Archive.org 网站:高级搜索、筛选器与合集
作者:Restorix 编辑团队 · 2026年4月26日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
大多数人对 Archive.org 网站的使用往往只有一次:把一个失效的网址粘进 Wayback Machine,截一张图,然后离开。这其实浪费了一个功能强大的工具。在同一个登录入口背后,藏着一座完整的数字图书馆, 数千万条资源, 拥有独立的搜索引擎、查询语法和几乎无人问津的筛选器。
多年来,我一直在 Archive.org 中挖掘客户网站、已停更的软件和扫描版手册。两分钟找到和二十分钟放弃之间的差别很少靠运气。关键在于知道该用哪个搜索框、点哪个筛选器。这才是我真正在用的工作流。
Archive.org 网站实际索引了什么
混淆就从这里开始。Archive.org 运行着两套共享同一 Logo 的不同系统。条目(item)档案, 从首页搜索到的内容, 保存着上传和抓取的对象:书籍、音乐会、软件、视频、广播节目。每个条目都有元数据、文件列表和评论。而 Wayback Machine(位于 web.archive.org)保存着按 URL 索引的网页快照,总数超过 9000 亿。
这对老网站来说为什么重要?因为一个已经下线的站点会以不同形式出现在两套系统里。Wayback 那侧有页面;条目那侧则可能保存着 Archive Team 对整个服务的抢救式抓取, 你的站点曾经寄宿过的 GeoCities、FortuneCity、MobileMe, 被打包成可下载的 WARC 文件。如果你只用其中一扇门,就会错过另一扇。
- 文本:扫描版书籍、手册、杂志, 支持全文搜索
- 软件:从共享软件光盘到老旧浏览器和 Flash 播放器,应有尽有
- 音频与视频:现场音乐会、广播档案、新闻短片、广告
- 网页条目:抓集合集与 Archive Team 抓取,保存为 WARC 文件
- 图像与数据:照片集、地图扫描、研究数据集
Archive.org 网站上的高级搜索
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
首页的搜索框用来搜 Beatles 的盗版唱片还行。要做精准检索,请进入高级搜索页面, archive.org/advancedsearch.php, 或者自己写查询语句。其语法类似 Lucene 而且非常严格:字段名必须小写,区间用方括号,布尔运算符必须大写。任意一处写错,你都会悄无声息地得到一堆垃圾结果。
一条查找 2005 到 2010 年间 Joomla 相关软件的查询语句长这样:title:(joomla) AND mediatype:software AND date:[2005-01-01 TO 2010-12-31]。把它粘进搜索框就能直接生效,无需表单。
- identifier:, 条目的精确 URL 标识;这是最快的查询方式
- collection:, 限定到某个合集,例如 collection:archiveteam
- creator: 与 title:, 模糊但有效,记得给短语加引号
- date:[YYYY-MM-DD TO YYYY-MM-DD], 收录日期区间,而非原始发布日期
- mediatype:, texts、software、audio、movies、image、web、data
- NOT、AND、OR 与括号, 可自由组合,但务必大写
一个常见的坑:date: 过滤的是条目进入档案库的日期,而不是内容产出的时间。一份 2003 年的手册在 2019 年上传,会匹配 2019。

真正起作用的筛选器
结果加载之后,时间都省在左侧边栏上。你可以按媒体类型、年份、合集、创建者和语言进行筛选,也可以按相关度、查看次数(总计或周榜)、收录日期或标题排序。大多数搜索失败并不是因为资料不存在,而是因为它们被两百条播客节目埋在了第九页。筛选器能解决这问题。
- 先按 mediatype 筛选。跨全库搜一个停更的 CMS 会被音频内容淹没。
- 想找有人维护的资料时,按周查看次数排序, 大众的判断是相当靠谱的质量信号。
- 把合集和年份筛选叠加使用,可以还原出某块网络在比如 2008 年的样子。
| 筛选器 | 最佳用途 |
|---|---|
| 媒体类型 | 一键砍掉 90% 的干扰 |
| 年份 | 围绕站点生命周期重建时间线 |
| 合集 | 停留在可信的抓取或抢救项目内 |
| 创建者 / 上传者 | 追踪某位档案员的完整收藏 |
| 周查看次数 | 发现仍被频繁使用的条目 |
对老网站而言值得认识的合集
合集相当于策展过的书架,其中有几个对寻找老网站的人来说堪称金矿:
- archiveteam, 对濒死服务进行的仓促但满怀热爱的抢救抓取:GeoCities、FortuneCity、Posterous、MobileMe。常包含对整个托管平台的完整 WARC 抓取。
- geocities 及其镜像, Yahoo! GeoCities 救援项目,是史上规模最大的个人网页一次性恢复行动。
- widecrawl 与其他抓集合集, Internet Archive 的大批量抓取,在 Wayback 的逐 URL 视图出现缺漏时尤其有用。
- 软件库合集, 老旧浏览器、Flash、Shockwave、Java 小程序。要真正运行老站点当时提供的内容,这些必不可少。
- cd-rom 软件库, 装满时代特征明显的建站工具、计数器和留言板脚本的共享软件光盘。
从合集页面开始,而不是搜索框。维护者通常会说明收录内容、抓取方式和文件布局, 这些背景信息能让你在凌晨两点少走弯路。

Archive.org 网站 vs. Wayback Machine:该走哪扇门
| Archive.org 条目搜索 | Wayback Machine | |
|---|---|---|
| 搜索对象 | 按元数据搜索条目 | 按地址搜索 URL |
| 获得结果 | 可下载文件 | 渲染后的快照 |
| 最适用 | 软件、媒体、大批量抓取 | 某个站点的具体页面 |
| 不足 | 无法渲染页面 | 无官方整站下载 |
经验法则:如果你能报出 URL,从 Wayback Machine 开始;如果你只能描述一个东西, 比如 2007 年大家都在用的那款 phpBB 主题, 那条目搜索更胜一筹。要做完整还原,你通常会两边都用:条目侧提供抓取和 CDX 数据,Wayback 侧提供页面快照。
实战工作流:寻找客户的失效论坛
一个真实案例。客户一个 2009 年的 phpBB 论坛在 2014 年托管商倒闭时随之消失,域名停放多年,他们希望把内容找回来。下面是实际奏效的步骤:
- 对该域名运行 Wayback CDX 查询,绘制哪些 URL 被抓取以及何时被抓取, 共约 1400 次抓取,多集中在 2010 到 2012 年。
- 在 collection:archiveteam 内用域名和站点名做条目搜索, 这次没有命中,但只花三十秒,值得一试。
- 检查老托管商的合集, 该托管商本身被 Archive Team 部分抓取,填补了不少模板和图片缺口。
- 对论坛所用软件做按年份筛选的搜索,取回一份年代相符的 phpBB 安装包作为参考。
总耗时约四十分钟,其中大部分在读 CDX 输出。真正懂得门道之后,搜索本身并不难。注意没有发生的事情:没有去猜 Google 缓存,没有去哀求老托管商的客服邮箱,也没花一分钱。档案库直接告诉我们哪些东西活了下来, 1400 次抓取、2013 年的一段已知空白、以及一段用来打补丁的部分抢救抓取。这份 CDX 数据也正是 Restorix 估算时用来统计文件数量和定价的依据,这个故事下文继续。
Archive.org 网站不够用的时候
上面这些方法能找到资料,却不会给你一个能跑的网站。Wayback 的快照带着被改写的 URL、缺失的图片、死掉的表单,以及指向你已无法控制域名的绝对链接。靠手工从原始抓取中重建一个站点,意味着数天沉浸在 sed 脚本与后悔之中。
这个空缺正是 Restorix 的设计初衷。粘入 URL,免费估算即可在付款前显示准确的归档文件数、总大小和锁定的价格。还原过程可以剥离统计代码和广告、把链接转为相对路径、强制 HTTPS,并直接部署到你的 VPS、FTP 主机或 S3, 还内置单文件 CMS,方便你编辑恢复出来的内容。
用 Archive.org 网站做侦察:核实内容存在与否、什么时间存在、留存了多少。然后把重建工作交给工具。你的时间比一个周末的 WARC 解析更值钱。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
Archive.org 网站是免费的吗?
是的。搜索、在线播放和下载公开条目完全免费,浏览也无需账号。免费账号可以添加收藏、上传内容并建立列表。某些现代书籍的借阅需要账号,但本指南涉及的所有内容都是开放的。
Archive.org 网站和 Wayback Machine 有什么区别?
Archive.org 是母级数字图书馆:包含书籍、软件、音频、抓集合集等条目,可按元数据搜索。Wayback Machine 是其中的一个服务,保存着 9000 多亿张按 URL 索引的网页快照。老网站可能同时出现在两边, 既作为 Wayback 快照,也作为批量抓取条目。
我能在 Archive.org 上对老网页做全文搜索吗?
不能。Wayback Machine 按 URL 索引而非按页面文本, 你需要的是地址,而不是关键词。全文搜索只能作用于扫描版书籍等文本条目。搜页面时,先想办法找到 URL(老链接、搜索引擎、CDX 通配符),再去查。
如何在 Archive.org 网站上下载找到的内容?
每个条目页面都有一个下载框,列出单个文件,以及种子和整条下载选项。Wayback Machine 抓取的网站没有下载按钮, 那需要 CDX API、下载器工具或像 Restorix 这样的还原服务。我们这份关于 [从 Archive.org 下载](/zh/download-archive-org) 的指南详细介绍了所有方法。
为什么我完全找不到某个老站点?
通常有三种原因:站点的 robots.txt 屏蔽了爬虫;站点从未出现在爬虫能跟随的任何链接中;或所有内容都藏在登录墙后以及重度依赖 Flash 和 JavaScript。在放弃之前,用 CDX API 查一下裸域名, 抓取记录有时会藏在你忘记的奇怪子域名或 www 变体下。
相关指南

wayback machine archive org
Wayback Machine on Archive.org:实用网站指南
Wayback Machine on Archive.org 实用指南:它的位置在哪,搜索框和日历视图究竟如何运作,以及如何带走真实的文件。

archiveorg
Archiveorg:探秘互联网最大的免费图书馆
Archiveorg 不仅仅是 Wayback Machine:它还有免费图书、现场音乐、电视新闻、可玩的软件以及超过 9000 亿个网页。完整的导览,外加文件恢复。

download archive org
如何从 Archive.org 下载:资源、快照及更多
下载 Archive.org 内容的每种实用方法, 资源文件、批量 CLI 拉取以及 Wayback 网页快照, 以及如何为你的任务选择合适的方式。

archive org download
Archive.org 下载格式:WARC、CDX 与单文件
各 Archive.org 下载格式实际包含的内容, WARC 抓取数据、JSON CDX 索引与单文件, 以及各自的使用方法。
