如何从 Archive.org 下载:资源、快照及更多
作者:Restorix 编辑团队 · 2026年4月28日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
"下载 Archive.org"这个词涵盖了两种完全不同的任务,混淆它们正是人们白白浪费大量时间的原因。任务一:从一个资源中获取文件, 一本书、一个驱动程序、一段演出录音。任务二:从 Wayback Machine 中提取一个网站。前者有下载按钮,而后者基本没有。
我每周都会做这两件事,既用于客户网站恢复,也用于研究。下面是每种仍然有效的方法,并附上诚实的取舍分析:哪些是一键操作,哪些是命令行操作,哪些是披着下载按钮外衣的陷阱。
从 Archive.org 下载的两种方式
Archive.org 将内容存储为资源(item), 带有元数据的独立文件包,就像书架上贴有标签的文件夹。Wayback Machine 则存储网页快照(capture), 单个 URL 的带时间戳的副本,以重写后的链接渲染后提供。资源是为下载而生的,而快照是为在浏览器中查看而生的。
你能做的所有事情都源于这种区分。资源下载是官方支持的:有下载按钮、种子文件、CLI 工具、元数据 API。快照的所谓"下载"实际上是重建工作, 你通过 CDX API 查询有哪些内容,拉取每个 URL 的原始字节,然后修复链接。不同的工具,不同的失败模式,不同的时间成本。
不确定自己身处哪个世界?看 URL 就知道了。archive.org/details/something 是一个资源, 可以下载。web.archive.org/web/2012/http://example.com 是一个快照, 只能查看。同一个档案库,两套地址方案,两套规则。
用最简单的方式下载 Archive.org 资源
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
打开任意资源页面,查看右侧的下载框。你可以看到单个文件,通常还有一个种子链接,有时还有 ZIP 或全文快捷方式。如果只需要一个 PDF 或一个 ISO,点一下文件即可完成。这是 Archive.org 下载中唯一符合人们预期的工作方式。
- 点击 "SHOW ALL" 可以查看资源中的每个文件,包括下载框中隐藏的日志和衍生格式。
- 直接 URL 的格式是可预测的:archive.org/download/{identifier}/{filename}, 非常适合脚本和 wget。
- 对于多 GB 的资源,种子下载通常优于 HTTP,并且断线后可以干净地续传。
- 衍生文件是自动生成的版本, 例如经过 OCR 的文本、压缩后的 MP4。原始上传文件会特别标记;当还原度很重要时,请下载原始文件。
给脚本作者多一个技巧:在 archive.org 后面追加 /metadata/{identifier},即可获得一个 JSON 列表,其中包含每个文件、大小、校验和以及格式。这个 JSON 正是命令行工具底层所使用的数据。

使用 Internet Archive CLI 进行批量下载
当下载数量不止几个时,建议安装官方命令行工具, 提供 ia 命令的 Python 包 internetarchive。它负责处理认证、断点续传和重试,是脚本和手动点击之间真正的分水岭。
- 安装:pip install internetarchive,然后使用你的账号运行一次 ia configure。
- 单个资源:ia download {identifier} 会将整个资源镜像到本地文件夹。
- 挑选下载:ia download {identifier} --glob='*.pdf', 再也不会出现意外下载 40 GB 的情况。
- 整个搜索结果:ia search 'collection:archiveteam AND year:2013' --itemlist > list.txt,然后循环使用 ia download 处理该文件。
限流是存在的。CLI 工具自身会礼貌地重试;但你直接用 wget 循环访问 archive.org 时不会,一旦过于频繁就会被限速甚至封禁。做那个礼貌的请求者, 档案库是非营利组织,而不是 CDN。
如何下载 Archive.org 的网页快照
现在进入困难的一半。Wayback 的快照不是资源,因此没有下载框。你有四条现实可行的路径,按投入精力由低到高排列:
- 单页,即刻操作:打开快照并使用浏览器的保存功能。适合单页;保存的副本中的资源仍指向 web.archive.org。
- 获取单个文件的原始字节:在快照 URL 的时间戳后插入 id_, web.archive.org/web/20120501000000id_/http://example.com/style.css, 即可获得未经修改的原始内容。非常适合单个图片、CSS 和 PDF。
- 脚本化拉取:使用 CDX API 查询某路径下所有已抓取的 URL,然后使用 id_ 修饰符逐个请求。可以工作,但此时你需要维护一个爬虫、自己去重摘要、并自己重写链接。
- 下载工具和恢复服务:像 wayback-machine-downloader gem 这样的社区工具可以自动完成 CDX 查询加抓取的循环;而像 Restorix 这样的恢复服务在此基础上还提供清理和重新部署。
注意规律:一旦你需要的不只是一两个页面,你就要编写或运行专门的工具。这没什么可耻的, 只要诚实地评估时间成本即可。
关于 id_ 技巧有一点需要提醒,因为它被过度宣传了:它只能给你该响应的原始字节,但不会修复任何问题。使用 id_ 拉取的页面仍然包含 2012 年该网站使用的所有绝对 URL,仍然引用爬虫从未抓取的资源,并假设你仍然拥有该域名。原始字节只是起始材料,并非最终成品。

资源与网页快照:各自的适用场景
| 你的需求 | 类型 | 方法 |
|---|---|---|
| 一本书、一首歌、驱动程序、ISO 镜像 | Item | 下载按钮、种子或 ia download |
| 某个页面的旧版本 | Snapshot | 浏览器保存或 id_ URL |
| 单个丢失的图片或 CSS 文件 | Snapshot | 将 id_ URL 直接用于 wget |
| 一个完全失效的网站 | Snapshot set | CDX API 加工具脚本,或使用恢复服务 |
| 一个已经消失的服务(GeoCities 时代) | Item plus snapshot | Archive Team WARC 文件,与 CDX 交叉核对 |
最后一行常常让人感到意外:当 Archive Team 抢救一个濒临倒闭的网站时,最终成果会以巨大的 WARC 文件形式作为资源入库。同一个网站既可以作为资源下载,也可以作为一组快照存在。请优先检查资源端, 预先打包的爬取数据胜过上千次单独抓取,我们的 格式指南 介绍了如何处理这些 WARC 文件。
浪费时间下载的常见错误
- 对 web.archive.org 进行递归 wget。每个链接都被重写以保持在其域名下,因此你的爬虫会愉快地下载 Wayback Machine 自身的界面,直到天荒地老。
- 为获取一个文件而下载整个资源。点击 "SHOW ALL" 只需十秒;下载 40 GB 的 ZIP 则要耗掉你一整晚。
- 把一次快照当作整个网站。快照是按 URL 抓取且具有偶然性的, 来自 CDN 子域名的图片常常完全缺失。
- 忽略 CDX 输出中的状态码。重定向和 404 也被一并归档;如果不筛选 statuscode:200 并对摘要去重,你将把重定向存根当作页面进行恢复。
- 跳过校验和。资源附带 md5 和 sha1 校验文件, 在基于大文件继续工作前,请先校验。
- 假设单一快照日期就足够。2011 年的首页搭配 2009 年的图片是正常现象;网站的抓取是分散进行的,因此需要混合不同时期的快照才能获得完整画面。
文件已下载。接下来怎么做?
资源下载可以直接放入你的媒体库或工具链, 这部分已经解决。真正的工作从快照拉取开始:链接被重写、资源缺失、表单失效、HTTP 和 HTTPS 混杂。把一堆 2011 年的快照变成一个真正可以加载的网站,是一项重建工作,而非下载工作。
正是在这一点上,我不再手写脚本,而是开始向人们推荐 Restorix。免费预估会为你读取档案库, 精确的文件数量、总大小、固定价格, 在你不花一分钱之前就一目了然。首个文件免费恢复,之后按文件计费,一次性充值即可,无订阅。如果恢复或部署失败,退款会自动到账,无需提交工单。
恢复选项涵盖了否则你需要用脚本处理的繁琐部分:剥离统计代码和广告、将链接改为相对路径、强制 HTTPS、统一 www 规范、保留重定向。一键部署可将结果推送到 SSH/SFTP、FTP 或 S3,自带的单文件 CMS 位于 /webarchive-cms.php,可让你直接在原位修复内容, 教程 演示了完整的操作流程。下载结束了搜索,却没有结束工作。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
我能从 Archive.org 下载整个网站吗?
无法通过一个按钮完成。网站在 Wayback 端以按 URL 划分的快照形式存在,因此下载一个网站意味着通过 CDX API 枚举所有 URL 并逐一获取,然后修复链接。对于超过几个页面的情况,请使用下载工具或恢复服务, 我们在 [从 Archive.org 下载整个网站](/zh/download-entire-website-from-archive-org) 中比较了各种方案。
从 Archive.org 下载合法吗?
公共领域和采用 Creative Commons 协议的资源明确允许下载。受版权保护的资源仍由权利人决定, 用于个人研究的下载通常是被容忍的,但再发布则不行。利用快照重建你自己的旧网站是典型的合法使用场景。
ia download 和种子下载有什么区别?
字节相同,传输方式不同。种子下载在超大资源和网络不稳定的情况下表现出色;CLI 工具则擅长脚本化、--glob 过滤以及跨多个标识符的批处理任务。对于单个 200 MB 的资源,普通的下载按钮胜过两者。
为什么我的快照下载文件中到处都包含 web.archive.org 的 URL?
Wayback Machine 会重写链接,以便页面在其播放器内渲染。使用 id_ 修饰符获取原始字节,或者运行能将链接改回的恢复流程, Restorix 的相对链接选项正是为这种清理工作而设的。
如何下载整个集合而不是单个资源?
使用 ia search 'collection:name' --itemlist 构建资源列表,然后对每个标识符运行 ia download,并使用 --glob 过滤器仅保留你需要的文件类型。这可能需要一些时间, 大型集合的规模可达数 TB,因此开始前请先查看该集合的容量统计。
相关指南

archive org download
Archive.org 下载格式:WARC、CDX 与单文件
各 Archive.org 下载格式实际包含的内容, WARC 抓取数据、JSON CDX 索引与单文件, 以及各自的使用方法。

download a website from archive org
如何从 Archive.org 下载网站:三种有效方法
三种经过验证的方法可从 archive.org 下载网站:手动保存页面、编写 CDX API 脚本,或运行自动化还原。附带每种方法的实际耗时参考。

download entire website from archive org
从 Archive.org 下载整个网站,而不仅仅是首页
要从 archive.org 下载整个网站,你需要每一页、每张图片和每个样式表。资源文件分散在不同的时间戳下, 原因在此,并附上完整检查清单。

wayback machine downloader
Wayback Machine 下载工具:哪些真正好用
客观评测 Wayback Machine 下载工具:开源脚本、实际局限,以及帮你把网站重新上线的托管式方案。
