如何从 Archive.org 下载网站:三种有效方法
作者:Restorix 编辑团队 · 2026年6月8日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
网站没了。主机到期,客户也没有备份,留下的唯一副本躺在 Wayback Machine 上。这样的电话我接过太多次了,每次第一个问题都一样:能从 archive.org 下载网站并把它找回来吗?
可以。有三条现实的路径:手动保存页面、调用 CDX 接口编写脚本,或者让自动化还原服务替你完成抓取。三者的投入天差地别,选错了就要搭进去一整个周末。下面是每种方法真实的工作方式,以及来自一线从业者的诚实耗时估算。
从 Wayback Machine 下载网站的真正含义
Wayback Machine 不是一个可以用一键全部下载的网站文件夹。它是一个由单次抓取组成的庞大索引:每个页面、图片、样式表和脚本都分别存储,各自绑定到被抓取的那一刻。当你查看一个旧页面时,浏览器从一个抓取中拉取 HTML,再从另外几个抓取中拼接图片,即时拼装出来。
因此,下载一个网站意味着枚举成百上千个独立文件,逐个抓取,然后重写内部链接,让副本在 archive.org 之外也能正常工作。请记住这个模型, 它能解释下文每种方法的工作原理,也能解释为什么没有一个方法是“一键下载”。
方法一:逐页手动从 archive.org 下载网站
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
最朴素的方法,有时也是最合适的方法。你在 Wayback Machine 中打开目标快照,用浏览器逐页保存。对于一个只有五页的宣传站,这样做完全没问题。规模再大一些,就是在慢慢折磨自己。
- 在你需要的快照日期打开已归档的页面。
- 使用“另存为”,选择“网页,全部”,这样资源文件可以一并保存。
- 对每个页面重复以上操作,包括那些只能从旧菜单才能进入的页面。
- 打开保存的 HTML,从每个文件中剥离 Wayback 工具栏的标记。
- 修复或直接接受那些仍然指向 web.archive.org 的资源链接。
这里有两个坑。保存下来的 HTML 仍然引用 web.archive.org 上的很多资源,所以一旦离线打开,或者归档站点某天响应变慢,你的副本就会立刻失效。而每个保存页面里都嵌入的工具栏标记,你只能逐个文件手动清除。我现在仍然用这种方法处理单页, 曾经有客户只需要他们旧的定价页面用于法律纠纷,一次保存花了不到两分钟。但他们那个 300 页的店铺就得另想办法了。
- 实际投入:包含资源清理的话,每个页面 5 到 10 分钟。
- 适用场景:最多 10 个页面,或仅抓取某个特定页面作为参考。
- 何时不再适用:页面达到几十个,或你需要干净原始标记的场合。

方法二:借助 CDX API 从 archive.org 下载网站
CDX API 是 Wayback Machine 的索引接口,也是查找某个域名归档文件列表的入口。一条请求就能以 JSON 格式返回完整账本:
web.archive.org/cdx/search/cdx?url=example.com/*&output=json&fl=timestamp,original,mimetype,statuscode&filter=statuscode:200&collapse=digest
这会返回所有抓取的时间戳、原始 URL 和 MIME 类型。collapse 参数可以对重复文件去重,这样同一个 logo 不会被下载 400 遍。之后用一个简单脚本遍历列表,逐个抓取文件。在时间戳 URL 上追加 id_, 例如 /web/20150312145531id_/http://example.com/style.css, archive.org 就会返回未经重写的原始字节。这个后缀,是获得干净副本与满是工具栏的页面之间的差别。
真正耗费你晚上的,是那些不性感的部分。archive.org 会限制过于激进的客户端,所以脚本需要礼貌的延迟和重试逻辑,否则你会盯着成片的 429 响应耗上好几个小时。带查询字符串的 URL 需要去重,否则会话 ID 会把一个 200 页的站点变成 9000 个文件的抓取。文件下载完成后,内部链接仍指向原域名,所以还需要一轮重写,才能让副本正常离线浏览。
- 实际投入:如果你经常写代码,编写和调试脚本需要 2 到 4 小时;如果不常写脚本,可能要花掉一个周末。抓取本身对几百个文件来说需要 30 到 90 分钟。
- 适用人群:开发者、档案工作者,以及希望对每个字节都拥有完全控制权的人。
- 何时不再适用:从未打开过终端的人,以及以小时计的紧迫截止日期。

无论你用什么脚本,请像真实访客那样测试结果:用任意一个本地 Web 服务器把文件夹跑起来,点击浏览一遍。图片路径断裂、链接跳到线上、字体缺失,五分钟之内你就会发现, 而在宣布大功告成之后才发现这些问题,会让人非常痛苦。
方法三:用自动化方式从 archive.org 下载网站
第三条路线让还原服务替你完成抓取、资源匹配和链接重写。当网站的重要性高于学习过程时,我会建议客户走这条路。使用 Restorix,你只需粘贴域名,就能立即获得一份免费估算:精确的归档文件数量、总大小,以及在你付款之前就锁定好的价格。选择日期范围,勾选你想要的选项,还原后的副本即可随时浏览, 也可以通过 SSH、FTP 或 S3 直接部署到你的主机。
- 值得留意的选项:相对内部链接、清除旧统计代码与广告、压缩 JS/CSS、强制 HTTPS、规范化 www 或非 www。
- 还原可以导出结构化清单(JSON 或 SQLite),让你清楚知道最终到底拿到了什么。
- 失败的还原会自动退款到账户余额,无需提交工单。
显而易见的问题是:需要花钱。按还原文件数计费,第一个文件免费,价格在估算时就锁定。个人博客的话,你可能更愿意自己写脚本。但对于客户那家当晚必须恢复上线的 WooCommerce 营收店铺,这笔费用通常只是整个事故中最便宜的一项。部署包还附带一个小型单文件 CMS,日后的小幅文字修改无需重新上传。
时间与投入,一目了然
| 方法 | 你的时间 | 技术门槛 | 最适合的规模 |
|---|---|---|---|
| 手动保存页面 | 每页 5 至 10 分钟 | 无 | 1 至 10 页 |
| CDX API 脚本 | 总计 3 至 6 小时 | 熟练写代码 | 10 至 1000 页 |
| 自动化还原 | 约 15 分钟点击操作 | 无 | 任意规模,尤其是 100 页以上 |
注意,这个表衡量的是你的时间,而不是机器时间。脚本或服务可能耗费数小时啃完大型抓取,但那是趁你睡觉时在啃。任何还原任务中最稀缺的资源,都是当事人熬的那个晚上, 所以我按这个来定价。
一下午就能毁掉你的常见错误
- 把浏览器保存当成完整站点的方案。你会漏掉每一个没有手动打开过的页面,而老站里那些页面的藏身之处,往往连你自己都忘了。
- 忽略 id_ 修饰符,然后又纳闷为什么每个 HTML 文件里都嵌着 Wayback 工具栏的标记。
- 对 archive.org 发起高频并发请求。结果就是被限流,一小时的活拖成四小时。
- 跳过链接重写这一步。副本看起来一切正常,直到你点开任何链接。
- 假设每个页面都已被归档。先查一下 CDX 清单,让缺口变成已知数,而不是最后时刻的“惊喜”。
你该选哪一种方法?
不到十个页面:手动保存,接受标记上的瑕疵。你会写代码且想拥有控制权:那就搭建 CDX 脚本,并预留一个晚上。你希望又快又干净地拿回网站,不想当业余档案员:走自动化路线, 教程 用几分钟带你走完一次完整还原,免费估算会在你付款之前就告诉你文件数量和价格。
最后一件事:无论你选哪条路,现在就开始。Archive.org 是一份馈赠,但它过去也曾发生过宕机并承受过法律压力;“回头再说”正是网站被弄丢两次的典型开头。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
从 archive.org 下载网站是免费的吗?
归档站点本身浏览免费,手动保存或编写 CDX 脚本除了时间之外不产生费用。自动化还原服务按还原文件数收费;Restorix 在免费估算中就给出锁定价格,第一个文件免费。
从 archive.org 下载网站合法吗?
下载自己的网站,或经客户授权下载其网站,是常规做法,也是大多数还原的实际情况。对于他人内容,副本用于个人参考或研究通常没问题,但重新发布你不拥有的受版权保护资料可能带来麻烦。有疑问时,去问律师,而不是去看评论区。
为什么我保存的页面仍然从 web.archive.org 加载图片?
因为 Wayback Machine 会把 HTML 中的资源链接改写为指向它自己的服务器,而浏览器保存保留了这些绝对 URL。使用 id_ 修饰符来抓取文件,或在之后跑一轮链接重写,就能获得一份自包含的副本。
可以不写代码就从 archive.org 下载网站吗?
可以。手动用浏览器保存完全不涉及代码,自动化还原服务也会替你处理脚本。真正需要编程的,只有 CDX API 这条路线。
从 archive.org 下载一个网站需要多久?
手动保存每个页面大约 5 到 10 分钟。CDX 脚本搭建需要几个小时,之后对中等规模的站点抓取需 30 到 90 分钟。自动化还原只需你花几分钟点点操作,剩下的是机器在等。
相关指南

download entire website from archive org
从 Archive.org 下载整个网站,而不仅仅是首页
要从 archive.org 下载整个网站,你需要每一页、每张图片和每个样式表。资源文件分散在不同的时间戳下, 原因在此,并附上完整检查清单。

archive.org download website
Archive.org 网站下载工具:一份诚实的对比
一份诚实的 archive.org 网站下载对比:HTTrack、wayback-machine-downloader 脚本和 Restorix。真实成本、所需精力与资源处理方式。

wayback machine downloader
Wayback Machine 下载工具:哪些真正好用
客观评测 Wayback Machine 下载工具:开源脚本、实际局限,以及帮你把网站重新上线的托管式方案。

restore website from archive.org
从 Archive.org 恢复网站:自己动手还是全托管服务?
从 Archive.org 恢复网站,应该自己动手还是付费使用全托管服务?本文从成本、时间、技能和风险四个维度进行客观对比,并提供一套决策框架。
