Wayback Machine 下载工具:哪些真正好用
作者:Restorix 编辑团队 · 2026年5月9日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
搜索 Wayback Machine 下载器,你会看到大家用了十年的那几款工具,外加一堆早已无人维护的 GitHub 仓库。其中有些确实能用,但它们都有一个共同的天花板。这篇评测是我希望在第一次做恢复项目前就有人能递给我的:开源脚本到底能做什么、在哪里会卡住,以及当网站必须重新上线时该用什么替代方案。
Wayback Machine 下载器到底在做什么
每个 Wayback Machine 下载器本质上都是同一套机制。它向 CDX API 请求捕获记录列表,遍历该列表,然后从带时间戳的 URL 逐一保存文件。好一点的工具会加上日期和文件类型过滤器,以及应对 archive.org 限流的重试逻辑。它们并没有访问你网站的某个秘密备份,抓取的就是你现在用浏览器就能打开的同一个公开存档。
这个区别比任何功能列表都重要。下载器继承了存档中的所有缺口:从未被爬取的页面、从未被捕获的图片、因为某人在 2015 年错误配置 robots.txt 而被屏蔽的目录。工具只能获取存在的内容。
文件数量增长也很快。一个普通的 200 页网站,算上图片、样式表和脚本,轻松就能变成 2,000 个文件。以每秒一个礼貌请求的速度计算,光是纯下载就要半个多小时, 这还没算重试、限流,以及那些因为存档多年前丢失而返回 404 的文件。
开源选项
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
每个论坛帖子里都会提到三个名字,原因也很充分:
- wayback-machine-downloader,一个 Ruby gem。其中最知名的一款。一条命令 wayback_machine_downloader http://example.com --from 2015 --to 2019,就能把所有匹配的捕获内容填满./websites 目录。支持并发参数和按文件扩展名过滤。
- waybackpack,一个 Python 工具。按时间戳组织下载的捕获内容,适合抓取某个页面的特定快照,不太适合整站镜像。
- HTTrack 指向快照 URL。严格来说根本不是存档工具。它跟随 Wayback 注入页面的重写链接,把整个捕获树拖下来。方法粗糙,对小站点偶尔有效,遇到查询字符串就完全懵了。
这三款都免费,都以业余节奏维护,而且都只给你一堆文件。之后的事情就是你的问题了, 这句话涵盖了接下来约百分之八十的内容。在安装任何一个之前,先去仓库看看未解决的 issue。在那花十分钟比看任何对比文章都管用。

免费 Wayback Machine 下载脚本能给你什么
运行任何东西之前先设好预期。使用免费 Wayback Machine 下载器的典型首次体验是这样的:三十分钟折腾 Ruby 或 Python 环境,十分钟看似顺利的进度,然后 archive.org 开始返回 429 错误,一切慢如蜗牛。一个 5,000 文件的站点以礼貌请求速率下载是个通宵任务,而通宵任务会在凌晨三点悄无声息地失败。
一次真实的首次运行
- 安装运行时环境和工具。调试 README 里没人提到的版本冲突。
- 对网站的一个目录做小规模测试,确认输出格式。
- 启动完整运行,看着前一百个文件到达。
- 撞上速率限制,降低并发,重启,祈祷断点续传逻辑能正常工作。
- 打开输出文件夹,发现你下载的除了有用的东西还有一堆垃圾。
输出总是需要筛选。除非你过滤得当,否则你会得到每个 URL 的每次捕获:跟踪参数垃圾、打印视图、返回 200 状态码的错误页面。而且除非工具获取了 id_ 变体, 即原始未修改的字节, 否则每个 HTML 文件都带着 Wayback 重写的链接和工具栏。
还有一个意外是文件组织方式。大多数脚本把所有东西倒进镜像存档结构的时间戳路径里,而不是你原来的目录结构。重建真实的文件夹树,把文件名改回服务器原来的叫法,是没人会预算在内的手工活。
你会碰到的局限
- 没有恢复逻辑。下载器只负责抓文件。它不会去掉 Wayback 工具栏、修复内部链接、选择规范主机名,也不会把任何东西转换成 HTTPS。
- 没有去重智能。同一张图片在六个时间戳下保存就变成六个文件,除非你自己按内容摘要合并。
- 速率限制。请求太猛,archive.org 就会限流或直接暂时封禁你。重跑是工作流的正常环节,不是你做错了什么的标志。
- 依赖老化。绑定旧版 Ruby 或 Python 的脚本在现代系统上会出问题。安装任何东西之前先看仓库的最后一次提交日期。
- 没有支持。工具出问题时,issue 跟踪器就是客服台,而最后一条回复可能是两年前的。
- 没有终点线。脚本退出时你拥有一个文件夹。把那个文件夹变成一个可托管、能正常运行的网站是另一个同等规模的工程。

托管式替代方案
不用守着脚本跑的替代方案是使用一种把下载视为恢复第一步而非全部工作的服务。这项服务 从免费估价开始:精确的存档文件数、总大小,以及付款前的锁定价格。然后它下载所有内容、清理数据,并可以通过 SSH、FTP 或 S3 直接部署到你的主机上。
细节专为这项工作设计。按恢复的文件数付费,第一个免费。如果恢复或部署失败,退款自动退回余额,无需提交工单。恢复选项可去除分析和广告、将链接重写为相对路径、强制 HTTPS。部署包含一个小型单文件 CMS,自带生成的管理员密码,让恢复后的站点保持可编辑状态。没有任何订阅:你充值余额然后消费。
什么时候 Wayback Machine 下载器是错误的工具
下载器脚本适合离线存档、研究数据集、抢救一批旧 PDF 文件。但在以下情况它是错误的工具:
- 网站必须重新上线且外观正确
- 做这项工作的人永远不会打开终端
- 存档中有数万个 URL,其中一半是查询字符串垃圾
- 有截止日期:重新上线、法律请求、客户在后面催
在这些情况下脚本并不比服务便宜,只是把账单藏进了你的时间里。Restorix 的估价至少让你提前知道真实价格,而不是搭上一个周末才发现真相。这并不是说脚本不好,它们是有明确职责范围的工具,而职责范围到文件夹就结束了。
如何选择
| 你的情况 | 合适的工具 | 原因 |
|---|---|---|
| 需要一份快照做参考 | 浏览器加 id_ URL 技巧 | 两分钟搞定,无需安装 |
| 小型站点,熟悉命令行 | wayback-machine-downloader gem | 免费、成熟、过滤功能好 |
| 大规模获取特定文件 | CDX API 加自己写脚本 | 完全掌控过滤逻辑 |
| 网站必须重新上线 | Restorix | 下载、清理、部署一步到位 |
按目标选择,而不是按下载选择。如果目标是一堆文件,免费工具物有所值,而且永远如此。如果目标是网站本身,跳过文件夹阶段,直接用能重建网站的工具。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
有官方的 Wayback Machine 下载器吗?
没有。Internet Archive 运营 Wayback Machine 并提供 CDX API,但没有发布官方批量下载器。这个领域的每个工具都是第三方开发的,基于你自己也能查询的同一套公开接口。
wayback-machine-downloader Ruby gem 安全吗?
它是一个长期维护的开源项目,在通常意义上是安全的:阅读代码、从官方仓库安装、对名称相似的仿冒包保持警惕。更大的实际风险是使用了一个过时的分支,在大站点下载到一半时静默失败。
为什么我的下载到一半卡住了?
几乎总是因为限流。archive.org 对激进的客户端返回 429 错误。降低并发、在请求之间加延迟,然后续传。大多数工具可以从停止的地方继续,所以卡住只损失时间而不损失进度。
下载器能抓取受密码保护或已删除的页面吗?
密码保护的不行:爬虫从未越过登录,所以没有东西可下载。已删除的可以:从实时网络上删除正是存档要防范的,只要在删除之前发生过爬取就行。
付费下载器比免费脚本更好吗?
有时候它们就是免费脚本加了个界面。看输出而不是看价格:你拿到的是原始 id_ 文件、合理的去重、干净的链接,还是一堆重写过的 HTML?恢复服务直接跳过这个问题,交给你的是一个完成的网站而不是一堆文件。
如何把下载的文件变回可运行的网站?
去掉 Wayback 重写、把内部链接改成相对路径、选择规范主机名,然后部署并测试。或者让恢复服务替你做这四件事, 这正是这类服务存在的全部理由。
相关指南

wayback download
Wayback 下载:按所需精力排出每一种方法
所有 wayback 下载方法按精力成本排序:单页保存、wget 脚本、CDX API,以及全自动帮你重建整个站点的服务。

wayback machine download site
从 Wayback Machine 下载整站
如何从 Wayback Machine 下载整站:爬虫陷阱、查询字符串页面、缺失资源,以及何时自动化恢复比手动脚本更靠谱。

restore website from wayback machine
从 Wayback Machine 恢复网站:完整指南
端到端地从 Wayback Machine 恢复网站:选择正确的快照,设置恢复选项,然后在一小时内部署一个带有 CMS 的可运行网站。
