Archive.org 网站下载工具:一份诚实的对比
作者:Restorix 编辑团队 · 2026年7月7日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
从 Wayback Machine 中提取网站有三种合理的方法,我在实际工作中都用过:HTTrack、wayback-machine-downloader Ruby gem 及其同类脚本,以及 Restorix, 当客户需要网站恢复运行而不仅仅是一堆文件时,我会推荐这个服务。
它们中没有一个是“最好的”。它们以不同的价格解决不同的问题,而且代价大多以时间而非金钱计算。以下是每种工具的实际功能、不足之处,以及适合谁使用。没有带推广色彩的排名,只有我亲眼所见的成败。
一个 archive.org 网站下载工具必须做对的事
仅凭下载速度来评判这些工具是没抓住重点。archive.org 网站下载工作中困难的部分并不光鲜,而正是这些地方悄悄拉开了工具的差距:
- 找到每一个文件。存档索引是唯一完整的来源, 从首页跟踪链接会遗漏所有孤立页面。
- 跨时间戳匹配资源。2014 年的页面可能需要从 2012 年唯一幸存的快照中获取 logo。
- 获取原始字节。如果处理不当,你保存的每个 HTML 文件都会嵌入 Wayback 工具栏标记。
- 重写内部链接,使副本在浏览时不依赖 archive.org 的服务器。
- 应对限流。archive.org 会对过于频繁的请求进行限速,重试时必须保持礼貌和耐心。
记住这五点。它们解释了下面对比表中的每一行,而这些工具收到的大多数差评都可以追溯到其中某一点。
HTTrack:免费、老派,依然可用
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
HTTrack 是老牌工具:一款免费、开源的离线浏览器,自 1990 年代起就开始镜像网站。将其指向 Wayback Machine 的 URL,它就会跟踪链接,把找到的所有内容保存到磁盘。它有 Windows 图形界面,价格免费,对于快速镜像一个小型网站确实有效。
但用于 archive.org 时,需要注意的地方就多了。HTTrack 对存档索引一无所知, 它只能找到从起始 URL 跟踪链接可到达的页面,因此孤立页面会被遗漏。它会抓取 Wayback 重定向到的任何快照,在不知不觉中混合了时间戳。而且它的过滤规则需要仔细调整:设置不当,你镜像的 2013 年博客就会顺着某个链接跑到现网,结果下载了当前网站。别问我是怎么知道的。
一个现实的基准测试:通过 Wayback Machine 镜像一个 40 页的 2012 年 WordPress 博客,我花了大约 40 分钟设置,两小时无人值守抓取,之后又花了一小时清理文件夹中混入的现网内容。这就是 HTTrack 工作的真实面貌, 便宜、基本自动化,但抓取结束时工作从未真正完成。
- 成本:免费。
- 精力投入:花一两个小时学习过滤语法;之后镜像可无人值守运行。
- 最适合:快速镜像小型、链接结构良好的网站,且不追求完美保真度。
- 注意:跑到现网、混合快照时间戳,以及 Wayback 重写的 URL 残留在文件中。

wayback-machine-downloader 与脚本路线
wayback-machine-downloader 是一个 Ruby gem,它查询存档的 CDX 索引,然后下载其中列出的你域名的所有文件,可选择日期范围。因为它读取索引而不是跟踪链接,所以能找到 HTTrack 永远看不到的页面。GitHub 上还有几个 Python 脚本,用不同的参数和不同的完善程度完成同样的工作。
取舍与常见的开源项目一样。你需要安装 Ruby 或 Python,并有信心阅读 README。这个领域中的项目可能连续多年没有更新,所以在把截止日期押在某个项目上之前,先检查一下 issue 跟踪器。当抓取完成后,组装工作就归你了:内部链接仍指向原始域名,快照时间戳需要检查合理性,而任何清理工作, 去除旧的统计代码、修复 canonical URL、转换为 HTTPS, 都将占用你的周六下午。
- 成本:免费,外加你的时间。
- 精力投入:如果你熟悉终端操作,大约半天;抓取过程本身会自动运行。
- 最适合:希望完全控制每个字节并乐在其中的开发者和档案工作者。
- 注意:没有重试逻辑的限速抓取、链接重写留作课后作业,以及仓库的维护空白期。
两个习惯能让脚本路线更可行。保留你最初获取的 CDX 响应, 当有人问文件夹里应该有什么时,它可以充当清单。在宣布完成之前,先在本地运行结果:花五分钟在 localhost 上点击浏览副本,比任何日志文件都能更快地发现缺失的资源。
Restorix:一站式 archive.org 网站下载方案
Restorix 位于付费、一站式服务的一端,专为 archive.org 恢复而构建,而非通用抓取。输入域名即可获得免费的即时估算:确切的存档文件数、总大小和锁定价格。选择日期范围和选项, 相对内部链接、去除统计和广告代码、HTTPS 转换、压缩 JS/CSS、www 或非 www 规范化, 服务会处理索引枚举、跨时间戳资源匹配、限流和链接重写。
结果可以下载为一个干净、可浏览的副本,或直接通过 SSH/SFTP、FTP/FTPS 或 S3 部署到你的主机,并包含一个轻量的单文件 CMS,用于后续编辑恢复的页面。按恢复的文件付费,第一个文件免费,恢复失败会自动退款到余额。没有订阅, 充值是一次性的,支持银行卡或加密货币。这不是爱好者路线,它也没打算成为。

Archive.org 网站下载工具,并排对比
| HTTrack | 脚本(gem / Python) | Restorix | |
|---|---|---|---|
| 价格 | 免费 | 免费 | 按文件付费,首个文件免费 |
| 发现未链接页面 | 否, 仅跟踪链接 | 是, 读取 CDX 索引 | 是, 读取 CDX 索引 |
| 跨时间戳资源匹配 | 否 | 部分 | 是 |
| 无工具栏标记的原始字节 | 否 | 是,需正确参数 | 是 |
| 内部链接重写 | 部分 | 需自行重写 | 是,可选相对链接 |
| 部署到你的主机 | 否 | 否 | 是, SSH、FTP、S3 |
| 你的典型投入 | 数小时过滤调整 | 半天加组装 | 约 15 分钟 |
| 最适合 | 快速小型镜像 | 希望掌控的开发者 | 让网站重新上线 |
把“你的典型投入”这一行读两遍。列表中的每个工具最终都能生成相同的文件文件夹, 你真正选择的是由谁来完成那繁琐的 20% 工作:是你自己,还是其他东西。
表格中还有一行放不下:风险。使用免费工具,搞砸一次工作会再搭上一个晚上。使用付费服务,留意失败条款, 自动退款到余额、开始前锁定价格、免费估算,意味着恢复失败的财务风险几乎为零。
你应该选哪个?
诚实的建议。如果你只需要镜像一个小型网站作为参考,并且喜欢免费工具,HTTrack 今晚就能把文件放到你的磁盘上。如果你会写代码,想要原始文件,并且有一个周末的时间,gem 路线确实不错且完全免费。如果网站是商业资产, 客户的 WooCommerce 商店、有十年帖子的论坛、你自己的毕生心血, 那就按文件付费,把晚上的时间花在别的事情上。教程 展示了完整的恢复流程,在你投入一分钱之前就能看到,而免费估算意味着你可以在做任何决定之前看到确切价格。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
有官方的 archive.org 网站下载功能吗?
没有。Wayback Machine 是为浏览单个快照而构建的,archive.org 不提供整站导出功能。所有批量方法, HTTrack、下载脚本、恢复服务, 都是第三方工具,读取相同的公开快照和公开索引。
对于 archive.org,HTTrack 和 wayback-machine-downloader 哪个更好?
适用不同任务。HTTrack 爬取链接,适合小型、简单的镜像。wayback-machine-downloader 读取存档索引,因此能发现未链接的页面并正确处理日期范围。对于超过几十页的网站,基于索引的方法更胜一筹。
用 Restorix 恢复一个网站要花多少钱?
你为每个恢复的文件支付一小笔固定费用,第一个文件免费,价格在估算时锁定, 因此你在支付任何费用之前就能看到你特定网站的确切总价。充值是一次性的,支持银行卡或加密货币,还有优惠码。没有任何循环费用。
这些工具能把网站放回我的主机上,还是只能下载文件?
HTTrack 和脚本止步于你磁盘上的文件;上传、修复链接和配置主机都得你自己来。Restorix 可以将恢复的副本直接部署到 SSH/SFTP 服务器、FTP/FTPS 共享主机或 S3,并包含一个简单的 CMS 用于后续编辑页面。
下载前我需要知道所有旧 URL 吗?
不需要。基于索引的工具会从 CDX API 枚举所有已捕获的 URL,因此你只需要域名。像 HTTrack 这样的链接爬虫只需要一个起始 URL,但它们会遗漏任何无法从其爬取范围链接到的内容。
相关指南

wayback machine downloader
Wayback Machine 下载工具:哪些真正好用
客观评测 Wayback Machine 下载工具:开源脚本、实际局限,以及帮你把网站重新上线的托管式方案。

web downloader
网页下载工具对比:它们保留了什么,又破坏了什么
网页下载器的工作原理,HTTrack、wget、SiteSucker 和浏览器保存功能实际保留了什么,各自会破坏什么,以及何时该选择网站恢复。

download a website from archive org
如何从 Archive.org 下载网站:三种有效方法
三种经过验证的方法可从 archive.org 下载网站:手动保存页面、编写 CDX API 脚本,或运行自动化还原。附带每种方法的实际耗时参考。
