从 Archive.org 下载整个网站,而不仅仅是首页
作者:Restorix 编辑团队 · 2026年7月15日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
任何人都能保存首页。首页很简单, 真正区分“我抓了一份副本”和“我真正拥有了这个网站”的,是背后那 4,000 个文件。当有人让我从 archive.org 下载整个网站时,首页通常已经躺在他的桌面上,而样式表却不在。
本文要讲的就是“整个”这个词。一份完整的副本到底包含什么,为什么存档会把你的资源分散在跨越数年的不同时间戳中,以及一份你可以在最后执行的检查清单,用来证明你确实拿到了所有内容,而不是凭感觉。
从 archive.org 下载整个网站时,“整个”意味着什么
一份完整的副本包含四个层次,而大多数人只完成了第一层。第一层:所有存在过的页面的 HTML。第二层:每个页面引用的资源:图片、样式表、JavaScript、字体、PDF、视频。第三层:内部链接已重写为相对路径,这样副本可以独立浏览,无需依赖 archive.org 的服务器。第四层:一份已抓取内容的清单,这样缺失的部分会被记录下来,而不是日后被客户发现。
- 页面:爬虫曾经看到过的每一个 URL,而不仅仅是主菜单里的那些。旧网站常常把整个栏目藏在被遗忘的页脚链接后面。
- 资源:图片、CSS、JS、字体和可下载文件, 在大多数网站上,这些文件的数量是页面的五倍。
- 链接:重写为相对路径,否则你的副本只有在 archive.org 正常运行时才能使用。
- 一份清单:逐文件列出你拥有的内容,把“我觉得我全拿到了”变成可核查的东西。
文件数量往往让人吃惊。一个只有 50 页的普通企业网站,文件总数通常达到 400 到 800 个。一个 2009 年的 phpBB 论坛,包含用户头像和附件,文件数可能高达数万。要按文件数量来规划,而不是页面数量。
另外,用于浏览的副本和用于重新部署的副本是有区别的。浏览用的副本只需要文件和可用的链接。而打算重新上线的副本则需要更多:一致的规范网址(选择 www 或非 www)、支持 HTTPS 的引用,以及去掉十年前的统计脚本等无用内容。在开始之前就要决定你要构建哪一种,因为事后再改都很繁琐。
为什么资源会分散在不同的时间戳下
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
Wayback Machine 并不是在一个下午就把整个网站拍下来。它的爬虫会抓取它们能到达的任何内容,而且是在它们恰好到达的时候。你 2014 年的首页可能引用了一个最后抓取于 2012 年的 logo,一个在五年间被抓取了六次的样式表,以及一张从未被抓取过的首屏大图。当你查看那个页面时,archive.org 会悄悄地为每个资源替换上它所保存的最接近的抓取版本。这就是为什么即使页面的各个部分分散在十年间,它在你的浏览器里看起来仍然正常。
这带来两个后果。第一,不存在一个你可以让下载工具直接使用的“网站时间戳”, 完整的下载需要从每个文件各自的最佳抓取版本中获取。第二,最接近抓取的替换技巧会掩盖缺失:Wayback 会毫无提示地把一张 2016 年的图片塞进你 2014 年的页面里。对于随意浏览来说这无伤大雅,但如果你在意恢复后的页面是否真的是 2014 年的版本,这一点就值得了解。
一个存档页面就像一幅拼贴画。HTML、图片和 CSS 各自在不同的时刻被冻结,而存档在每次有人查看时,又把它们重新粘合在一起。

你使用的任何工具或脚本都需要一个策略来应对这一点。偷懒的策略, 在一个时间戳下抓取所有内容, 正是导致页面充满图片裂图的原因,因为半数资源在那周根本没有抓取记录。正确的策略是按文件处理:从你的日期范围内,为每个资源选取它自己最接近的、可用的抓取版本。
如何从 archive.org 下载整个网站:从清点库存开始
在抓取任何一个文件之前,先列出存档实际保存的内容。CDX API 可以给你一个域名的完整账本:每个被抓取的 URL,连同它的时间戳、MIME 类型和 HTTP 状态码。筛选出状态码为 200 的记录,合并重复的内容摘要,你就得到了一份现实的购物清单,而不是凭空猜测。
在下载之前先查看清单,你就能尽早发现那些令人不快的事实。在那个 phpBB 论坛的项目中,CDX 列表显示了 11,000 个被抓取的 URL, 其中大约 3,000 个是同一个头像 GIF,只是保存在不同的查询字符串下。合并重复项把一个吓人的任务变成了一个普通的任务。同一份清单还会暴露出那些从未被抓取过的页面,世上任何下载方法都无法将它们变回来。最好在第一天就知道这一点。
按 MIME 类型对幸存文件进行分组,工作的轮廓就显现出来了:有多少 HTML 页面,多少图片,多少 JavaScript,是否有需要担心的 PDF 或视频。这种分组既决定了你的下载顺序,也决定了你最终的完整性检查。
从 archive.org 无遗漏下载整个网站的检查清单
- 拉取该域名的 CDX 清单,筛选出 HTTP 200 的抓取记录,覆盖你的完整日期范围。
- 合并重复的内容摘要,让相同的文件只下载一次,而不是成百上千次。
- 按 MIME 类型对列表进行分组:首先是 HTML 页面,然后是 CSS、JS、图片、字体、文档、媒体。
- 从每个文件各自的最佳抓取版本下载,使用 id_ 修饰符获取原始字节,不含 wayback 注入的标记。
- 将内部链接重写为相对路径,使副本能在任何主机上运行,包括你的笔记本电脑。
- 在本地提供该文件夹的服务,并点击浏览。断开的链接、缺失的图片和字体 404 错误几分钟内就会显现。
- 将最终的文件数量与清单进行对比,并记录下缺失的内容及其原因。

最后一步是每个人都会跳过的,而它正是备份和一堆文件之间的区别。一份清单能把“我觉得我全拿到了”变成一份你可以审计的列表。网站恢复服务 内置了这一点:免费估算会在你开始前报告确切的存档文件数量和总大小,恢复过程可以导出一份 JSON 或 SQLite 清单,列出它带回的每一个文件,这样完整性就是一个数字,而不是一种感觉。
你无论如何都会遇到的缺失
- 爬虫从未发现的页面。如果公开网络上没有任何东西链接到某个页面,wayback 很可能从未见过它。
- Robots.txt 排除项。较早的抓取会完全跳过被禁止的路径,而且有些网站故意阻止存档。
- JavaScript 渲染的内容。爬虫历来只存储 HTML 外壳,而不是脚本后来构建的任何内容。
- 登录、购物车和搜索结果。任何需要 POST 请求或会话的内容,都是爬虫无法逾越的墙。
- URL 噪音。会话 ID 和跟踪参数会让清单膨胀出数千个重复的“页面”,去重后只剩下少数几个真实的页面。
这些都不是你方法的失败, 它们是存档本身的漏洞。清单的价值在于,它能在你向任何人承诺完整恢复之前,就让你看到这些漏洞。
当你确实发现漏洞时,把它们记录下来。一页纸的说明,列出那十二个从未被抓取的页面、那个只以缩略图形式存在的视频,以及被 robots.txt 屏蔽的论坛板块,就能把一个尴尬的意外变成可控的预期。客户可以原谅文件缺失,但他们不会原谅自己发现这些缺失。
一份完整副本的价值
如果这个网站是客户的商店,或者是一个有着十年帖子的社区论坛,那么半吊子的下载就是伪装成备份的隐患。要么自己投入时间执行检查清单,要么把爬取、时间戳匹配、链接重写和清单生成交给专门为此而建的工具。估算不花一分钱,而另一种选择则是在网站上线后才发现缺失了 300 张图片。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
我能一键从 archive.org 下载整个网站吗?
Archive.org 本身不提供整站导出, 它是为浏览单个抓取版本而建的。一键式结果来自那些枚举存档索引并抓取每个文件的工具:比如 wayback-machine-downloader 这样的脚本,或者像 Restorix 这样的恢复服务,它们还能处理资源、链接重写和清单。
为什么我从 archive.org 下载整个网站后,图片会缺失?
通常有两个原因之一。要么图片从未被爬取过,所以任何地方都不存在副本;要么你的工具从一个时间戳抓取了页面,而唯一幸存的图片抓取却在另一个时间戳下。跨时间戳资源匹配可以解决第二种情况;第一种情况则无解。
Wayback Machine 会存档网站的每一个页面吗?
不会。它存档的是其爬虫能够到达的内容:从某处链接过来的页面、robots.txt 允许的页面、无需登录或大量 JavaScript 即可渲染的页面。深层的论坛帖子、分面搜索页面和管理后台通常都不存在。CDX 清单会在你开始前准确显示存在的内容。
一个完整的网站下载通常涉及多少个文件?
比人们预期的要多。一个只有 50 页的普通企业网站,算上图片、样式表、脚本和字体,文件总数通常达到 400 到 800 个。论坛和商店则可达数万个。决定下载时间和成本的是文件数量,而不是页面数量。
存档中包含 PDF、视频和其他下载文件吗?
通常是的。存档会保存它能够到达的文档和媒体,CDX 索引会按 MIME 类型将它们与页面一起列出。大型视频是例外, 它们的抓取并不一致, 因此要在清单中核实它们,而不是假设它们幸存了下来。
相关指南

download a website from archive org
如何从 Archive.org 下载网站:三种有效方法
三种经过验证的方法可从 archive.org 下载网站:手动保存页面、编写 CDX API 脚本,或运行自动化还原。附带每种方法的实际耗时参考。

archive.org download website
Archive.org 网站下载工具:一份诚实的对比
一份诚实的 archive.org 网站下载对比:HTTrack、wayback-machine-downloader 脚本和 Restorix。真实成本、所需精力与资源处理方式。

find all pages on a website
如何查找网站上的所有页面(包括已删除的页面)
需要查找网站上的所有页面, 包括那些没有任何链接的页面?比较站点地图、爬虫、Wayback CDX API 和 Search Console 导出。

wayback download
Wayback 下载:按所需精力排出每一种方法
所有 wayback 下载方法按精力成本排序:单页保存、wget 脚本、CDX API,以及全自动帮你重建整个站点的服务。
