Wayback Machine on Archive.org:实用网站指南
作者:Restorix 编辑团队 · 2026年6月6日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
搜索 Wayback Machine 时,Archive.org 会把你带到一个布满图标的首页, 书籍、音乐会、电视新闻、MS-DOS 游戏。你真正想要的网页存档就隐藏在其中。这是一份实用指南:Wayback 在 Archive.org 中的具体位置,搜索和日历视图如何运作,几个能节省大量时间的 URL 技巧,以及当仅仅查看旧页面无法满足恢复需求时该怎么办。
Wayback Machine 在 Archive.org 上的位置
Archive.org 是一座完整的数字图书馆;Wayback Machine 是其中的一个馆藏, 网页馆藏。首页的搜索框是目录搜索:它通过标题和描述来查找书籍、视频和音频等项目。如果你把 URL 粘贴进去并期待看到旧快照,你会得到一些名字相似的书籍结果,让人一头雾水。每个人都会经历一次这种事。
Wayback 在 web.archive.org 有自己的主页,可以通过 archive.org 首页上的大 Web 图标进入。经验法则是:寻找网页,从 web.archive.org 开始;寻找其他东西, 一本书、一场音乐会、一部电影, 从 archive.org 开始。把两者搞混是人们认为存档中没有某样东西(而实际上绝对有)的主要原因。
在 Archive.org 上搜索 Wayback Machine
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
将完整的 URL 粘贴到 Wayback 搜索框中(协议可选),你就会进入该地址的日历视图。接下来:
- 在顶部的条形图中选择一个年份。柱子的高度代表抓取量,因此网站活跃的年份一目了然。
- 在日历上,圆圈标记有抓取记录的日期;圆圈越大表示抓取次数越多。将鼠标悬停在圆圈上可查看确切的时间戳。
- 点击时间戳即可加载该快照。页面顶部会出现 Wayback 工具栏,带有用于查看同一 URL 上一个和下一个快照的箭头。
三个值得记住的快捷方式。第一,通配符:web.archive.org/web/*/example.com 会打开整个域名的 URL 列表, 这是找出你忘记其存在的页面的最快方法。第二,日期简写:web.archive.org/web/2015/example.com 会重定向到最接近该日期的快照,输入更多数字可以进一步缩小范围(20150615 会定位到六月中旬)。第三,id_ 修饰符:web.archive.org/web/20150615000000id_/http://example.com/style.css 会返回未经 Wayback 重写的原始文件, 这是获取未被篡改的样式表或图像的干净方法。
比较两个快照
从日历页面链接的“Changes”视图会将两个快照并排对齐,并逐页突出显示它们之间的变动, 增加和删除的内容。在长页面上它可能会显得有些杂乱,但如果你想找出某个定价层级或页脚免责声明是何时出现的,这比用肉眼盯着两个浏览器标签页要强得多。选择相隔几个月的快照进行比较;如果比较 2010 年和 2025 年的快照,整个屏幕都会被高亮覆盖。
自己保存网页
web.archive.org/save 的保存框可以按需存档任何公开页面,通常在一分钟内完成。登录用户还可以享受额外功能,例如一次性保存出站链接以及保留个人保存列表。在网站发布、重新设计和迁移之后使用它, 这些是你以后最可能想要带有日期记录的时刻。
正确解读快照
旧快照会以不易察觉的方式欺骗你。页面正常渲染说明 HTML 及其资源保留了下来。如果只显示没有样式的骨架,说明样式表未被抓取或被阻止。图片位置出现灰框也是同样的道理。这些都不意味着页面未被存档, 而是说明存档保留了文档,但遗漏了一些附件。
工具栏上的时间戳值得更多重视。一个渲染出来的页面可能会拼接相隔数周抓取的资源,因为存档会提供每个文件最接近的可用副本。对于任何需要作为证据的内容,请记录每个元素的抓取日期,而不是假设整个页面是同一时刻冻结的。
在浏览快照时请注意地址栏。存档页面上的每个链接都被重写为指向该目标的最近快照,这就是为什么你可以像网站还活着一样浏览一个死站, 这也是为什么从 Wayback 复制出来的链接是 archive.org 地址,而不是原始地址。

Wayback 周边的馆藏
既然你已经在这个网站上了,图书馆的其余部分也值得花十分钟看看。首页的图标按媒体类型对其进行了划分:
- 文本:数千万本扫描的书籍和文档,包括 Open Library 的借阅和免费的公共领域下载。
- 音频:Live Music Archive 的音乐会录音、老式广播、播客和数字化的 78 转唱片。
- 视频:带有可搜索字幕的电视新闻存档,以及内容奇特有趣的 Prelinger 教育和工业电影合集。
- 软件:数千款可在浏览器模拟器中运行的 MS-DOS、街机和主机游戏。建议先空出一个下午的时间。
每个馆藏都有自己的搜索和筛选功能,而且与网页部分不同的是,它们提供了丰富的下载选项。
各馆藏之间的交叉链接也做得很好。一本扫描的计算机杂志可能会评论一个程序,然后你可以在模拟器中启动该程序;电视新闻字幕只需点击一下即可查看相关的网页快照。在这里漫无目的地浏览会有意想不到的收获。
Archive.org 上的 Wayback Machine 无法提供的东西
Archive.org 的网页部分是为浏览而构建的,当你把它当作文件来源时,它的局限性很快就会显现。快照无法批量下载。表单、搜索框和登录功能都是无效的, 存档只存储 GET 响应,而不是会话。登录后才能访问的内容从未被抓取过。所有者可以要求排除,因此某些域名是应要求而缺席的。而从 2010 年代中期开始,大量使用 JavaScript 的页面通常只抓取到了一个加载图标。
一个具体的案例:一个拥有 40,000 个帖子的 2009 年 phpBB 论坛。Wayback 显示了分散在多年快照中的公开帖子。浏览器的“另存为”生成的页面带有被重写的 archive.org URL,缺少头像,并且没有附件。将 wget 指向 web.archive.org 速度很慢,有速率限制,而且除非你自己重写每个 URL,否则它给你的仍然是经过 Wayback 包装的 HTML。这相当于每个子论坛都要花一整晚的时间,结果还是一团糟。
带走真实文件
当目标是重新发布或保留本地副本时,请使用专门的提取工具。Restorix 会从 Wayback 中提取域名的存档版本,并将其重建为干净的文件。免费评估会在你支付任何费用之前,为你提供确切的存档文件数量、总大小和锁定的价格。然后,你可以按恢复的文件数量付费, 第一个文件免费,且没有任何订阅费用, 清理选项可以剥离旧的跟踪器、广告和 iframe,将内部链接设为相对路径,并将网站转换为 HTTPS。你可以下载结果,将文章导出为 XML、CSV 或 JSON,或者直接部署到你的主机上,其中包含一个小型内置 CMS。
如需完整的下载工作流程,从 Archive.org 下载网站 指南会逐步引导你完成操作,而 Wayback downloader 文章则比较了主要的方法。

Wayback Machine Archive.org 速查表
收藏好这些内容, 它涵盖了人们对该网站最常问的问题:
| 你想要…… | 这样做 |
|---|---|
| 查看网页的旧版本 | 在 web.archive.org 粘贴其 URL |
| 列出某个域名下被抓取的 URL | 打开 web.archive.org/web/*/example.com 并使用 URLs 视图 |
| 跳转到最接近某个日期的快照 | 使用 web.archive.org/web/20150615/http://example.com |
| 获取原始、未重写的文件 | 在快照 URL 的时间戳后添加 id_ |
| 立即存档网页 | 在 web.archive.org/save 提交 |
| 搜索书籍、音频或视频 | 在 archive.org 上使用目录搜索 |
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
Wayback Machine 是 Archive.org 的一部分吗?
是的。Archive.org 是 Internet Archive 的网站,而 Wayback Machine 是其网页馆藏, 可通过 web.archive.org 或首页上的 Web 图标访问。同一个组织,同一个非营利机构,一个账户即可在全站通用。
Archive.org 上的 Wayback Machine 可以追溯到多久以前?
可以追溯到 1996 年,即 Internet Archive 开始抓取网页的那一年。20 世纪 90 年代后期的覆盖率较低,且主要限于大型网站;从 2000 年代初开始,随着抓取规模的扩大,覆盖率明显增加。
使用 Archive.org 上的 Wayback Machine 需要账户吗?
浏览快照或通过 Save Page Now 保存页面不需要账户。免费账户可提供更多便利,例如管理已保存的页面和从 Open Library 借书。Wayback 本身没有付费层级。
为什么日历显示有快照,但页面加载却是损坏的?
HTML 被抓取了,但某些资源没有被抓取, 样式表、图片或脚本可能是在不同时间被抓取的,被 robots 规则阻止了,或者来自后来失效的域名。尝试邻近的快照日期;提前或延后一周通常能渲染出完整的页面。
我可以在 Archive.org 上搜索旧网页的全文吗?
在 Wayback Machine 中不行, 它索引的是 URL,而不是页面文本。对于文本搜索,项目目录搜索涵盖了带有完整 OCR 的书籍和文档。如果你只记得某个失效页面的一句话,使用通用搜索引擎加上域名通常是找到正确 URL 的更快途径。
如何从 Archive.org 下载整个网站?
Wayback Machine 没有批量导出功能。实用的方法是使用恢复服务:Restorix 会提取某个域名的所有存档文件,清理标记,并为你提供可下载的副本, 请参阅[整个网站下载指南](/zh/download-entire-website-from-archive-org)。
相关指南

internet archive way back machine
Internet Archive Way Back Machine:网站管理员指南
Internet Archive Way Back Machine 的运作方式、运营它的非营利组织、9000 多亿存档页面的意义,以及网站管理员日常如何使用它。

archiveorg
Archiveorg:探秘互联网最大的免费图书馆
Archiveorg 不仅仅是 Wayback Machine:它还有免费图书、现场音乐、电视新闻、可玩的软件以及超过 9000 亿个网页。完整的导览,外加文件恢复。

download a website from archive org
如何从 Archive.org 下载网站:三种有效方法
三种经过验证的方法可从 archive.org 下载网站:手动保存页面、编写 CDX API 脚本,或运行自动化还原。附带每种方法的实际耗时参考。

restore website from archive.org
从 Archive.org 恢复网站:自己动手还是全托管服务?
从 Archive.org 恢复网站,应该自己动手还是付费使用全托管服务?本文从成本、时间、技能和风险四个维度进行客观对比,并提供一套决策框架。
