Wayback Machine:浏览网页历史的完整指南
作者:Restorix 编辑团队 · 2026年4月30日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
Wayback Machine 帮我解决过无数次难题。客户的 WooCommerce 商店因一次糟糕的插件更新而数据全毁。竞争对手 2019 年的定价页面,因合同纠纷需要调取。某篇被悄悄改写过的文章的原始版本,只因它在一场诉讼中被引用。它是互联网的记忆,而且完全免费使用。然而大多数人只用过首页的搜索框,错过了其他所有功能。本指南将介绍这个存档的实际运作方式、所有值得掌握的搜索技巧、它的不足之处,以及当浏览快照不够用、你需要找回网站本身时该怎么办。
Wayback Machine 到底是什么
Wayback Machine 是一个免费的公共网页存档,由总部位于旧金山的非营利数字图书馆 Internet Archive 运营。Brewster Kahle 于 1996 年创立了该组织,Wayback Machine 则于 2001 年向公众开放。其名称致敬了 1960 年代动画片《皮博迪先生的不可思议历史》中的时间旅行装置 WABAC 机器, 这也是为什么很多人会误记为“the way back machine”。
该存档已收录超过 9000 亿个网页,并且每周仍在以超过十亿页的速度增长。除了网页,Internet Archive 还存储扫描书籍、电视新闻、音频以及可以在浏览器中运行的旧软件。浏览完全免费,无需账户。
在开始之前,有一点需要明确:Wayback Machine 存档的是页面,而非网站。每个快照都是在特定时刻捕获的单个 URL。并不存在一个“2015 年 3 月的完整网站”实体, 只有数千个碰巧共享同一域名的独立页面捕获。请记住这一点,因为它解释了你稍后会遇到的几乎所有怪异现象。
爬虫与快照的工作原理
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
存档由爬虫构建。在最初几年,Internet Archive 依赖于 Alexa Internet 的爬虫数据,这是一家由 Kahle 联合创立的网络分析公司;如今它运营着自己的爬虫系统,同时也有合作伙伴的爬虫以及数百万用户手动保存的内容。爬虫请求一个 URL,存储返回的 HTML,然后获取该 HTML 引用的资源, 图片、样式表、脚本, 每个都作为独立文件存储。
最后一点解释了最常见的困惑。快照并非一个被冻结在时间中的文件夹。页面的 HTML 可能来自 3 月 3 日,而其样式表来自 3 月 9 日,主图则来自 2 月 20 日。当一切对齐时,页面渲染正常。当不对齐时,你就会看到经典的损坏快照:文字完好,布局混乱,照片位置显示为灰色方块。
页面被爬取的频率
没有固定的爬取时间表。爬取频率取决于网站的重要性:一个主要报纸的首页每天会被捕获数千次,而一个 2009 年的 phpBB 论坛可能十年只出现两次。如果一个页面对你很重要,不要等待爬虫来关注它, 自己保存它,这个技巧将在后面几节介绍。
什么会阻止爬取
爬虫遵守 robots.txt 规则,并且排除规则可以追溯生效:一个网站如果对其域名设置了全面禁止,可能会使其整个捕获历史下线,直到该限制被解除。网站所有者也可以直接要求 Internet Archive 排除其内容。需要登录和付费墙的页面从一开始就不会被爬取。
解读日历与时间线
搜索一个 URL 后,你会进入日历视图。两个工具完成所有工作。顶部的条形图显示每年的捕获次数, 这是查看网站何时活跃、何时繁忙以及何时消失的快捷方式。下方的日历标记了所选年份中每个被捕获的日期。
- 蓝色圆圈: 返回 200 OK 的正常捕获。
- 绿色圆圈: 捕获是一个重定向。爬虫跟踪了它,所以请检查它最终跳转到的位置。
- 红色标记: 错误响应,通常是 404 或 500。很少值得打开。
- 更大的圆圈: 当天有更多捕获。将鼠标悬停在某天可查看确切时间,点击时间戳可打开。
打开一个快照,页面顶部会显示一个横幅。它包含精确的 UTC 时间戳、用于上一个和下一个捕获的箭头,以及一个包含爬虫元数据的“关于此捕获”面板。当你在寻找特定变更时, 例如,一家公司何时删除了其退款条款, 不要随机点击日期。寻找捕获的集群和间隔,然后将变更定位在包含它的最后一个捕获和不包含它的第一个捕获之间。

值得记忆的 Wayback Machine 搜索语法
首页搜索框是最慢的入口。URL 本身才是真正的界面,少数几种模式几乎涵盖了你所有可能需要的功能。
| 模式 | 功能 | 示例 |
|---|---|---|
| web.archive.org/web/2020/URL | 最接近 2020 年 1 月 1 日的捕获 | web.archive.org/web/2020/example.com |
| web.archive.org/web/20200615143000/URL | 最接近某一精确秒的捕获(UTC,格式 YYYYMMDDhhmmss) | web.archive.org/web/20200615143000/example.com |
| web.archive.org/web/*/URL | 该单个页面所有捕获的日历 | web.archive.org/web/*/example.com/pricing |
| web.archive.org/web/*/domain/* | 某个域名下所有被捕获的 URL,可筛选 | web.archive.org/web/*/example.com/* |
| web.archive.org/web/2020id_/URL | 原始文件,无横幅,链接未重写 | web.archive.org/web/2020id_/example.com |
| web.archive.org/web/2020im_/URL | 仅该时间戳的图片资源 | web.archive.org/web/2020im_/example.com/logo.png |
其中两种模式值得特别提及。域名级 URL 列表是查找你只记得部分地址的页面的最快方法, 在筛选框中输入部分 slug,存档就能从数千条路径中缩小到你需要的那篇帖子。而 id_ 修改器是专业人士在需要文件本身而非重新框架的预览时使用的,因为它提供原始字节,没有横幅,也不会重写任何链接。
“立即保存页面”及其拒绝保存的情况
存档不仅是阅览室。通过“立即保存页面”功能可以向其写入:将任何公开 URL 粘贴到 web.archive.org/save,爬虫会在几秒内获取实时页面。免费账户可解锁额外功能,如保存外链页面和整页截图。如果你发布任何重要内容,当天保存它是互联网上最便宜的保险。
它拒绝保存的情况比人们预期的要多。被 robots.txt 阻止的页面无法保存。匿名使用有速率限制,因此连续批量保存五十个页面会卡住。登录界面会保存为登录界面。而重度依赖 JavaScript 的应用有时会存档为空壳, HTML 保存成功,但内容只在脚本运行后才存在,而这些脚本请求的 API 早已失效。
Wayback Machine 的不足之处
- 任何需要登录、付费墙或 POST 表单的内容都不会被存档。
- 使用 JavaScript 渲染的交互式应用通常会以空壳形式保存。
- 流式视频和音频很少能从旧捕获中播放。
- 间隔。你迫切需要的那一周,恰好是没人爬取的那一周。
- 无法整站下载。你一次只能浏览一个页面,且链接被重写为指向存档。
- 服务器端代码永久丢失。快照保存的是渲染后的 HTML;PHP、数据库和管理面板从未公开,因此从未被存档。
这些都不是缺陷。存档的构建是为了记忆,而非迁移, 而当你的目标从阅读旧页面转变为重建整个网站时,这一区别就变得至关重要。
从 Wayback Machine 到恢复的网站
浏览快照可以回答问题。但它不会直接给你一个网站。链接指向 archive.org,资源由存档服务器提供,且没有导出按钮。手动复制一两页还行;一个 3000 页的商店那样复制,会耗费你一个月无法挽回的时间。正是在这个节点,人们停止研究,开始寻找 Wayback Machine 恢复 服务。
这个缺口正是 这款网站恢复服务 要解决的问题。它拉取域名的所有存档文件,重建可用的内部链接,并先提供免费估算, 确切的文件数量、总大小,以及在你付款前锁定的价格。恢复按文件收费,第一个文件免费,失败的恢复会自动退款到你的余额。选项涵盖了那些重要但不起眼的部分:清除旧的分析和广告脚本、将链接转换为相对路径、强制 HTTPS、保持 301 重定向有效,以及将结构化的文章数据导出为 XML、CSV 或 JSON。

文件准备好后,一键即可通过 SSH 或 SFTP 部署到你自己的 VPS,通过 FTP 部署到共享主机,或部署到 S3 存储桶, 每次部署都包含一个位于 /webarchive-cms.php 的小型单文件 CMS,因此恢复的网站在部署后即可编辑。教程 大约十分钟即可完成整个流程。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
使用 Wayback Machine 合法吗?
浏览是合法的,该存档作为图书馆运营。版权仍然适用于你对内容的使用, 阅读旧页面没问题,但将他人的文本整体重新发布则不行。恢复你自己的网站,或你拥有权利的内容,是常见且安全的场景。
Wayback Machine 的存档最早追溯到什么时候?
爬虫数据始于 1996 年,因此最早的捕获已有近三十年历史。不过 1990 年代的覆盖较为稀疏;从 2000 年代中期开始,存档才变得可靠且密集。
为什么快照缺少图片或样式?
每个资源都是单独捕获的,有些从未被获取, 被 robots.txt 阻止、来自不同域名,或者只是那天被遗漏了。HTML 保存下来了,但视觉呈现没有。尝试几天前或几天后的捕获。
我能从 Wayback Machine 下载整个网站吗?
存档本身没有网站下载按钮。你可以逐页保存,或使用像 Restorix 这样的恢复服务来重组整个域名, 我们关于[从 archive.org 下载整个网站](/zh/download-entire-website-from-archive-org)的指南详细介绍了所有选项。
如何将自己的网站从 Wayback Machine 中移除?
在 robots.txt 中为 ia_archiver 爬虫添加禁止规则,或向 Internet Archive 发送排除请求。阻止规则可以隐藏过去的捕获,而不仅仅是未来的。
Wayback Machine 会存档社交媒体吗?
部分会。公开的帖子和资料会被捕获,但基于登录和无限滚动的动态流存档效果不佳。将社交媒体捕获视为幸运的发现,而非可靠的记录。
相关指南

wayback
如何每天使用 Wayback:丢失的网页、失效的链接与旧声明
Wayback 是恢复丢失网页、查看网站去年的声明、引用失效链接或在付款前审查公司的最快方法。以下是具体操作指南。

the way back machine
The Way Back Machine:它是什么以及为什么存在
你在搜索'the Way Back Machine'吗?你找对了, 官方名称是Wayback Machine。下面介绍它是什么、谁建立的,以及它的能力和局限。

wayback machine restore
Wayback Machine 恢复:四大陷阱及规避方法
Wayback Machine 恢复可能悄无声息地失败:停放页面、重定向链、图片缺失、时间戳混乱。本文教你如何识别并规避每个陷阱。

download entire website from archive org
从 Archive.org 下载整个网站,而不仅仅是首页
要从 archive.org 下载整个网站,你需要每一页、每张图片和每个样式表。资源文件分散在不同的时间戳下, 原因在此,并附上完整检查清单。
