Wayback Back Machine:无论你怎么输入,这里都有使用指南
作者:Restorix 编辑团队 · 2026年6月15日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
你搜索了'wayback back machine'。也许你的手指多打了一个词,也许这个名字在你记忆中有点模糊。没关系。你需要的工具是 web.archive.org 上的 Wayback Machine,本指南涵盖人们实际需要的三件事:查找快照、下载页面,以及在原始网站消失时恢复整个网站。
多年来,我一直从那个存档中拉取网站, 为一位客户恢复了一个2009年的 phpBB 论坛,为另一位客户恢复了一个因托管账单被归入垃圾邮件文件夹而丢失的 WooCommerce 商店。工具始终如一,变化的只是技巧。
为什么这么多人输入 'Wayback Back Machine'
官方名称的节奏有点奇怪,所以搜索日志里充满了各种变体。'Wayback back machine' 是其中之一,还有 'way back machine' 和 'waybackmachine'。谷歌会直接把你带到同一个地方:互联网档案馆的网络存档。
这个名字源自《洛奇和布尔温克历险记》中的时间旅行装置 WABAC 机器。记住这一点,就不会再叫错了。Wayback,一个词,不需要多余的 'back'。
谷歌会原谅这个拼写错误,存档也是如此。重要的是日历加载后你该做什么。
在 Wayback Machine 上查找快照
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
打开 web.archive.org,将你需要查找的页面或网站的完整网址粘贴到搜索框中。返回的是一个时间线:顶部是每年抓取次数的迷你趋势图,下方是日历。有抓取记录的日期会显示彩色圆圈。蓝色表示爬虫获得了正常的 2xx 响应,绿色表示重定向,橙色和红色表示错误。圆圈越大,表示当天的抓取次数越多。
- 粘贴网址时带不带协议都可以, 存档会自动规范化。
- 点击趋势图上的年份,然后悬停一个日期并选择一个时间戳。
- 检查页面是否实际渲染。快照可能存在但仍然损坏。
- 在快照内部点击浏览。内部链接和资源也会从存档中加载。
- 尝试 www 和非 www 变体,以及 http 和 https。旧网站在这些变体上的存档往往不均匀。
记不清确切的网址?打开网站的日历页面,使用 URL 视图列出已抓取的路径。它会显示你忘记存在的页面, 通常你真正怀念的内容就藏在那里。
一个省心的习惯:永远不要仅凭首页判断一个日期。首页是任何网站上抓取次数最多的页面,所以它几乎总是看起来没问题。在确定日期之前,打开两三个更深层的页面, 产品页、博客文章、联系页面, 确认它们能正常渲染图片和样式。在这里花十五分钟点击,胜过之后花一天返工。

下载单个页面
对于单个页面,你有三种可行的方法,从省事到精细。
- 浏览器保存。打开快照,按 Ctrl+S,选择“网页,全部”。你会得到 HTML 及其资源,其中嵌入了存档的重写标记。适合阅读,但重用起来很麻烦。
- id_ 后缀。编辑快照 URL,使时间戳以 id_ 结尾, 例如 https://web.archive.org/web/20140601120000id_/http://example.com/, 存档会提供完全按抓取时的原始页面:没有工具栏,没有重写的链接。查看源代码并复制你需要的内容。
- wget。将 wget -p -k 指向 id_ URL,一次性拉取页面及其所需资源。当你还需要图片时,就用这个方法。
这三种方法对于一两页来说都还行。到了五十页左右,它们就不再是方法,而是一种折磨。
无论你选择哪种方法,在信任它之前,先在本地打开保存的文件。检查图片是否从磁盘加载,而不是从 web.archive.org 加载,如果打算重新发布任何内容,请去除存档注入的工具栏标记。现在花五分钟清理,可以避免以后出现一堆盗链资源的问题。
当你需要整个网站时,Wayback Back Machine 的局限性
这个存档是为浏览历史而建的,不是为把你的网站还给你。一旦你尝试恢复超过几页,这一点很快就会显现出来。
- 没有批量下载按钮。每个文件, 每个页面、图片、样式表、脚本, 都是独立的抓取记录。
- 深层页面很少或从未被抓取。首页可能有 400 个快照,而产品页只有两个。
- 资源会丢失。HTML 可能来自三月,而它的 CSS 根本没有被抓取过。
- 速率限制会将逐页拉取变成持续数天的苦差事。
- 在查看时由 JavaScript 组装的页面,通常被存档为空壳。
开始之前先算一算。一个 500 页的网站,每页两分钟,就是超过 16 小时的点击, 而且你还需要修复链接、去除存档标记、寻找托管。完整情况请参阅从 archive.org 下载整个网站的指南。
逐步恢复整个网站
这就是 Restorix 专为处理的工作。粘贴域名,即可免费恢复估算工具:确切的存档文件数量、总大小,以及在你支付任何费用之前锁定的价格。无需订阅, 你可以通过银行卡或加密货币充值余额,并按恢复的文件付费。第一个文件免费。
- 输入域名并查看估算。
- 选择日期范围,这样你恢复的是网站的最佳状态,而不是最新状态。
- 设置选项:去除分析代码、广告和 iframe,将内部链接转换为相对路径,强制使用 HTTPS,压缩 JS 和 CSS。
- 运行恢复,并在仪表板中实时查看进度。
- 下载完成的网站,或直接部署到你的托管服务器。
部署只需一键,支持 SSH 或 SFTP 的 VPS、FTP/FTPS 共享主机或 S3,凭据采用 AES-256-GCM 加密。每次部署都包含免费的 Restorix CMS, 一个位于 /webarchive-cms.php 的单 PHP 文件编辑器,仪表板中会显示每个站点的密码, 这样你无需重新部署即可修改内容。教程 会带你走完整个流程。

Wayback Back Machine 无法保存的内容
在向任何人承诺完全恢复之前,先设定期望。有些内容根本没有进入存档。
- 登录或付费墙后的页面, 爬虫也无法进入。
- 被 robots.txt 阻止的部分,历史上这会阻止爬虫访问。
- 通过表单和 POST 请求获取的内容,例如内部搜索结果。
- 大多数流媒体音频和视频嵌入。
- 任何完全由客户端 JavaScript 生成、而爬虫未执行的内容。
- 数据库本身。你得到的是渲染后的 HTML,而不是 MySQL 转储文件。
一位客户的论坛恢复得很漂亮, 2009 年的每个帖子都完好无损。但照片附件位于登录之后,全部丢失了。在开始计算文件之前,先弄清楚你的内容属于哪一类。当你仍然需要原始数据时,Restorix 可以导出结构化的文章导出为 XML、CSV 或 JSON,以及每个恢复文件的 JSON 或 SQLite 清单, 方便审计哪些内容幸存了下来。
让你的恢复网站保持在线
恢复后的网站是静态 HTML,因此托管既便宜又简单。保留恢复时保留的 301 和 302 重定向,选择一个规范主机, www 或非 www, 如果你仍然拥有旧域名,就将网站放回原域名。旧的入站链接会重新生效,这是恢复的一半 SEO 价值。
| 托管类型 | 典型费用 | 适合 |
|---|---|---|
| 共享主机 (FTP) | 每月几美元 | 小型宣传网站 |
| VPS (SSH/SFTP) | 每月 5-10 美元 | 更大的网站,更多控制权 |
| S3 静态托管 | 每月几分钱 | 高流量,零维护 |
无论你怎么输入这个名字, 多了一个 'back',词序颠倒, 出路都是一样的。找到快照,保存重要的内容,然后将网站放回你控制的托管服务器上。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
它叫 Wayback Machine 还是 wayback back machine?
真正的名字是 Wayback Machine, 一个 'wayback',没有第二个 'back'。它由互联网档案馆运营,自 1996 年以来一直在保存网页。双词版本只是一个常见的拼写错误,搜索引擎对两者一视同仁。
我可以免费从 Wayback Machine 下载整个网站吗?
没有批量导出功能。你可以免费逐页保存,但整个网站意味着成百上千个独立的抓取记录。Restorix 改为按恢复的文件收费, 估算会显示确切数量和锁定价格,且第一个文件免费。
为什么有些快照中缺少图片或样式?
每个资源都是独立的抓取记录,有自己的时间戳。如果爬虫当天抓取了 HTML 但错过了样式表,快照就会无样式渲染。试试相邻的日期, 抓取覆盖率在不同日期之间差异很大。
Wayback Machine 能追溯到多久以前?
追溯到 1996 年。热门网站的覆盖率很高,小型网站则很稀疏,而且越往前越零散。一个地区性商业网站可能从 2005 年开始有可靠的抓取记录,而 1999 年几乎什么都没有。
从存档中恢复旧网站合法吗?
恢复你自己的网站,或你明确拥有权利的内容,通常没问题。全盘复制他人的网站则是版权问题。当所有权情况不明时,在发布任何内容之前请寻求适当的建议。
我可以自己将页面添加到存档中吗?
可以。使用 web.archive.org/save 上的“立即保存页面”功能, 粘贴网址,爬虫会按需抓取。每次对你的网站进行重大更新后都这样做,这样无论你的托管发生什么,总有一个干净的副本存在。
相关指南

wayback machine
Wayback Machine:浏览网页历史的完整指南
Wayback Machine 存档了超过 9000 亿个网页。了解爬虫、快照、日历和搜索语法的工作原理, 以及如何恢复丢失的网站。

download entire website from archive org
从 Archive.org 下载整个网站,而不仅仅是首页
要从 archive.org 下载整个网站,你需要每一页、每张图片和每个样式表。资源文件分散在不同的时间戳下, 原因在此,并附上完整检查清单。

restore website from wayback machine
从 Wayback Machine 恢复网站:完整指南
端到端地从 Wayback Machine 恢复网站:选择正确的快照,设置恢复选项,然后在一小时内部署一个带有 CMS 的可运行网站。

wayback machine downloader
Wayback Machine 下载工具:哪些真正好用
客观评测 Wayback Machine 下载工具:开源脚本、实际局限,以及帮你把网站重新上线的托管式方案。
