Wayback Machine 与 Google:在缓存失效后找回丢失页面
作者:Restorix 编辑团队 · 2026年5月11日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
二十年来,查看刚刚下线页面的最快方式一直是 Google 的“已缓存”链接。2024 年 2 月,Google 移除了该功能,到 9 月,cache: 搜索操作符也停止了工作。同年,Google 做了一件出人意料的事:它开始在“关于此结果”面板中链接到 Internet Archive 的 Wayback Machine。信息很明确, Google 是一个实时索引,而非存档,它不再假装自己是存档了。
但这两款工具结合使用效果最佳。当某个页面或整个网站消失时,以下是我如何结合它们的方法,包括那些在清理中幸存下来的操作符技巧。
Wayback Machine 与 Google:两种不同的记忆
Google 维护着一个实时网络的索引。它持续重新抓取,每小时更新排名,其全部目的就是用当前真实的内容来回答问题。当页面发生变化时,旧版本会在下次抓取时被丢弃。当页面消失时,其列表会短暂保留,然后消失。
Wayback Machine 则相反。它是一个只增不减的捕获库,可追溯至 1996 年, 拥有超过 9000 亿个页面。它不关心本周什么内容相关;它关心的是该页面在 2014 年 3 月 12 日说了什么,并且会向你展示那个确切的版本,连同所有界面元素。
因此,这两款工具回答的是不同的问题。Google:这个页面现在是什么内容?Wayback:这个页面过去说了什么?两者之间的混淆是许多人认为网络拥有它实际上并不具备的记忆的原因。
Google 缓存发生了什么
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
二十年来,每个 Google 搜索结果都隐藏着一个“已缓存”链接, 这是 Googlebot 上次看到的页面快照。当页面在会议前五分钟返回 404 错误时,这是标准的解决方案。2024 年 2 月,Google 的搜索联络官 Danny Sullivan 宣布该链接将被退役,理由是页面可靠性已提高且使用量已下降。到 2024 年 9 月,cache: 搜索操作符完全停止工作。
关于时间点有两点很重要。首先,缓存从来就不是存档:它只保存一个版本, 最近一次抓取的版本, 并不断覆盖它。失去它让我们损失了“今早删除”的用例,而非任何历史记录。其次,在缓存功能消失的同一个月,Google 在其“关于此结果”面板中添加了指向 Wayback Machine 的链接。点击任何结果旁边的三个点,选择“关于此页面的更多信息”,Google 就会将你转交给 Internet Archive 的捕获记录。Google 官方地将其用户指向了真正能完成这项工作的工具。

对于非常近期的删除,现在可用的选项更少了:Wayback Machine 经常抓取热门页面,archive.today 按需保存页面,而 Google 摘要本身在页面消失后会在结果中保留数天。这通常足够了。勉强够用。
使用 Google 搜索 Wayback Machine 的索引
Wayback Machine 有一个测试版的全文搜索功能,但它不太稳定。一个无人谈论的变通方法:Google 索引了 web.archive.org 本身的一部分内容,而 Google 非常擅长搜索。
模式很简单:site:web.archive.org/web 加上一个域名、一个标题,或者, 最好的情况, 一个你记得的完整短语。搜索 site:web.archive.org "we regret to inform you" 加上一个品牌名称,可以找到 Wayback 自身搜索无法找到的已存档的停用通知。已存档的新闻稿、删除的道歉文章、旧文档:都是可以挖掘的对象。
请正确设定期望。Google 只索引了存档捕获的一小部分, 那 9000 亿个页面中的大多数对它来说是不可见的。零结果搜索什么也证明不了;它意味着不在 Google 的存档切片中,而非未被存档。将 Google 视为发现层,而将 Wayback 自身的日历视为事实来源。
使用 Google 和 Wayback Machine 的 site: 操作符技巧
以下是我实际运行的查询,大致按顺序排列:
- site:example.com, 快速清点 Google 仍然知道的关于一个垂死网站的信息。在页面本身返回 404 后,摘要会持续存在数天或数周。
- site:example.com inurl:blog(或 /products/、/docs/), 将大型域名切分成各个部分,以便你可以检查每个区域的覆盖情况。
- site:example.com filetype:pdf, 旧的白皮书、手册和规格表。每个失效的 PDF URL 都会直接进入 Wayback 的地址栏。
- "来自已删除页面的确切短语", 带引号的搜索可以找到采集站副本、论坛引用和镜像。短语越独特,效果越好。
- before:2019-01-01, before: 和 after: 操作符会将结果偏向你关心的时代。
- site:web.archive.org/web "example.com", 直接跳转到 Google 已索引的捕获记录。
一旦你有了一个 URL,两个快捷方式可以节省大量时间。将其粘贴到 Wayback Machine,使用 web.archive.org/web/2/ 加上地址, 2 会重定向到时间上最接近的捕获。或者使用可用性 API:archive.org/wayback/available?url=example.com/old-page 会以整洁的 JSON 格式返回最近的快照,这正是你在脚本中所需要的。
Google 何时胜出,Wayback Machine 何时胜出
一个快速的决策表:
| 任务 | 更好的工具 | 原因 |
|---|---|---|
| 今天早上删除的页面 | Google 摘要加上 archive.today | Wayback Machine 可能最近没有抓取它 |
| 2009 年的页面 | Wayback Machine | Google 多年前就已移除该列表 |
| 你记得一个短语但不记得 URL | 全文搜索胜过浏览日历 | |
| 浏览整个网站过去的样子 | Wayback Machine | 捕获记录保持导航和布局完整 |
| 列出网站曾经提供的所有 URL | Wayback CDX API | Google 将 site: 结果限制在几百个 |
| 检查页面去年的确切措辞 | Wayback Machine | 每次抓取一个捕获,带有时间戳 |

简而言之:Google 找到针;Wayback 存储干草堆。如果你需要完整的 URL 清单而不仅仅是单个页面,CDX 路线在查找网站所有页面的指南中有详细介绍。
一个实际案例:追踪一个已失效的 2012 年产品页面
去年春天的一个真实场景。一位客户的 WooCommerce 商店多年前就替换了他们旧的 Joomla 网站;一位经销商需要某个已停产零件的规格表,而客户自己的备份,用他们的话说,“在某个硬盘上的某个地方”。
- 运行了 site:clientdomain.com filetype:pdf 和 site:clientdomain.com inurl:products。实时网站上什么都没有,但一个残留的摘要揭示了旧的 Joomla URL 模式, 带有文章 ID 的 index.php。
- 将域名粘贴到 Wayback Machine 中,并使用日历时间线跳转到 2012 年的捕获记录。
- 从首页捕获记录深入到产品部分。第一个捕获记录中的图片已损坏;四个月后的捕获记录是完整的,PDF 链接有效。
- 在 archive.today 上交叉检查了 Wayback Machine 遗漏的少数页面。
总耗时:大约十分钟。如果没有操作符技巧,这将是一个充满死胡同的夜晚。操作很简单;知道哪个工具回答哪个问题是全部的技巧。
从那次工作中值得记住的一个细节:第一个捕获记录中损坏的图片并非丢失,只是异步加载。Wayback Machine 在不同时间抓取页面及其资源,因此三月捕获的页面可能引用了六月捕获的图片。当一个捕获记录看起来半空时,不要放弃, 向前或向后跳几个月,缺失的部分通常会补上。Google 摘要也存在同样的交错更新问题,这就是为什么一个摘要可能引用当前页面不再包含的段落。
从找到页面到再次拥有一个可工作的网站
找到页面是有趣的部分。从捕获记录重建网站则不然:右键单击另存为、重命名资源、修复路径,然后在第四十页你发现样式表存在于不同的捕获日期。我见过有人在一个十五页的网站上浪费一个周末。
这正是 Restorix 服务 自动化解决的问题。免费估价会读取 Wayback 的 CDX 索引,并在你支付任何费用之前告诉你确切的已归档文件数量、总大小和锁定价格。恢复按文件收费,第一个文件免费,你可以去除那个时代的分析和广告代码,重建的网站可以一键部署到你自己的主机上, 或者如果你想自托管,可以导出为结构化数据。当 Google 和 Wayback Machine 向你展示了曾经存在什么之后,这就是你如何将其找回。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
Google 还有缓存页面功能吗?
没有了。Google 在 2024 年 2 月从搜索结果中移除了“已缓存”链接,并在同年晚些时候关闭了 cache: 搜索操作符。替代方案是:对于任何历史内容使用 Wayback Machine,对于实时页面的按需快照使用 archive.today。
我可以通过 Google 搜索 Wayback Machine 吗?
可以, 使用 site:web.archive.org 加上域名或带引号的短语。Google 只索引了存档捕获的一小部分,因此将空结果视为未被 Google 索引,而非证明捕获不存在。请检查 Wayback 自身的日历以确认。
如何直接从 Google 结果中查看页面的旧版本?
点击任何结果旁边的三个点,打开“关于此结果”,然后选择“关于此页面的更多信息”。自 2024 年 9 月以来,Google 会从该面板直接链接到 Internet Archive 的 Wayback Machine 对该 URL 的捕获记录。
为什么 site: 操作符没有显示网站的所有页面?
site: 操作符返回的是一个样本,而非数据库转储, Google 通常将可见结果限制在几百个,并且只显示它已索引的内容。要获得完整的 URL 清单,请结合使用网站的站点地图和 Wayback CDX API。
什么替代了 cache: 操作符?
Google 没有官方替代品。最接近的编程等效方案是 Wayback 可用性 API (archive.org/wayback/available?url=...),它以 JSON 格式返回任何 URL 的最近捕获记录,并且在脚本中运行良好。
Wayback Machine 多久抓取一次页面?
这取决于页面的显著性和入站链接。主要新闻主页每天会被捕获多次;一个不起眼的页面可能一年被抓取一次或从未被抓取。你可以随时使用 web.archive.org 上的“立即保存页面”框强制进行一次捕获。
相关指南

web cache
网页缓存详解:缓存的工作原理及使用方法
什么是网页缓存,浏览器、内容分发网络、搜索引擎和存档缓存的工作原理,以及如何利用网页缓存查看已消失的页面。

wayback machine
Wayback Machine:浏览网页历史的完整指南
Wayback Machine 存档了超过 9000 亿个网页。了解爬虫、快照、日历和搜索语法的工作原理, 以及如何恢复丢失的网站。

find all pages on a website
如何查找网站上的所有页面(包括已删除的页面)
需要查找网站上的所有页面, 包括那些没有任何链接的页面?比较站点地图、爬虫、Wayback CDX API 和 Search Console 导出。

search website history
购买域名前如何查询网站历史
在购买域名前查询网站历史:旧快照、所有权变更、垃圾信息包袱和商标陷阱, 一套30分钟的尽职调查工作流。
