网页缓存详解:缓存的工作原理及使用方法
作者:Restorix 编辑团队 · 2026年5月13日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
你打开过的每个页面其实都只是一个副本。浏览器并非直接从网站服务器获取内容,而是从缓存中提取了一份副本,而这份副本又来自另一个缓存,直到万不得已时才会向真正的服务器发起请求。这条副本链构成了网页缓存系统,大多数时候它就像隐形的管道, 直到某个你需要的页面消失,这时“谁的副本还在”这个问题就变得耐人寻味了。
下面我们来了解每一个层级实际的工作原理、哪些你可以查看内部,以及如何利用它们查看已经不复存在的页面。
网页缓存到底是什么?
网页缓存是响应数据的一份存储副本,保留在源服务器和你的屏幕之间的某个位置,以便下一次请求更快、更省资源。这就是它的全部定义。源服务器通过 Cache-Control 和 ETag 等标头规定副本可复用的时长;缓存会持续提供该副本,直到它过期失效,然后会重新验证或获取一份新的。
由此带来了两个结果。第一,每个网页不止一个副本,而是成千上万份,分散在浏览器、服务器和各种服务中。第二,这些副本几乎都不是为了让你以后浏览而保存的。它们的存在是为了速度,而且大部分会按照计划清理。当页面丢失时,关键就在于找到那个专门用来保存内容的缓存。
四种值得了解的网页缓存
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
实践中,有四个层级至关重要。它们在保存时长和是否允许进入方面差异巨大:
| 缓存类型 | 运营方 | 存在原因 | 保留时长 | 能否查看内部? |
|---|---|---|---|---|
| 浏览器缓存 | 你(在你的设备上) | 加速重复访问 | 数天至数周,静默清除 | 技术上可以,但实际操作很麻烦 |
| CDN和代理缓存 | Cloudflare、Fastly、你的主机服务商、你的ISP | 降低全球负载和延迟 | 数秒至数天 | 否, 它按自己的规则为你服务 |
| 搜索引擎缓存 | Google、Bing | 索引和结果预览 | 直到下一次重新抓取 | 大多数已不可用, Google于2024年关闭了公共缓存 |
| 网页存档 | Internet Archive、archive.today | 保存本身就是目的 | 数十年,有意为之 | 是的, 这正是其意义所在 |
看着一个页面加载,你就能看到整个堆栈是如何工作的。在手机上打开一个网站,浏览器缓存会提供它已有的内容,最近的CDN边缘节点提供大部分其余内容,而源服务器只有在所有缓存都没有副本时才会被唤醒。之后,每一层都会保留自己的副本, 各自按照自己的计划,出于自己的原因,几乎没有一个是为你着想的。

浏览器缓存:你本地机器上的副本
你的浏览器会将图片、脚本、样式表,有时甚至是整个页面保存在磁盘缓存中,以便重复访问时无需通过网络。这是你唯一物理拥有的网页缓存,但对于有意的恢复来说几乎没用:没有浏览界面, Chrome多年前就移除了chrome://cache页面, 条目以哈希文件名形式存在,而且缓存会在需要空间时静默清除内容。
仍有两点实用价值。如果你在页面下线前不久访问过它,从历史记录中重新加载有时会在404出现之前从缓存提供页面, 概率低,零成本,值得一试。而且你的历史记录始终保存着确切的URL,这是其他所有恢复工具都需要的一个输入。
CDN和代理缓存:中间人
在你和大多数热门网站之间,存在着一个内容分发网络,它在世界各地的边缘节点保存副本,外加主机附加的任何缓存层。这些缓存遵循源服务器的标头,配置得当的缓存会在源服务器宕机后继续提供过期内容一段时间, stale-if-error指令正是为死掉的服务器而设。这就是为什么一个网站可能在服务器断线后数天内看起来仍然完全正常。
但对于恢复来说,可以把CDN缓存看作天气:它们能让网站可见时间稍长一些,但你无法查询、浏览或要求获取去年的副本。企业代理缓存也是如此,只不过多了一层刻意的模糊。副本确实存在,但没有一个是为你的。我曾目睹一个客户的Magento商店在服务器宕机后仍然“在线”了四天, CDN继续提供首页和分类页面,而结账功能却在悄然失败。看似活着的,其实是一座博物馆。
搜索引擎和存档:为展示而建的缓存
20年来,搜索引擎缓存一直是公众最喜欢的恢复技巧:Google保存了上次抓取的可查看副本,每个搜索结果只需点击一下即可。Google在2024年2月退役了这项功能, cache: 操作符和“缓存”链接都消失了, Bing也一直在逐步关闭其版本。搜索引擎仍然在内部缓存网络,但公众可以查看的窗口正在关闭。
剩下的那一层从来就不是缓存,而是图书馆:存档。Wayback Machine按计划抓取,并通过Save Page Now按需保存。archive.today按请求保存页面,并先渲染JavaScript。Common Crawl免费发布原始抓取数据,供任何愿意查询其索引的人使用。这些副本的创建目的是让陌生人几十年后仍能检索, 网页缓存的任何其他层级都做不到这一点。
如何使用网页缓存查看丢失的页面
- 从浏览器历史记录、失败的链接或引用中确认确切的URL。每次缓存查找都从一个URL开始。
- 查询Wayback Machine:web.archive.org/web/后跟URL。日历显示了每个快照;选择一个状态良好的年份,而不是域名停放页面时代。
- 接下来检查archive.today。它按照不同规则保存不同页面,并且其JavaScript渲染可以捕捉到Wayback显示为空壳的页面。
- 如果两者都没有,可以尝试Common Crawl索引(index.commoncrawl.org), 原始HTML,没有修饰,偶尔是唯一存在的副本。
- 如果页面只是几天前消失的,在该功能还可用时,在Bing结果中寻找缓存链接,并尝试从自己的浏览器历史记录中重新加载一次。
- 当同一网站的一个页面变成二十个时,请停止。转而批量恢复网站:Restorix CMS提供免费估价, 确切的存档文件数量、总大小和固定价格, 在你承诺任何事之前。
对于存在一年或更长时间的公开页面,预计成功率约为十分之八。失败的原因可以预见:被robots.txt阻止的网站、需登录的内容,以及在任何爬虫经过之前就被删除的页面。

当所有网页缓存都让你失望时
有些页面从未在任何地方被复制过:太新、被爬虫阻止、需要登录,或者JavaScript渲染太重,导致存档只保存了空壳而没有内容。当所有缓存都为空时,工作就从检索转向重建, 通过引语搜索来浮现转载和引用,链接到你错过的快照的Wikipedia引用,以及向作者发邮件索要副本这种不时髦但有效的方法。旧网页恢复详细介绍了这条取证路线。
在需要之前缓存你自己的内容
赢得网页缓存游戏的可靠方法是停止依赖别人的缓存。对于任何你关心的页面,将其提交给Save Page Now和archive.today,这样两个独立的存档就会保留它,并保留一份本地副本作为PDF或单一HTML文件。对于你自己的网站,做法要更加正统:定期进行真正的备份。这个列表上的每一个缓存都是你侥幸遇到的意外;备份才是你主动做出的决定。
如果你正在寻找的页面是你拥有的网站上的众多页面之一,那就完全跳过零散的方式:使用Restorix一次性从存档中恢复网站,并使用捆绑的单文件CMS部署,恢复问题就不再重复发生。教程展示了完整的端到端流程。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
网页缓存和备份是一回事吗?
不是。缓存是为了速度而临时制作的副本,大多数缓存会按照自己的计划清除内容,无需征求任何人同意。备份是为了恢复而有意识制作的副本。唯一像备份一样工作的缓存是网页存档,因为保存本身就是它们的工作。
缓存的页面能保存多久?
浏览器缓存:数天至数周,毫无征兆地消失。CDN缓存:数秒至数天。搜索引擎缓存:直到下一次重新抓取,而且Google的公开视图已经消失。网页存档:实际上永久有效, 1996年抓取的内容至今仍然可用。
我可以强制网页缓存更新吗?
浏览器:使用Ctrl+F5强制刷新。CDN:如果是你的网站,可以清除缓存。搜索引擎:在Search Console中请求重新抓取。存档:提交一次新的Save Page Now抓取。你只能刷新你拥有或接受公共请求的缓存。
为什么我自己的浏览器缓存这么难浏览?
因为它为速度而建,不是为人而建。条目以哈希名称存储,没有查看器, Chrome多年前移除了chrome://cache页面。存在第三方缓存查看器,但期望值要放低:缓存会静默清除,你想要的绝大部分内容已经没有了。
私密模式或无痕模式会使用网页缓存吗?
它会使用一个临时缓存,仅在一次会话中存在,关闭窗口时即被清除。对隐私方便,对恢复无用, 你在私密模式下浏览的任何内容之后都找不到。
相关指南

old web page recovery
旧网页恢复:找回丢失页面的最快方法
旧网页恢复速度排行:Wayback Machine、archive.today、搜索引擎缓存及其他被遗忘的资源,帮你找回单个丢失的页面。

wayback machine
Wayback Machine:浏览网页历史的完整指南
Wayback Machine 存档了超过 9000 亿个网页。了解爬虫、快照、日历和搜索语法的工作原理, 以及如何恢复丢失的网站。

archive org website
Archive.org 网站:高级搜索、筛选器与合集
掌握 Archive.org 网站的高级搜索运算符、筛选器以及对老网站至关重要的合集, 以及何时该使用还原工具。

website history
网站历史:快照、WHOIS、DNS 及各自工具
网站历史可以指存档快照、WHOIS 记录、DNS 变更或旧排名。了解哪种工具回答哪个问题, 以及如何重建丢失的网站。
