网站的历史:保存、消失与原因
作者:Restorix 编辑团队 · 2026年5月29日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
2009 年 4 月,Yahoo 宣布关闭 GeoCities。3800 万用户页面, MIDI 文件、闪烁的施工小人、从《X 档案》到热带鱼的各种粉丝站, 都定于那年 10 月被删除。一支名为 Archive Team 的志愿者团队花了六个月时间,在带宽允许范围内尽可能多地下载内容,并将其打包为种子文件发布出来。早年互联网的一小部分因此幸存, 只因为一群陌生人决定让它留下。而大部分早期网络内容并没有这么幸运。
本文将梳理:最初几十年里究竟有哪些内容被保留下来、什么已经永远消失,以及造成这两种结果的技术与社会原因。如果您只是想找回某个特定的旧网站,可以直接跳到最后一节, 那部分就是为您准备的。
网站的历史比你想象的更短
1991 年 8 月,Tim Berners-Lee 在 CERN 公布万维网项目,并引导人们访问 info.cern.ch。没有人对其进行归档, 当时也没有工具可用:大规模网络爬虫还要再过几年才会出现,而主动保存网站的想法在大多数人看来只是囤积癖。
Internet Archive 由 Brewster Kahle 于 1996 年 5 月创立,爬虫数据由 Alexa Internet 提供。Wayback Machine 直到 2001 年 10 月才对外开放,当时已收录 100 亿个页面。如今其收录量已超过 9000 亿。数字虽惊人, 但那段空白才是关键。1991 至 1996 年间,根本不存在系统性的归档工作。2013 年 CERN 在原始地址重建首个网站时,人们能找到的最早副本来自 1992 年 11 月。而 1991 年的原始版本, 堪称网页史上最重要的页面, 仅以截图和重建形式存世。
那五年空白期内的一切都只是侥幸存留:系统管理员的一盘备份磁带、随杂志附赠的一张光盘、某个被人忘记删除的 FTP 镜像。
谁保存了什么:档案工作者、志愿者与图书馆
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
实际承担保存工作的是四类机构,各自动机不同,覆盖范围也不同。
- Internet Archive 持续运行爬虫,并接受公众通过「Save Page Now」提交快照。它是互联网的默认记忆库,也是首选查询入口。
- Archive Team 是一个志愿者救援组织,每当有服务宣布关停便会迅速行动, 2009 年的 GeoCities、2019 年的 Google+ 和 Yahoo Groups,都是他们尽可能抢救并以种子形式发布的。
- 国家图书馆的归档工作具有选择性。英国网络档案馆自 2013 年起依据法定缴存制度运行;澳大利亚的 PANDORA 档案馆自 1996 年起持续甄选并保存具有代表性的澳大利亚网站。
- Common Crawl 自 2008 年起持续发布大规模开放爬虫数据集, 对研究者而言价值极高,但缺少直观的日历式界面,不便于普通用户浏览。
另有一个值得单独提及的来源:archive.today,自 2012 年上线以来提供按需快照服务,常常收录 Internet Archive 漏掉的页面,尤其是那些禁止 IA 爬虫抓取的内容。

网站历史中保留下来的内容:静态、公开、热门
观察保留得最好的内容,便能发现一条规律:归档总是倾向于那些爬虫能够低成本、高频次抓取到的页面。
- 纯链接的静态 HTML 页面, 爬虫的「天然口粮」。
- 直接从已抓取页面链接的图片与文件,前提是文件体积尚在合理范围内。
- 拥有大量入站链接的页面, 爬虫会顺着链接抓取,热门页面因此被反复收录。
- robots.txt 允许抓取的网站, 一行 Disallow: / 就能让所有内容隐身。
- 各种形式的文本, 压缩效率高,读取速度也快。
一个 1998 年手写的个人主页, 紫色背景、访客计数器、链接页, 通常可以完整还原,包括 GIF 在内。而一个 2008 年的在线商店,文化影响可能是前者的十倍,却往往无法恢复。可见,热度与简洁度胜过一切。
彻底消失的内容及其原因
消失的内容可以归入几个可预见的类别,其中影响最大的竟是一个纯文本文件。在 2017 年政策调整之前,Internet Archive 一直遵循 robots.txt 排除规则,并将其回溯应用, 一次文件编辑就能让多年积累的快照从公众视野中消失。域名被转卖后,新所有者一旦设置严格的 robots 文件,数十年的历史便会一夜之间沉寂。无数网站就这样从档案中消失,而数据本身其实仍然存在。
任何需要登录才能访问的内容都从未被爬取:私人论坛、早期社交网络、仅限会员的社区。Friendster 在 2011 年的改版中,一次部署便抹掉了多年积累的用户资料。动态、数据库驱动的页面至多只是被零星抓取, 爬虫只能处理 GET 链接,无法理解 POST 表单,因此搜索结果、购物车、筛选列表等对档案而言几乎从未存在过。

大体积媒体内容的命运同样不佳。RealPlayer 时代的音视频流、Java applets 以及通过各类冷门协议传输的内容,要么被跳过,要么只能抓取到残缺版本。Flash 是最著名的边缘案例:.swf 文件常被保存下来,却多年无法播放,直到 2020 年 Ruffle 模拟器问世才让其中许多重新可运行。而那些从未被收录的 Flash 作品则彻底消失。
即便是较新的网络环境,数字也令人沮丧。皮尤研究中心 2024 年的研究显示,2013 年存在的页面中已有 38% 无法访问。哈佛大学一项关于「链接腐烂」的研究发现,美国最高法院判决书中引用的 URL 已有约一半失效。保存是例外,消亡才是常态。
动态网站为何让归档失效
爬虫的工作就是抓取 URL, 仅此而已。2005 年的 phpBB 论坛或 osCommerce 商城并不是一组 URL 的集合,而是一个披着 URL 外衣的数据库,根据 viewtopic.php?t=4821&start=40 这类查询字符串即时生成页面。URL 空间几乎是无限的,爬虫只能从中抽样:抓取索引页和当月链接较多的帖子,其余一概错过。
会话与 Cookie 让情况更糟:同一 URL 对不同访客呈现不同内容,导致抓取到的可能是未登录的占位页或重定向页。此外还有一个直白的经济因素, 文本抓取与存储成本低,媒体则不然。限速的爬虫为控制成本会跳过大型文件,这正是为什么许多存档页面只剩下文字,图片原本的位置只留下灰色的破洞。
结果就是:档案通常只保存了一个网站的「骨架」, 首页、静态文章、少数高链接帖子, 而非鲜活的整体。搜索框、会员列表、结算流程:这些功能在任何有意义的层面上都从未被捕获过。
如何自己探索网站的历史
若要查看某个具体网站,操作流程很简单:
- 在 web.archive.org 输入域名。日历上方的迷你图会按年显示抓取密度, 密集的年份意味着覆盖更全面。
- 从最早的快照开始,依次往后翻阅。早期的快照能够呈现原始结构与旧 URL 模式。
- 在找特定 URL?可查询 CDX 索引,或直接将地址粘贴到 Wayback 工具栏, 关于 API 技巧的详细说明,可参阅这篇「如何找出一个网站曾有的所有页面」。
- 可用 archive.today 交叉核对 Internet Archive 遗漏的内容。
- 若需查阅 1996 年之前的资料,建议去查找运营者自建的镜像、大学收藏以及怀旧项目,而非正式档案库。
如果您想看全貌而非单一页面,可参阅我们的「搜索网站历史」与「网站历史」研究指南,其中详细介绍了日历功能、专题合集与替代性档案库。
当只是翻阅旧页已不够用时
Wayback Machine 是一间阅览室,并非还原按钮。当您真正需要把网站恢复回来, 文件、图片、可在自有域名上正常工作的内链, 手动保存做到十几页就会崩溃。右键、另存为、修复路径、再来一遍:每个区块都耗去一个下午,最终得到的只是一堆零散文件。
Restorix 正是为这类需求而生。粘贴域名,免费估算会先显示精确的存档文件数、总大小以及锁定价格,再决定是否付费。按文件数量计费,首个文件免费,并可按时间范围筛选与清理:剥离旧版统计代码与广告、链接改为相对路径、强制启用 HTTPS。重建后的网站可一键部署到您自己的主机,也可导出为结构化数据。完整流程请参阅 教程。
网站的历史虽然残缺,但只要用对工具,幸存下来的内容通常都可以恢复。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
Wayback Machine 中网站的历史最早能追溯到何时?
抓取工作始于 1996 年 Internet Archive 开始爬取之时。万维网本身诞生于 1991 年,因此最初五年的内容仅存于私人备份与重建版本中, 例如 CERN 重建的首个网站,就是基于 1992 年 11 月的副本。
早期互联网的内容是否都已存档?
并非如此。被 robots.txt 屏蔽的内容、登录后才能访问的内容、大体积媒体以及动态生成的页面,都很少被抓取。如果 Wayback Machine 和 archive.today 都没有收录,那它很可能只存于私人手中,甚至已彻底消失。
一个明显很老的网站,为什么其页面会显示「未收录」?
通常有四种原因:robots.txt 屏蔽了爬虫、该页面没有可供爬虫跟踪的入站链接、页面是动态生成的,或是域名易主后原有快照被隐藏。单凭网站年龄并不能保证其被收录。
GeoCities 上的网站都去哪儿了?
Yahoo 在 2009 年 10 月将其全部删除。Archive Team 抢救了相当一部分并以约 900 GB 的种子形式发布,Reocities 等镜像站点也保留了部分可浏览的内容。Wayback Machine 中同样收录了大量 GeoCities 页面, 但完整的官方备份从未公开。
网站所有者能否从网络档案中抹除自己的网站?
Internet Archive 会受理网站所有者的删除请求,robots.txt 的修改在历史上也曾回溯隐藏已有快照,直到 2017 年政策调整。域名交易正是以这种方式让不少档案从公众视野中消失。但仅从服务器上删除网站本身,并不会自动移除已抓取的快照。
删除自己的网站,Wayback Machine 上的记录会一起消失吗?
不会自动消失。已抓取的快照仍然可见,除非域名所有者主动提交排除申请。若想从档案中移除内容,必须主动申请, 仅将网站下线,历史记录仍会保留。
相关指南

website history
网站历史:快照、WHOIS、DNS 及各自工具
网站历史可以指存档快照、WHOIS 记录、DNS 变更或旧排名。了解哪种工具回答哪个问题, 以及如何重建丢失的网站。

search website history
购买域名前如何查询网站历史
在购买域名前查询网站历史:旧快照、所有权变更、垃圾信息包袱和商标陷阱, 一套30分钟的尽职调查工作流。

historical web
历史网络作为研究资源:哪些经得起考验
学者、记者和律师如何使用历史网络:记录保存在何处,如何判断保存质量,以及何时可将抓取内容作为证据。

wayback machine
Wayback Machine:浏览网页历史的完整指南
Wayback Machine 存档了超过 9000 亿个网页。了解爬虫、快照、日历和搜索语法的工作原理, 以及如何恢复丢失的网站。
