Wayback Machine 与网络历史遗址:旧互联网的栖息地
作者:Restorix 编辑团队 · 2026年7月4日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
2009 年 10 月,雅虎关闭了 GeoCities。数百万手工搭建的个人主页, MIDI 音乐、写着「施工中」的 GIF 动图、纪念早已被遗忘的电视节目的祭坛页, 在短短几个月的通知期后被标记删除。一个名为 Archive Team 的志愿者团队在那几个月里以雅虎服务器允许的最快速度疯狂抓取,并将成果以种子文件形式发布。正是这场救援,让网络历史遗址成为你今天仍能亲自造访、而不仅仅停留在记忆中的地方。
搜索词可能很笨拙, wayback machine、webhistorical web sites,词序可能乱七八糟, 但背后的疑问其实很简单:旧互联网保存在哪里,现在还能看到吗?能。下面就是这些保存点的导览:从拥有数千亿次抓取的 Wayback Machine,到一个可以让你在仿真的 Netscape Navigator 浏览器里浏览 1997 年网页的网站。文末还有实用的部分:如何把一段历史从博物馆的架子上取下来,放回你自己的域名上线。
什么算作网络历史遗址?
人们常把三类东西混为一谈。第一类,大型爬虫档案馆, Wayback Machine 以及它那些国家级图书馆的同类, 按计划对网页进行快照。第二类,救援合集:GeoCities、Tripod、AOL Hometown 等已经死去的平台,由志愿者在关站前批量抢救并重新托管。第三类,活体博物馆:像 oldweb.today 这类项目,不只是保存页面,而是复现浏览那个年代网页的真实体验,包括浏览器当年的外观细节。
这种需求并非出于情怀。皮尤研究中心 2024 年的一项研究显示,2013 年存在过的网页中,有 38% 在十年后已无法访问。网页消失并不是因为有人宣布历史结束了,而是因为信用卡过期了、公司被收购了、CMS 升级出错了。网络历史遗址是为这种没有纸质版的媒介兜底的安全网。
值得保存的内容通常分为几类:
- 2010 年前手写的 HTML, 表格布局、间隔 GIF、留言板
- 已消亡的平台:GeoCities、Tripod、Angelfire、MySpace 博客、Google+
- phpBB 和 vBulletin 上的论坛社区,往往是某项小众爱好唯一的记录
- 早于社交媒体的早期博客和图片博客
- 已消失的小型商业网站和俱乐部网站, 那些别人没有归档的地方史
Wayback Machine 如何成为最大的网络历史遗址收藏
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
Internet Archive 由 Brewster Kahle 于 1996 年创立,并在 2001 年向公众开放了 Wayback Machine。它如今保存着数千亿次网页抓取,仍然是「这个网站五年前长什么样」这一问题的默认答案。日历视图能让人一眼看出抓取密度;时间地图列出某个 URL 的每一次快照;Save Page Now 让任何人都能即时归档眼前的页面,这也是为什么突发新闻发生后,相关的近期网页能在几分钟内被收录。
有两个小技巧值得知道。在 URL 的时间戳后面加上 id_, 例如 web.archive.org/web/20090601id_/http://example.com, 就能获得与抓取时完全一致的原始文件,没有档案馆注入的横幅和改写后的链接。CDX API 则能列出某 URL 模式下所有的抓取记录,这也是专业人员在动手之前盘点整个已死网站的方式。
抓取的缺漏同样重要。Wayback Machine 历来遵守 robots.txt,因此一些老站点的覆盖很稀薄。重度依赖 JavaScript 的页面往往只抓到了外壳,没有抓到内容。托管在其他域名上的图片和文件则经常被遗漏。当某次抓取看起来残缺时,第一反应是试试早几个月或晚几个月的版本, 不同日期的覆盖质量差异巨大。
GeoCities 与拒绝让它消亡的拯救项目
GeoCities 在 1999 年被雅虎收购时,是全网访问量第三的网站。十年后雅虎将其关闭,Archive Team 的紧急抓取成为志愿者完成的、最大规模的数字保存行动之一。这些数据如今保存在 oocities.org 和 geocities.ws 等重新托管被救页面的网站上,以及 GifCities, Internet Archive 上专门搜索该合集中动图 GIF 的引擎。Richard Vijgen 的 Deleted City 把整个档案渲染成一张可缩放的地图,连「街区」都保留了下来;Cameron's World 则把它混剪成致敬拼贴。
两个衍生项目值得特别一提。One Terabyte of Kilobyte Age,由 Olia Lialina 和 Dragan Espenschied 维护的研究博客,多年来持续发布来自该合集的截图与评论文章, 是旧互联网最接近策展项目的东西。而 2013 年成立的 Neocities 则是活着的继承者:它不是档案馆,而是免费托管平台,让人重新手写个人主页,GeoCities 风格自然也在其中。

GeoCities 留下的教训令人不安:只要托管在别人那里,就没有什么是永久的,无论公司多大。雅虎曾是互联网的巨人,这个平台的寿命恰好只比通知期长那么一点。
oldweb.today:在还原时代的浏览器中浏览旧网页
1997 年的网页是为 Netscape Navigator 4 或 Internet Explorer 5 写的。用现代浏览器打开,框架会塌掉,小程序会失效,字体被替换,<blink> 标签就这么静静地待着不闪, 现代渲染引擎拒绝执行。oldweb.today 由 Webrecorder 的 Ilya Kreymer 开发,它的解决方案是在你的浏览器里运行仿真的老式浏览器,再从 Internet Archive 和几个国家级网络档案馆中取页面喂给它。你可以选择 Mosaic、Netscape 或早期 IE,输入 URL 和年份,就能看到那一年网页「真的感觉到的样子」。
乍听像是噱头,但用于研究时就不一样了。间隔 GIF 的布局只有在当年的屏幕尺寸下才合理。为 IE4 写的 DHTML 菜单在现代引擎里毫无反应。如果你研究、引用或重建老站,用它们当年设计的浏览器来渲染,看到的才是标本本身,而不只是标本的照片。同一个团队开发的 ArchiveWeb.page 则走向另一端:它把你当前的浏览过程录制成标准 WACZ 文件,让今天你在意的网页成为他人未来精心保存的历史。
Wayback Machine 之外:更多值得了解的网络历史遗址
Wayback Machine 规模最大,但并非唯一。严肃的研究, 以及严肃的还原工作, 会交叉比对多个档案馆,因为每个爬虫看到的只是互联网的不同切面。
| 档案馆 | 擅长领域 | 使用方法 |
|---|---|---|
| archive.today (archive.ph) | 按需快照;对 JavaScript 密集型网页和新闻页面覆盖强 | 粘贴 URL;浏览或保存单个页面 |
| Arquivo.pt | 葡萄牙语网络,并提供归档页面的全文检索 | 网页界面与开放 API |
| UK Web Archive | 由大英图书馆依呈缴制度对英国网络进行抓取 | 开放合集在线查阅;完整档案需在图书馆阅览室访问 |
| Common Crawl | 以 PB 计的月度抓取,免费提供数据集 | 原始 WARC 文件;需自备工具 |
| Memento Time Travel | 按日期同时检索多个档案馆 | 一次查询自动跳转至最近的一次抓取 |
| Library of Congress Web Archives | 策展式主题合集, 选举、事件、网络文化 | 在 loc.gov 上浏览和搜索 |
国家级图书馆在这里值得被认真对待。呈缴制度意味着大英图书馆、法国国家图书馆及其他机构会系统性地抓取本国域名下的网站, 常常涵盖那些 Internet Archive 很少甚至从未抓取过的地方网站和政府网站。
从 Wayback Machine 还原网络历史遗址
逛博物馆是一回事。有时候一段历史重要到值得让它重新运转起来:你俱乐部 2003 年的网站、一个已停更的开源项目文档、去世亲人的主页。去年就有一位客户带着这样的需求来找我, 她已故父亲运营的一个图片博客,自 2014 年起就一直离线。家人希望它能在一个周年纪念日回到原本的域名上。
- 找到最完整的抓取。 使用日历视图并对比多个日期;最新的不一定是文件最全的。不同抓取之间,图片损坏的情况也不一样。
- 在动手前先拿到真实清单。 Restorix 的免费估算 会读取你域名的归档数据,返回准确的归档文件数量、总大小和一个锁定价格, 付款之前就能看到。
- 选择还原选项。 日期范围选择让你停留在网站最好的年代;剥离旧统计代码、广告和 iframe 能去掉 2008 年那种第三方垃圾;相对路径内部链接和 HTTPS 转换让结果可以部署到任何环境。
- 还原。 按文件计费,外加一笔小额固定费用,首个文件免费,没有订阅, 只支持一次性余额充值。
- 部署与维护。 一键部署可将还原后的网站推送到你的 VPS、虚拟主机或 S3;内置的单文件 CMS 让家人, 或俱乐部秘书, 不用学 Git 也能改错别字。
就那个图片博客而言,估算结果是 1,140 个文件、210 MB,还原耗时不到一小时,网站现在托管在便宜的静态主机上,一年的花费还不到一束鲜花。失败的还原会自动退款到余额,所以风险差不多跟看一张收据一样令人兴奋。完整的 wayback 还原 流程有详细文档,想先了解细节也可以直接看。

指向博物馆的链接 vs 自己拥有展品
引用或一次性参考时,链接到一条 Wayback 抓取完全没问题。当内容具有持续价值时,还原更划算:搜索流量应落在你自己的域名上,稳定性由你掌控,并且不依赖任何单一档案馆的政策, 档案馆确实会应要求删除内容,Wayback Machine 也不例外。我的原则是:脚注用链接,值得再失去一次的东西用还原。
指向一个档案馆的链接是别人替你履行的承诺;一次还原是把副本握在自己手中。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
网络历史遗址和 Wayback Machine 是同一回事吗?
不是。Wayback Machine 是规模最大的单一收藏,但这个词涵盖所有保存老网站的地方:GeoCities 镜像这类被救平台的档案、oldweb.today 这类活体博物馆、各国国家图书馆的网络档案馆,以及 Common Crawl 这类研究数据集。交叉比对多个来源是标准做法,因为每个爬虫抓取到的只是互联网的不同切面。
今天还能浏览 GeoCities 吗?
可以。oocities.org 和 geocities.ws 重新托管了 Archive Team 2009 年救下的页面;GifCities 用来检索合集中的动图 GIF;oldweb.today 可以在仿真的当年浏览器中展示 GeoCities 的抓取页面。做不到的是在 geocities.com 上访问它, 雅虎的原版已彻底消失。
从网络档案馆还原老网站合法吗?
还原自己的网站是清楚的。还原别人的网站在法律上处于灰色地带:归档的文本、图片和代码仍归原作者所有。保存与私人研究通常被容忍;把他人的内容当作自己的重新发布则不被允许。如果能找到原作者,就去问一下, 根据我的经验,他们通常会因为有人在乎而感到高兴。
为什么老的抓取里图片和页面会缺失?
爬虫当时没抓到它们, 可能是其他域名上的资源、robots.txt 屏蔽,或者干脆是在上一次抓取之后才上线的页面。可以试试目标日期前后几个月的抓取;不同快照之间的覆盖率差异很大。对于还原工作,按日期范围还原可以拉取最完整的一批文件,而不必赌某一天。
网络历史档案馆最早能追溯到什么时候?
Internet Archive 的抓取始于 1996 年。大多数国家网络档案馆始于 2000 年代初中期,Common Crawl 的数据集始于 2008 年。1996 年起的任何公开内容都有相当概率在某个地方幸存;1996 年之前的网络则大多只剩截图和记忆。
相关指南

historical web
历史网络作为研究资源:哪些经得起考验
学者、记者和律师如何使用历史网络:记录保存在何处,如何判断保存质量,以及何时可将抓取内容作为证据。

wayback machine
Wayback Machine:浏览网页历史的完整指南
Wayback Machine 存档了超过 9000 亿个网页。了解爬虫、快照、日历和搜索语法的工作原理, 以及如何恢复丢失的网站。

website history
网站历史:快照、WHOIS、DNS 及各自工具
网站历史可以指存档快照、WHOIS 记录、DNS 变更或旧排名。了解哪种工具回答哪个问题, 以及如何重建丢失的网站。

wayback restore
Wayback恢复:五步找回丢失的网站
通过五个简单步骤完成Wayback恢复:找到正确的快照,付款前获取准确价格,下载重建文件,上传到您的托管空间。
