Archive.org 下载格式:WARC、CDX 与单文件
作者:Restorix 编辑团队 · 2026年6月28日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
你找到了抓取文件,点击下载,结果发现一个 900 MB 的.warc.gz 文件,电脑上什么软件都打不开。欢迎来到 Archive.org 文档最匮乏的部分:格式。网站只提供原始抓取数据,而原始数据需要你自备工具。
三种格式覆盖了几乎所有你会下载的内容:WARC 文件、JSON CDX 输出与普通单文件。下面将说明每种格式的实质、适用场景以及如何将其变为有用之物, 包括当你只想恢复旧网站时的捷径。
Archive.org 下载的实际内容是什么
又是两种存储世界的划分。项目下载提供成品文件, PDF 就是 PDF,ISO 就是 ISO。Wayback 端的下载则提供网页抓取数据:抓取时 HTTP 响应的快照,以及描述这些响应的索引。那些令人困惑的格式都来自第二个世界,此外还有一个单文件逃生口连接两者。
规划时文件大小很重要。一个抓取集合中的单个 WARC 段压缩后约 1 GB。一个中型网站的 CDX 列表可能有 5 万行 JSON。单文件嘛,就是一个文件。应在开始传输前而非传输后将格式与任务匹配, 因为拿错了而重新下载 1 GB 数据是每个人都该避免的教训。
WARC:原始抓取格式
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
WARC(Web ARChive,ISO 标准 28500)是一个将记录串联起来的容器。每条记录代表一次抓取的 HTTP 交互:响应头后紧跟精确的负载字节,以及抓取时间和目标 URL 等元数据。记录有多种类型, response、resource、metadata、warcinfo, 文件几乎总是以 gzip 压缩形式提供,每个 gzip 成员包含一条记录,方便工具无需解压整个档案即可定位。
- 内容未经渲染或清理。你得到的是爬虫所见的一模一样的字节,包括 404 页面和重定向链。
- 一个 WARC 包含抓取中成千上万通常不相关的 URL, 你的网站可能只占文件的 2%。
- 你需要工具来读取它:使用 Python 的 warcio 库进行提取,或使用 ReplayWeb.page 和 pywb 将其回放为可浏览的页面。
使用 warcio 提取是一个过滤循环:打开档案,跳过目标 URL 不在你域名内的记录,将负载按原始路径写入磁盘,去重相同的摘要。50 行 Python 代码, 或者花一个漫长的夜晚去理解为什么有人愿意为这个付费。
实际上从哪里获取 WARC?两个地方。Archive Team 救援抓取和 Internet Archive 抓取集合将其作为普通项目文件提供, 在项目的下载框中查找.warc.gz。如果你曾委托或导出自己的抓取,返回的也是 WARC。它是网页存档界的集装箱:丑陋、标准化,且无处不在。

JSON CDX:索引,而非内容
CDX 是 Wayback Machine 的卡片目录。向 web.archive.org/cdx/search/cdx?url=example.com&output=json 发起查询,会返回一个 JSON 数组,其中每一行描述一次抓取:urlkey、timestamp、原始 URL、mimetype、statuscode、digest 和字节长度。完全没有页面内容, 只是一个精确的菜单,逐次列出存在的内容。
每次查询有两个参数不可或缺:filter=statuscode:200 去除重定向和错误页面,collapse=digest 移除相同内容的重复抓取。在某个客户的 WooCommerce 商店中,这两个参数将 3.8 万原始行缩减为 4,100 个真实唯一页面。这个列表成为了恢复计划, 也成为了价格估算的依据。
值得了解的查询技巧:添加 matchType=prefix 以覆盖路径下的所有 URL,使用 from=2008&to=2012 限定年份。像 url=example.com/* 这样的通配符已隐含对整个域名的前缀匹配。从窄处开始, 对大型网站进行未过滤的域名查询会返回数 MB 的 JSON 并卡死浏览器标签页。
- 范围界定:网站的多少内容曾被抓取,以及在哪几年。
- 缺口分析:找出从未被抓取的图片目录和 CDN 主机。
- 批量获取列表:将时间戳加 URL 对输入下载器,每个使用一次 id_ 请求。
- 估算:Restorix 读取同样的 CDX 数据来为恢复定价, 文件数量、总大小、锁定价格、预先透明。

单文件:最简单的 Archive.org 下载
第三种格式几乎算不上一种格式:直接获取一个原始文件。对于项目,就是下载框中的文件链接。对于快照,就是 id_ 技巧, 在时间戳后插入 id_,如 web.archive.org/web/20130501000000id_/http://example.com/logo.png,Wayback Machine 会返回未修改的负载,没有工具栏,也没有重写的标记。
当你确切知道缺少什么时使用单文件:未被抓取的样式表、PDF 价格表、客户一直问的主图。我每个项目都会建一个临时文件夹存放这些文件。但你不应该用这种方式重建整个网站, 手动进行 4,000 次 id_ 获取正是一个需要脚本的典型场景。
两种常见失败模式。快照方面,id_ 仅当确切 URL 被捕获时才有效, 先检查 CDX 索引,不要猜测 URL。项目方面,直接 URL 模式 archive.org/download/{identifier}/{filename} 稳定且可用脚本处理,但包含空格的文件名需要正确进行 URL 编码,否则 wget 会对明明存在的文件返回 404。
你需要哪种 Archive.org 下载格式?
| 格式 | 包含内容 | 最佳用途 | 工具 |
|---|---|---|---|
| WARC (.warc.gz) | 批量原始 HTTP 响应 | 完整抓取、离线存档 | warcio, pywb, ReplayWeb.page |
| JSON CDX | 仅抓取元数据 | 范围界定、缺口分析、获取列表 | 任意 HTTP 客户端加脚本 |
| Single file / id_ | 单个原始负载 | 定向缺失资源 | 浏览器或 wget |
| Item download | 成品文件(PDF、ISO、MP3) | 书籍、软件、媒体 | 无需, 点击即用 |
网站恢复的诚实依赖链是:先 CDX,再 WARC 或 id_ 获取,最后用单文件修补缺口。跳过 CDX 步骤,你就会下载 1 GB 的抓取数据却仍然遗漏半个网站。项目下载完全独立于这个链条, 它们是成品,如果你需要的是书籍或驱动程序,停止阅读,直接点击下载。
处理已下载的内容
每个人都会踩一次的坑。gzip 压缩的 WARC 是多成员文件, 简单的 gunzip 可以工作,但流式读取器不能停在第一个成员处。摘要在不同抓取中会重复,因此在计数文件前要去重,否则总数会不准确。2004 年的字符编码不是 UTF-8;在必须解码前保持字节原样。抓取的 HTML 中每个被 Wayback 重写的 URL 仍然指向 web.archive.org,直到你将其改回。
在提取前规划输出结构:镜像原始 URL 路径,保留说明每个负载来自哪条记录的清单,永远不要覆盖你可能需要的变体。Restorix 可以在每次恢复中导出这种清单(JSON 或 SQLite), 当手工处理时,你就会明白为什么存在这个功能。
或者完全跳过格式折磨
以上所有内容都是可以学习的,但没有哪一项值得企业主花周末时间来做。网站恢复服务 正是为此而生:它读取 CDX 数据,拉取抓取文件,去重,重写链接,交付一个可运行的网站。免费估算显示存档文件数量、总大小以及锁定价格,然后才需付费, 第一个文件免费恢复,之后按文件付费,如果任何文件失败则自动退款保持平衡。
恢复选项与上述痛点一一对应:相对内部链接而非 archive.org URL,HTTPS 转换,剥离旧的分析和广告,保留 301 重定向。从恢复面板一键部署到 SSH/SFTP、FTP/FTPS 或 S3,捆绑的 CMS 位于 /webarchive-cms.php, 随机生成的密码,默认开启安全模式, 意味着你可以编辑恢复的网站而无需接触任何 WARC 工具代码。格式是档案管理员的事。你想要的是你的网站回来。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
什么是 WARC 文件,如何打开?
WARC 是一个 ISO 标准的容器,包含抓取的 HTTP 响应, 头部加上精确的负载字节,通常经过 gzip 压缩。使用 Python 的 warcio 库打开以提取文件,或使用 ReplayWeb.page 或 pywb 将其回放为可浏览的页面。双击无效;没有原生的桌面查看器。
JSON CDX 输出中的字段含义是什么?
每一行是一次抓取:urlkey(规范化 URL)、timestamp(抓取时间,yyyyMMddhhmmss)、original(抓取时的 URL)、mimetype、statuscode、digest(内容哈希, 相同的摘要表示相同的字节)和 length(压缩记录大小)。它描述抓取;本身不包含页面内容。
如何获取未经 Wayback 重写 HTML 的原始文件?
使用 id_ 修饰符:在任何快照 URL 的时间戳后直接插入,存档会返回未修改的负载, 没有工具栏,没有重写的链接。适用于页面、图片、CSS 等任何被抓取的内容。
能否将 Archive.org 下载的内容转换回可运行的网站?
可以,但需要努力:通过 CDX 枚举抓取,从 WARC 或 id_ 获取中提取负载,重写链接,修补缺失资源,然后部署。对于少量页面,这是一个有趣的夜晚。对于真正的网站,像 Restorix 这样的恢复服务可以自动化整个链路,并在收费前显示价格。
一个典型网站的 Archive.org 下载有多大?
通常比你想的要小。一个五年的 200 页宣传网站所有抓取总和通常为 200-800 MB;去重后,唯一内容可能只有 60 MB。CDX 列表会告诉你下载前的真实数据, 始终先进行范围界定。
相关指南

download archive org
如何从 Archive.org 下载:资源、快照及更多
下载 Archive.org 内容的每种实用方法, 资源文件、批量 CLI 拉取以及 Wayback 网页快照, 以及如何为你的任务选择合适的方式。

archive.org download website
Archive.org 网站下载工具:一份诚实的对比
一份诚实的 archive.org 网站下载对比:HTTrack、wayback-machine-downloader 脚本和 Restorix。真实成本、所需精力与资源处理方式。

wayback download
Wayback 下载:按所需精力排出每一种方法
所有 wayback 下载方法按精力成本排序:单页保存、wget 脚本、CDX API,以及全自动帮你重建整个站点的服务。

restore website from archive.org
从 Archive.org 恢复网站:自己动手还是全托管服务?
从 Archive.org 恢复网站,应该自己动手还是付费使用全托管服务?本文从成本、时间、技能和风险四个维度进行客观对比,并提供一套决策框架。
