网页文章:如何从任何网站提取干净的正文
作者:Restorix 编辑团队 · 2026年5月7日 · 3 分钟阅读

从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
曾有位客户慌慌张张地给我打电话:他们的代理商重新设计了公司网站,却没把博客内容迁移过来。四十多篇文章、四年的搜索权重,全部没了。代理商那边也没有任何备份。他们开口问的第一个问题倒是问对了:文章正文还能找回来吗?
那项工作, 以及日常中更小一号的、单纯从杂乱页面中保存一篇干净文章的工作, 其实是同一项技能,只是规模不同。下面是我两件事都会用到的方法:哪些工具真的管用、怎样从已经不复存在的网站中恢复文章,以及在转载任何内容之前,法律边界画在哪里。
为什么提取比想象中更难
在典型的新闻页面里,文章正文不到 HTML 的五分之一。剩下的全是导航栏、侧边栏、Cookie 横幅、邮件订阅弹窗、相关文章轮播以及追踪脚本。从浏览器里直接复制粘贴,会把这些一并拖进来, 更糟的是,粘出来的文字还会因为原始结构里嵌套了无数 div 和 span 而变得支离破碎。
常见的拦路虎:
- JavaScript 渲染:你下载下来的 HTML 只是一个空壳,脚本跑起来后才有内容
- 分页:为了多卖几次广告,一篇文章被拆成五个 URL
- 反爬墙:能瞬间识破并拦截普通下载工具的验证机制
- 懒加载:图片只有等你滚动到才加载出来
- 残缺的 RSS:只输出两句话加一个省略号就截断的订阅源
你选用的方法取决于规模:单篇文章、整个站点,还是已经死掉的站点。
方法一:阅读模式提取单篇网页文章
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
如果只是一篇文章,那就别自己造轮子。Firefox 的阅读视图(F9 键,或地址栏上的页面图标)会把页面精简为标题、作者和正文。Safari 和 Edge 也有类似功能, Edge 甚至能直接把文章读出来。进入阅读模式后,复制到你的编辑器,或者打印成 PDF 做一个归档级别的保存。
- 打开文章并触发阅读视图
- 如果识别器把标题或作者猜错了,手动修正一下
- 复制到你的编辑器,或打印为 PDF
- 把原始 URL 和抓取日期一并保存, 以后你会需要溯源信息
一个不太为人知的小技巧:很多站点自带打印样式表。即使阅读模式卡住,点一下打印预览有时反而能拿到完整干净的文章, 而且只要在打印对话框里勾上页眉页脚,'另存为 PDF' 就能在页眉里保留来源 URL。
局限也很明显:一次只能处理一页、元数据(作者、日期、标签)经常丢失或出错,遇到付费墙、分页或重度依赖脚本的页面就直接失效。Pocket 和 Instapaper 也做同样的清理工作,再叠一层稍后阅读的功能, 用来看文章还行,做批量处理就别想了。
方法二:网页文章的结构化提取
一旦超过十来页,手动操作就毫无意义了。结构化提取就是用一套库去自动识别每篇页面里的正文部分, 和阅读模式是同一招,但可以脚本化运行。
| 工具 | 语言 | 最适用场景 |
|---|---|---|
| Readability.js | JavaScript | Firefox 阅读视图背后的引擎;搭配 Playwright 处理 JS 渲染页面 |
| Postlight Parser | JavaScript | 支持单次快速提取,可按站点自定义规则 |
| trafilatura | Python | 元数据提取效果最好(作者、日期、标签);可自动抓取 Feed 和站点地图 |
| newspaper3k | Python | 适合快速写脚本和做原型;API 简单,维护较少 |
| go-readability | Go | 适合速度优先的大规模爬取 |
动手写提取代码之前,先看看两个小窍门。第一,/wp-json/wp/v2/posts?per_page=100, 如果站点用的是 WordPress,访问这个 URL 就能直接拿到全部文章,而且是干净的 JSON,根本不用爬。第二,sitemap.xml:它列出了站点所有 URL,你可以据此枚举文章,而不是盲目爬取。真要爬取的话,记得保持礼貌:每秒一个请求、用真实的 User-Agent、遵守 robots.txt、按 canonical URL 去重。

浪费时间的提取误区
我见过的提取工作里,大部分后期清理的活都源自四个错误,而它们全部都是事前避免比事后修补更省力:
- 轻信工具识别出来的日期。 提取器很可能会抓到修改日期、评论日期,或者页脚里的年份。务必和作者署名或归档快照日期交叉核对。
- 把 canonical URL 弄丢了。 务必连同正文一并保存。没有它,你就没法去重、设置跳转,也没法在日后证明内容来源。
- 把列表页当成文章提取。 分类页和标签页在检测器眼里和正文长得很像。批量跑提取之前,先按 URL 模式过滤,而不是之后。
- 忽略编码问题。 一个 2008 年用 Windows-1251 编码的站点,如果你默认按 UTF-8 处理,就会变成一堆乱码, 别只看 meta 标签,记得检查 HTTP charset 头。
从已失效站点恢复网页文章
当站点彻底消失,归档就成了你的唯一来源。Wayback Machine 的 CDX API 能列出某个路径下所有的抓取快照, 比如 example.com/blog/*, 你可以拉取每篇文章最后一版可用的快照,然后对 web.archive.org 上的 URL 跑同一套提取工具。思路可行,但相当慢:归档接口有频率限制,老快照里引用的图片经常已经丢失,五十篇文章就能耗掉你一下午的时间。
更高效的做法是先把这个站点完整恢复出来。Restorix 网站恢复服务 提供免费预估, 精确的归档文件数量、总大小、锁定价格, 然后按你指定的时间段恢复文件。大部分人忽略的一点是:它有一个 结构化文章导出 选项,可以把文章正文以 XML、CSV 或 JSON 格式交到你手上,外加一份 JSON 或 SQLite 格式的清单,列出每一个恢复出来的文件。开篇故事里那个 2016 年的博客就是这么找回来的, 412 个文件、96 MB,文章以 CSV 导出,包含标题、别名、日期和正文,当天下午就重新导入回 WordPress。完整流程可以看这份 教程。
还有一个大家常忽略的来源:Google 在 2024 年下线了缓存链接,但 archive.today 经常保留住一些 Wayback Machine 漏掉 的页面, 尤其是新闻类文章, 而 Bing 仍然为部分站点提供缓存副本。在宣布一篇文章不可恢复之前,值得先查一下。

转载前必须了解的版权规则
以下不是法律建议, 只是行业里大家实际遵循的边界。事实和观点不受版权保护;但对它们的具体表达方式受版权保护。你自己写的文章当然可以随意处置。至于别人的文字:
- 先查协议。 Creative Commons 标识很重要:CC0 和 CC-BY 允许转载(CC-BY 需要署名);CC-BY-NC 禁止商业用途;没有标识就意味着保留所有权利。
- 没有协议时,拿到书面授权。 一封写着“可以”的邮件,胜过整页的合理使用理论。
- 合理使用是法庭上的抗辩理由,不是事前许可。 法院会综合考虑使用目的、使用比例、作品性质和市场影响, 而整篇转载几乎在“使用比例”这一关就过不了。
- 署名加上 canonical 链接是基本礼貌,也是良好的 SEO 实践。 但它们并不能治愈侵权本身。
- 图片有自己独立的版权,和文字是两回事。要重新托管图片,需要另行获得授权。
一个常常坑到代理商的细节:员工在职期间产出的作品通常归公司所有,但外包人员的作品未必如此,除非合同里有明确约定。如果你要恢复的是自己公司的博客,在以新品牌名义重新发布之前,先确认文字的真正归属。
一份保你平安的转载清单
- 确认你拥有或已获授权, 文字和图片要分别确认
- 保留原作者姓名和原始发布日期
- 如果旧版本仍存在于任何地方,设置一个 canonical URL
- 把旧 URL 用 301 跳转到新地址
- 更新内链,让它们指向可访问的页面,而不是死链
- 如果有重大修改,注明“已于 2026 年 7 月更新”,而不是悄悄改写历史
把以上六件事做到位,恢复出来的博客搜索排名会回升得惊人地快, Google 把这种在原 URL 上的忠实恢复视为同一站点的回归,而不是一个新站点的从零开始。
从 Wayback Machine 恢复您的网站
数秒内免费估价 — 确认后才需付费。恢复失败将自动退款。
FAQ
抓取别人网站上的文章合法吗?
用于私人目的, 比如归档你付费购买过的页面、把一篇教程存下来离线阅读, 一般没问题。批量复制别人的文章再转载就不行了:文字本身受版权保护,和它有多容易下载无关。服务条款又在版权之上叠了一层合同约束。拥有内容或获得授权, 这一条能解决大多数争议。
现在最快提取一篇网页文章的方法是什么?
用 Firefox 打开文章,按 F9。阅读视图大约一秒内就只留下正文,之后你可以复制,也可以打印为 PDF。不用任何工具,不用写代码。
能从已经不复存在的网站中恢复文章吗?
可以,前提是它曾被归档过。Wayback Machine 存有大多数曾有一定流量的站点快照;你可以手动拉取页面,用 CDX API 写脚本爬,或者直接把整个站点恢复出来,再通过结构化导出一次性拿到所有文章,格式为 CSV 或 JSON。
导出格式该怎么选, XML、CSV 还是 JSON?
看你要导入到哪里。WordPress 的原生导入器吃 XML;以表格为主的工作流和简单脚本用 CSV 最顺手;开发者搭数据管线一般选 JSON。拿不准就三个都要, 反正生成它们几乎不费成本,而恢复操作你只会做一次。
阅读模式对所有网站都有效吗?
不是。它对付费墙文章、多页图集、以及那些只有跑完 JavaScript 才有文字的页面都无能为力。这些情况就用无头浏览器提取器, 或者如果是自己的死站,先做归档恢复,再做结构化导出。
提取工具会保留图片吗?
大多数文本提取器会去掉图片,或者只留下热链接 URL,而一旦原站点挂掉这些链接就会失效。直接恢复站点则能把原始图片文件和正文一起保留下来。无论哪种方式,图片版权和文字版权要分开处理, 它们是两套不同的版权。
相关指南

wayback machine downloader
Wayback Machine 下载工具:哪些真正好用
客观评测 Wayback Machine 下载工具:开源脚本、实际局限,以及帮你把网站重新上线的托管式方案。

download entire website from archive org
从 Archive.org 下载整个网站,而不仅仅是首页
要从 archive.org 下载整个网站,你需要每一页、每张图片和每个样式表。资源文件分散在不同的时间戳下, 原因在此,并附上完整检查清单。

restore old website
恢复旧网站,同时避免其遗留问题
如何恢复旧网站:处理古老的PHP、Flash和框架集,决定保留或现代化哪些内容,并从网络档案中提取文件。

web cache
网页缓存详解:缓存的工作原理及使用方法
什么是网页缓存,浏览器、内容分发网络、搜索引擎和存档缓存的工作原理,以及如何利用网页缓存查看已消失的页面。
