Веб-статьи: как извлечь чистый текст с любого сайта
От редакционной команды Restorix · 7 мая 2026 г. · 7 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Однажды клиент позвонил мне в панике: агентство переделало сайт компании и просто не перенесло блог. Сорок с лишним постов, четыре года поискового веса, исчезли. У агентства не было резервной копии. Первый вопрос, который они задали, был правильным: можно ли вернуть текст статей?
Та задача, и гораздо более скромная повседневная задача сохранения одной чистой статьи с захламлённой страницы, это одно и то же умение в разных масштабах. Вот как я делаю и то и другое: какие инструменты действительно работают, как восстановить веб-статьи с сайтов, которых больше нет, и где проходят юридические границы, прежде чем вы что-либо переопубликуете.
Почему извлечение сложнее, чем кажется
На типичной новостной странице статья занимает меньше пятой части HTML. Остальное, навигация, боковые панели, баннеры cookie, всплывающие окна подписки, карусели похожих записей и скрипты отслеживания. Копирование из браузера тащит всё это за собой, или, что хуже, вставляет текст, который превращается в хаос, потому что был построен из вложенных div и span.
Обычные препятствия:
- Рендеринг JavaScript: HTML, который вы загружаете, пустая оболочка, пока не выполнятся скрипты
- Пагинация: одна статья разбита на пять URL ради показов рекламы
- Защита от ботов: проверки, которые сразу блокируют простые загрузчики
- Ленивая загрузка: изображения, которые появляются только при прокрутке
- Урезанные RSS: ленты, обрывающиеся после двух предложений и многоточия
Выбор метода зависит от масштаба: одна статья, целый сайт или неработающий сайт.
Метод 1: режим чтения для отдельных веб-статей
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Для одной страницы не нужно ничего создавать. Режим чтения Firefox (F9 или значок страницы в адресной строке) очищает страницу до заголовка, автора и основного текста. В Safari и Edge есть свои версии, Edge даже может прочитать статью вслух. Из режима чтения скопируйте в редактор или распечатайте в PDF для сохранения архивного качества.
- Откройте статью и включите режим чтения
- Исправьте заголовок и автора, если детектор ошибся
- Скопируйте в редактор или распечатайте в PDF
- Сохраните исходный URL и дату захвата вместе с текстом, позже вам понадобится подтверждение происхождения
Менее известный трюк: многие сайты поставляют стили для печати. Предварительный просмотр печати иногда выдаёт всю статью в чистом виде, даже когда режим чтения не справляется, а «Сохранить как PDF» сохраняет исходный URL в колонтитуле, если включить верхние и нижние колонтитулы в диалоге печати.
Ограничения реальны: по одной странице за раз, метаданные (автор, дата, теги) часто теряются или неверны, и метод полностью не работает на страницах с платным доступом, пагинацией или большим количеством скриптов. Pocket и Instapaper делают ту же очистку с дополнительным слоем «сохранить на потом», удобно для чтения, бесполезно для массовой обработки.
Метод 2: структурированное извлечение веб-статей
После десятка страниц ручная работа теряет смысл. Структурированное извлечение означает прогон каждой страницы через библиотеку, которая умеет находить статью внутри шаблонного кода, тот же трюк, что и в режиме чтения, но поддающийся автоматизации.
| Инструмент | Язык | Лучше всего для |
|---|---|---|
| Readability.js | JavaScript | Движок, лежащий в основе режима чтения Firefox; используйте с Playwright для страниц с рендерингом JS |
| Postlight Parser | JavaScript | Быстрое однократное извлечение с настраиваемыми правилами для каждого сайта |
| trafilatura | Python | Лучшие метаданные (автор, дата, теги); сам обходит ленты и карты сайта |
| newspaper3k | Python | Быстрые скрипты и прототипы; простой API, менее поддерживаемый |
| go-readability | Go | Массовый обход, где важна скорость |
Прежде чем писать код извлечения, проверьте два чит-кода. Во-первых, /wp-json/wp/v2/posts?per_page=100, если сайт работает на WordPress, этот URL отдаст все записи в чистом JSON, без необходимости парсинга. Во-вторых, sitemap.xml: он перечисляет URL сайта, так что вы можете составить список статей, а не обходить сайт вслепую. При обходе соблюдайте вежливость: один запрос в секунду, настоящая строка user-agent, уважайте robots.txt, удаляйте дубликаты по каноническому URL.

Ошибки извлечения, которые отнимают часы
Четыре ошибки составляют большую часть работы по очистке, которую я вижу в задачах извлечения, и все их дешевле избежать, чем исправлять:
- Доверие к определённой дате. Инструменты охотно хватают дату изменения, дату комментария или год в подвале. Проверяйте по строке автора или дате захвата в архиве.
- Потеря канонического URL. Сохраняйте его вместе с текстом. Без него вы не сможете удалить дубликаты, настроить редиректы или позже доказать происхождение.
- Извлечение страниц списков как статей. Страницы категорий и тегов выглядят как контент для детектора. Фильтруйте по шаблону URL до запуска пакетной обработки, а не после.
- Игнорирование кодировки. Сайт 2008 года в Windows-1251 превращается в кашу, если вы предполагаете UTF-8, проверяйте HTTP-заголовок charset, а не только мета-тег.
Восстановление веб-статей с неработающего сайта
Когда сайт исчез, архив становится вашим источником. CDX API Wayback Machine перечисляет все захваты по пути, example.com/blog/*, и вы можете получить последний хороший снимок каждой записи, а затем запустить те же инструменты извлечения для URL web.archive.org. Это работает, но медленно: архив ограничивает частоту запросов, старые захваты ссылаются на отсутствующие изображения, и пятьдесят статей превращаются в полдня ручного контроля.
Более быстрый путь, сначала правильно восстановить сайт. Этот сервис даёт бесплатную оценку, точное количество архивных файлов, общий размер, фиксированную цену, затем восстанавливает файлы за выбранный вами диапазон дат. Часть, которую большинство упускает: есть опция структурированного экспорта статей, которая отдаёт текст статей в XML, CSV или JSON, плюс манифест всех восстановленных файлов в JSON или SQLite. Блог 2016 года из моей вступительной истории вернулся именно так, 412 файлов, 96 МБ, записи экспортированы в CSV с заголовком, slug, датой и текстом, повторно импортированы в WordPress в тот же день. В руководстве описан весь процесс.
Ещё один источник, о котором забывают: Google отключил ссылки на кэш в 2024 году, но archive.today часто хранит страницы, пропущенные Wayback Machine, особенно новостные статьи, а Bing всё ещё отдаёт кэшированные копии для некоторых сайтов. Стоит проверить, прежде чем объявлять статью невосстановимой.

Правила авторского права перед повторной публикацией
Не юридическая консультация, просто границы, в которых реально работают профессионалы. Факты и идеи не охраняются авторским правом; охраняется их конкретное выражение. Ваши собственные статьи принадлежат вам, и вы можете делать с ними что угодно. Для чужого текста:
- Проверьте наличие лицензии. Знаки Creative Commons имеют значение: CC0 и CC-BY разрешают повторную публикацию (CC-BY требует указания авторства); CC-BY-NC запрещает коммерческое использование; отсутствие знака означает, что все права защищены.
- Получите письменное разрешение, если лицензии нет. Письмо с согласием лучше страницы теории добросовестного использования.
- Добросовестное использование, это защита в суде, а не разрешение. Оно учитывает цель, объём, характер и влияние на рынок, и цитирование целой статьи почти всегда не проходит проверку по объёму.
- Указание авторства и каноническая ссылка, это хороший тон и хорошее SEO. Они не исправляют нарушение.
- Изображения имеют собственные авторские права, отдельные от текста. Их повторное размещение требует отдельного разрешения.
Один нюанс, который кусает агентства: работа, созданная сотрудниками, обычно принадлежит компании, но работа подрядчиков может не принадлежать, если это не указано в договоре. Если вы восстанавливаете блог своей компании, подтвердите, кто на самом деле владеет текстом, прежде чем публиковать его под новым брендом.
Чек-лист повторной публикации, который обезопасит вас
- Подтвердите, что вы владеете или имеете лицензию на каждый элемент, текст и изображения отдельно
- Сохраните имя автора и дату публикации вместе со статьёй
- Установите канонический URL, если старая версия ещё где-то существует
- Настройте 301-редирект со старых URL на новые
- Обновите внутренние ссылки, чтобы они вели на живые страницы, а не на мёртвые
- Отмечайте существенные правки («обновлено в июле 2026»), а не переписывайте историю молча
Сделайте эти шесть вещей, и восстановленный блог на удивление быстро вернёт свои позиции в поиске, Google рассматривает точное восстановление по исходным URL как возвращение того же сайта, а не как новый сайт, начинающий с нуля.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Законно ли парсить веб-статьи с чужого сайта?
Для личного использования, архивирование страницы, за которую вы заплатили, сохранение руководства для офлайн-чтения, как правило, нормально. Массовое копирование чужих статей для повторной публикации, нет: текст защищён авторским правом независимо от того, насколько легко его было скачать. Условия использования добавляют договорной уровень. Владейте контентом или имейте разрешение, этот критерий решает большинство случаев.
Как быстрее всего извлечь одну веб-статью прямо сейчас?
Откройте её в Firefox и нажмите F9. Режим чтения убирает всё, кроме статьи, примерно за секунду, и оттуда вы можете скопировать её или распечатать в PDF. Никаких инструментов, никакого кода.
Можно ли восстановить веб-статьи с сайта, которого больше нет?
Да, если он был заархивирован. Wayback Machine хранит захваты большинства сайтов, у которых был хоть какой-то трафик; вы можете извлекать страницы вручную, автоматизировать через CDX API или восстановить весь сайт и использовать структурированный экспорт, чтобы получить все статьи в CSV или JSON за один проход.
Какой формат экспорта выбрать, XML, CSV или JSON?
Подбирайте под импортёр. Родной импортёр WordPress принимает XML. Рабочие процессы на основе электронных таблиц и простые скрипты лучше всего работают с CSV. Разработчики, строящие конвейеры, хотят JSON. Если сомневаетесь, берите все три, их дёшево сгенерировать, а восстановление вы делаете только один раз.
Работает ли режим чтения на каждом сайте?
Нет. Он не работает на статьях с платным доступом, многостраничных галереях и страницах, где текст появляется только после выполнения JavaScript. Для таких случаев используйте извлечение через headless-браузер или, для вашего собственного неработающего сайта, восстановление из архива с последующим структурированным экспортом.
Сохраняют ли инструменты извлечения изображения?
Большинство инструментов извлечения текста удаляют изображения или оставляют прямые ссылки, которые умирают вместе с исходным хостом. Восстановление сайта сохраняет сами файлы изображений вместе с текстом. В любом случае рассматривайте права на изображения отдельно от прав на текст, это разные авторские права.
Похожие гайды

wayback machine downloader
Инструменты для скачивания из Wayback Machine: что реально работает
Честный обзор инструментов для скачивания из Wayback Machine: опенсорс-скрипты, их реальные ограничения и готовое решение, которое вернёт ваш сайт в онлайн.

download entire website from archive org
Загрузка всего сайта из Archive.org, а не только главной страницы
Чтобы загрузить весь сайт из archive.org, вам нужны все страницы, изображения и стили. Ресурсы скрываются под разными временными метками, вот почему это происходит, а также полный чек-лист.

restore old website
Восстановите старый сайт, не воскрешая его проблемы
Как восстановить старый сайт: разобраться с устаревшим PHP, Flash и фреймами, решить, что оставить, а что модернизировать, и извлечь файлы из веб-архивов.

web cache
Веб-кэш: как он работает и зачем он нужен
Что такое веб-кэш, как работают кэши браузера, CDN, поисковых систем и архивов, и как с их помощью увидеть исчезнувшую страницу.
