Инструменты для скачивания сайтов с Archive.org: честное сравнение
От редакционной команды Restorix · 7 июля 2026 г. · 6 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Существует три разумных способа вытащить сайт из Wayback Machine, и я использовал все на реальных проектах: HTTrack, Ruby-гем wayback-machine-downloader и его скриптовые аналоги, а также Restorix, сервис, который я рекомендую клиентам, когда сайт должен вернуться работающим, а не просто кучей файлов.
Ни один из них не является «лучшим». Они решают разные задачи за разную цену, и цена в основном измеряется часами, а не долларами. Вот что каждый из них на самом деле делает, где спотыкается и кому какой выбрать. Никакого рейтинга с привкусом партнёрства, только то, что я видел, как получалось и как нет.
Что должен уметь инструмент для скачивания сайтов с archive.org
Оценивать эти инструменты по скорости скачивания, значит упускать суть. Сложные моменты при скачивании сайта с archive.org неброские, и именно в них инструменты незаметно различаются:
- Найти каждый файл. Индекс архива, единственный полный источник; переход по ссылкам с главной страницы пропускает все потерянные страницы.
- Сопоставление ресурсов по временным меткам. Странице 2014 года может понадобиться логотип из единственного сохранившегося снимка 2012 года.
- Получение оригинальных байтов. При неаккуратной работе вы сохраняете разметку панели инструментов Wayback, встроенную в каждый HTML-файл.
- Перезапись внутренних ссылок, чтобы копия просматривалась без обращения к серверам archive.org.
- Выживание при ограничении скорости. Archive.org ограничивает нетерпеливых клиентов, и повторные попытки должны быть вежливыми и терпеливыми.
Держите эти пять пунктов в уме. Они объясняют каждую строку в таблице сравнения ниже, и большинство плохих отзывов об этих инструментах восходит к одному из них.
HTTrack: бесплатный, старой школы и всё ещё в строю
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
HTTrack, ветеран: бесплатный офлайн-браузер с открытым исходным кодом, который зеркалирует сайты с 1990-х. Укажите ему URL из Wayback Machine, и он переходит по ссылкам, сохраняя всё, что найдёт, на диск. Есть графический интерфейс для Windows, цена подходящая, и для быстрого зеркалирования небольшого сайта он действительно работает.
При использовании с archive.org оговорки накапливаются. HTTrack ничего не знает об индексе архива, он находит только страницы, доступные по ссылкам с вашего начального URL, поэтому потерянные страницы остаются позади. Он хватает тот снимок, на который перенаправляет wayback, смешивая временные метки без предупреждения. А его правила фильтрации требуют серьёзной настройки: задайте их неправильно, и ваше зеркало блога 2013 года уйдёт по ссылке на живой веб, и вы скачаете текущий сайт вместо нужного. Спросите, откуда я знаю.
Реалистичный бенчмарк: зеркалирование блога на WordPress 2012 года из 40 страниц через Wayback Machine заняло у меня около 40 минут настройки и двухчасовой автоматический обход, и я всё равно потратил ещё час на очистку папки от мусора с живого веба. Такова честная картина работы с HTTrack, дёшево, в основном автоматически, и никогда не заканчивается полностью, когда обход завершён.
- Стоимость: бесплатно.
- Усилия: час-два на изучение синтаксиса фильтров; затем зеркала работают автоматически.
- Лучше всего для: быстрых зеркал небольших, хорошо связанных сайтов, когда идеальная точность не является целью.
- Остерегайтесь: ухода на живой веб, смешанных временных меток снимков и переписанных URL от wayback, попадающих в ваши файлы.

wayback-machine-downloader и путь скриптов
wayback-machine-downloader, это Ruby-гем, который запрашивает индекс CDX архива, а затем скачивает каждый файл, перечисленный для вашего домена, опционально в пределах диапазона дат. Поскольку он читает индекс, а не переходит по ссылкам, он находит страницы, которые HTTrack никогда не увидит. Несколько Python-скриптов, плавающих на GitHub, делают ту же работу с разными флагами и разным уровнем отделки.
Компромиссы, обычные для открытого исходного кода. Вам понадобятся установленные Ruby или Python и уверенность, чтобы прочитать README. Проекты в этой нише замолкают на годы, поэтому проверьте трекер задач, прежде чем ставить дедлайн на один из них. А когда обход завершится, вам предстоит сборочная работа: внутренние ссылки всё ещё указывают на исходный домен, временные метки снимков нужно проверять на вменяемость, а любая очистка, удаление старых тегов аналитики, исправление канонических URL, конвертация в HTTPS, это ваш субботний вечер.
- Стоимость: бесплатно, плюс ваши часы.
- Усилия: полдня, если вам комфортно в терминале; сам обход затем выполняется самостоятельно.
- Лучше всего для: разработчиков и архивистов, которые хотят полного контроля над каждым байтом и получают от этого удовольствие.
- Остерегайтесь: обходов с ограничением скорости без логики повторных попыток, перезаписи ссылок, оставленной как домашнее задание, и пробелов в поддержке репозитория.
Две привычки делают путь скриптов выживаемым. Сохраните ответ CDX, с которого вы начали, он служит манифестом, когда кто-то спросит, что должно быть в папке. И запустите результат локально, прежде чем считать работу законченной: пять минут кликов по копии на localhost находят отсутствующие ресурсы быстрее любого лог-файла.
Restorix: вариант скачивания сайта с archive.org «под ключ»
Restorix находится на платном, готовом конце спектра и создан специально для восстановления с archive.org, а не для общего скрапинга. Вы вводите домен и получаете бесплатную мгновенную оценку: точное количество заархивированных файлов, общий размер и фиксированную цену. Вы выбираете диапазон дат и опции, относительные внутренние ссылки, удаление аналитики и рекламы, конвертация в HTTPS, минификация JS/CSS, канонизация www или без www, и сервис берёт на себя перечисление индекса, сопоставление ресурсов по временным меткам, ограничение скорости и перезапись ссылок.
Результат скачивается как чистая, пригодная для просмотра копия или разворачивается прямо на ваш хостинг по SSH/SFTP, FTP/FTPS или S3, с включённой небольшой однофайловой CMS для последующего редактирования восстановленных страниц. Вы платите за восстановленный файл, первый файл бесплатно, а неудачные восстановления автоматически возвращаются на ваш баланс. Подписки нет, пополнения одноразовые, картой или криптовалютой. Это не путь для любителей, и он не пытается им быть.

Инструменты для скачивания сайтов с Archive.org: бок о бок
| HTTrack | Скрипты (gem / Python) | Restorix | |
|---|---|---|---|
| Цена | Бесплатно | Бесплатно | Плата за файл, первый файл бесплатно |
| Находит несвязанные страницы | Нет, только по ссылкам | Да, читает индекс CDX | Да, читает индекс CDX |
| Сопоставление ресурсов по временным меткам | Нет | Частично | Да |
| Оригинальные байты без разметки панели инструментов | Нет | Да, с правильными флагами | Да |
| Внутренние ссылки переписаны | Частично | Вы переписываете их сами | Да, опционально относительные ссылки |
| Разворачивается на ваш хостинг | Нет | Нет | Да, SSH, FTP, S3 |
| Типичные усилия с вашей стороны | Часы настройки фильтров | Полдня плюс сборка | Около 15 минут |
| Лучше всего для | Быстрых небольших зеркал | Разработчиков, желающих контроля | Возвращения сайта в онлайн |
Прочитайте строку усилий дважды. Каждый инструмент в этом списке в конечном итоге может создать одну и ту же папку с файлами, на самом деле вы выбираете, кто сделает капризные 20% работы: вы или что-то другое.
Ещё одна строка, которую таблица не может вместить: риск. С бесплатными инструментами испорченная работа стоит вам ещё одного вечера. С платным сервисом ищите условия на случай неудачи, автоматический возврат на баланс, фиксированная цена до начала и бесплатная оценка означают, что финансовый риск неудачного восстановления практически равен нулю.
Какой выбрать?
Честный совет. Если вам нужно зеркало одного небольшого сайта для справки и вам нравятся бесплатные инструменты, HTTrack сделает это сегодня вечером. Если вы пишете код, хотите сырые файлы и у вас есть выходные, путь с гемом действительно хорош и действительно бесплатен. Если сайт, это бизнес-актив: магазин клиента на WooCommerce, форум с десятилетней историей сообщений, дело всей вашей жизни, заплатите за файл и проведите вечер за чем-то другим. Руководство показывает полный процесс восстановления до того, как вы потратите ни цента, а бесплатная оценка означает, что вы увидите точную цену, прежде чем что-либо решать.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Есть ли официальная функция скачивания сайта с archive.org?
Нет. Wayback Machine создана для просмотра отдельных снимков, и archive.org не предлагает экспорта целого сайта. Каждый массовый метод, HTTrack, скрипты-загрузчики, сервисы восстановления, это сторонний инструмент, читающий те же публичные снимки и тот же публичный индекс.
Что лучше для archive.org: HTTrack или wayback-machine-downloader?
Разные задачи. HTTrack обходит ссылки и подходит для небольших простых зеркал. wayback-machine-downloader читает индекс архива, поэтому находит несвязанные страницы и правильно обрабатывает диапазоны дат. Для чего-то больше нескольких десятков страниц подход на основе индекса выигрывает.
Сколько стоит восстановить сайт с помощью Restorix?
Вы платите небольшую фиксированную плату за восстановленный файл, первый файл бесплатно, а цена фиксируется в момент оценки, так что вы видите точную сумму для вашего конкретного сайта до того, как что-либо заплатить. Пополнения одноразовые, картой или криптовалютой, существуют промокоды. Никаких повторяющихся платежей.
Могут ли эти инструменты вернуть сайт на мой хостинг или только скачать файлы?
HTTrack и скрипты останавливаются на файлах на вашем диске; загрузка, исправление ссылок и настройка хостинга, за вами. Restorix может развернуть восстановленную копию напрямую на серверы SSH/SFTP, общий хостинг FTP/FTPS или S3 и включает простую CMS для последующего редактирования страниц.
Нужно ли мне знать все старые URL перед скачиванием?
Нет. Инструменты на основе индекса перечисляют каждый захваченный URL из CDX API, поэтому вам нужен только домен. Обходчики ссылок, такие как HTTrack, нуждаются только в начальном URL, но они пропустят всё, на что не было ссылок из места, до которого мог добраться их обход.
Похожие гайды

wayback machine downloader
Инструменты для скачивания из Wayback Machine: что реально работает
Честный обзор инструментов для скачивания из Wayback Machine: опенсорс-скрипты, их реальные ограничения и готовое решение, которое вернёт ваш сайт в онлайн.

web downloader
Сравнение инструментов для скачивания сайтов: что они сохраняют, а что ломают
Как работает скачивальщик сайтов, что реально сохраняют HTTrack, wget, SiteSucker и сохранение браузера, что каждый из них ломает, и когда восстановление, лучший выбор.

download a website from archive org
Как скачать сайт из Archive.org: 3 рабочих способа
Три проверенных способа скачать сайт из archive.org: сохранять страницы вручную, работать через CDX API или запустить автоматическое восстановление. Реалистичные оценки времени для каждого.
