Инструменты для скачивания из Wayback Machine: что реально работает
От редакционной команды Restorix · 9 мая 2026 г. · 6 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Если вы ищете способ скачать сайт из Wayback Machine, то найдёте одни и те же инструменты, которыми все пользуются уже лет десять, и кладбище заброшенных репозиториев на GitHub. Некоторые из этих инструментов действительно работают. Но у всех у них один и тот же потолок. Это обзор, который я хотел бы получить перед своей первой работой по восстановлению: что на самом деле делают опенсорс-скрипты, где они останавливаются и что использовать вместо них, когда сайт нужно снова поднять в онлайне.
Что на самом деле делает инструмент скачивания из Wayback Machine
Любой загрузчик из Wayback Machine, это одна и та же машина под разной обёрткой. Он запрашивает у CDX API список снимков, перебирает их и сохраняет каждый файл по его временной ссылке. Лучшие добавляют фильтры по дате и типу файла, а также логику повторных попыток на случай, когда archive.org начнёт ограничивать запросы. Ни один из них не подключается к какой-то секретной резервной копии вашего сайта. Они просто собирают тот же публичный архив, который вы можете открыть в браузере прямо сейчас.
Это различие важнее любого списка функций. Загрузчик наследует все пробелы в архиве: страницы, которые никогда не были проиндексированы, изображения, которые не были сохранены, директории, закрытые из-за неправильно настроенного robots.txt в 2015 году. Инструмент может получить только то, что существует.
Цифры тоже быстро растут. Сайт на 200 страниц, это легко 2 000 файлов, если считать изображения, стили и скрипты. При одном вежливом запросе в секунду это больше получаса чистого скачивания, без учёта повторов, без троттлинга, без файлов, которые вернут 404, потому что архив потерял их много лет назад.
Варианты из опенсорса
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
В каждом обсуждении на форумах всплывают три имени, и не зря:
- wayback-machine-downloader, Ruby-гем. Самый известный из всех. Одна команда, wayback_machine_downloader http://example.com --from 2015 --to 2019, и он наполнит папку./websites всеми подходящими снимками. Поддерживает параллельность и фильтрацию по расширению файлов.
- waybackpack, инструмент на Python. Скачивает снимки, разложенные по временным меткам, что удобно для получения одного конкретного снапшота страницы, но меньше подходит для зеркала всего сайта.
- HTTrack, направленный на URL снимка. Это вообще не инструмент для архивов. Он переходит по переписанным ссылкам, которые Wayback добавляет на страницы, и тянет за собой всё дерево снимка. Грубо, иногда эффективно на маленьких сайтах, и совершенно теряется при работе с query-параметрами.
Все три бесплатны. Все три поддерживаются в темпе хобби-проектов. И все три выдают вам кучу файлов. Что делать дальше, уже ваша проблема, и в этой фразе заключено процентов восемдесят того, что пойдёт дальше. Перед установкой любого из них загляните в открытые issue в репозитории. Десять минут там расскажут вам больше, чем любой обзор.

Чего ожидать от бесплатного скрипта для скачивания из Wayback Machine
Настройте ожидания заранее, до запуска. Типичная первая сессия с бесплатным загрузчиком из Wayback выглядит так: тридцать минут борьбы с установкой Ruby или Python, десять минут обнадёживающего прогресса, а затем archive.org начинает отвечать ошибками 429, и всё замедляется до ползучего темпа. Сайт на 5 000 файлов при вежливых скоростях, это работа на ночь, а ночные задания тихо падают в три часа ночи.
Реалистичный первый запуск
- Установите рантайм и сам инструмент. Разберитесь с конфликтами версий, о которых никто не пишет в README.
- Запустите небольшой тест на одной директории сайта, чтобы проверить формат вывода.
- Запустите полное скачивание и понаблюдайте за первыми сотнями файлов.
- Упёршись в лимиты, снизьте параллельность, перезапустите и надейтесь, что логика возобновления сработает.
- Откройте выходную папку и обнаружьте мусор, который скачали вместе с золотом.
Выходные данные всегда нуждаются в сортировке. Если вы плохо настроили фильтры, получите каждый снимок каждого URL: мусор с utm-метками, версии для печати, страницы ошибок, которые всё равно вернули статус 200. И если инструмент не скачал варианты id_, оригинальные неизменённые байты, все HTML-файлы придут с переписанными ссылками и тулбаром Wayback прямо внутри.
Ещё один сюрприз, организация. Большинство скриптов сваливают всё в пути с временными метками, которые повторяют структуру архива, а не вашу исходную файловую систему. Восстановление реального дерева папок и переименование файлов обратно к серверным именам, это ручная работа, которую никто не закладывает в план.
Ограничения, в которые вы упрётесь
- Никакой логики восстановления. Загрузчик просто скачивает файлы. Он не убирает тулбар Wayback, не чинит внутренние ссылки, не выбирает канонический хост и не переводит ничего на HTTPS.
- Никакого интеллекта дедупликации. Одно и то же изображение, сохранённое под шестью временными метками, станет шестью файлами, если вы сами не схлопнете их по хешу содержимого.
- Лимиты запросов. Если давить слишком сильно, archive.org ограничит вас или вообще заблокирует на какое-то время. Повторные запуски, нормальная часть рабочего процесса, а не признак ошибки.
- Гниение зависимостей. Скрипты, привязанные к старым версиям Ruby или Python, ломаются на современных системах. Прежде чем что-то ставить, загляните на дату последнего коммита в репозитории.
- Никакой поддержки. Когда инструмент ломается, трекер issue, это и есть служба поддержки, и последний ответ там может быть двухлетней давности.
- Никакого финиша. Когда скрипт завершает работу, у вас на руках папка. Превращение этой папки в работающий хостящийся сайт, это второй проект сопоставимого размера.

Готовое решение как альтернатива
Альтернатива возне со скриптами, сервис, который рассматривает скачивание как первый шаг восстановления, а не как всю работу целиком. Сервис Restorix начинается с бесплатной оценки: точное количество файлов в архиве, общий размер и зафиксированная цена, ещё до того, как вы потратите хоть цент. Дальше сервис скачивает всё, чистит и может сразу задеплоить на ваш хостинг через SSH, FTP или S3.
Детали заточены именно под эту задачу. Платите за каждый восстановленный файл, причём первый, бесплатно. Если восстановление или деплой не удаётся, возврат автоматически уходит на ваш баланс, без обращения в поддержку. Опции восстановления вырезают аналитику и рекламу, переписывают ссылки в относительные пути и принудительно включают HTTPS. Деплой включает компактную однофайловую CMS со своим сгенерированным паролем администратора, так что восстановленный сайт остаётся редактируемым. Никаких подписок: вы пополняете баланс и тратите его.
Когда загрузчик из Wayback Machine, это не тот инструмент
Скрипт-загрузчик, правильный выбор для офлайн-архивов, исследовательских датасетов и спасения папки со старыми PDF. Он не подходит, когда:
- Сайт должен вернуться в онлайн и выглядеть при этом правильно
- Тот, кто делает работу, никогда не откроет терминал
- Архив содержит десятки тысяч URL, половина из которых, мусор с query-строками
- Есть дедлайн: ребрендинг, юридический запрос, клиент, стоящий над душой
В этих случаях скрипт получается не дешевле сервиса. Он просто прячет счёт в ваших рабочих часах. Оценка Restorix хотя бы называет реальную цену заранее, прежде чем вы потратите выходные, чтобы узнать это на собственном горьком опыте. Ничто из этого не делает скрипты плохими. Просто у них есть должностная инструкция, и эта инструкция заканчивается на папке.
Как выбрать
| Ваша ситуация | Подходящий инструмент | Почему |
|---|---|---|
| Нужен один снимок для справки | Браузер плюс трюк с id_ URL | Две минуты, без установки |
| Маленький сайт, вы уверенно работаете с CLI | гем wayback-machine-downloader | Бесплатно, проверено, хорошие фильтры |
| Конкретные файлы в большом объёме | CDX API плюс свой скрипт | Полный контроль над фильтрацией |
| Сайт должен снова жить | Restorix | Скачивание, очистка и деплой за один заход |
Выбирайте по конечной цели, а не по способу скачивания. Если цель, папка с файлами, бесплатные инструменты своё дело делают и всегда будут делать. Если цель, сам сайт, пропустите стадию с папкой и сразу идите к тому, что восстанавливает его.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Есть ли официальный загрузчик для Wayback Machine?
Нет. Internet Archive поддерживает Wayback Machine и предоставляет CDX API, но не выпускает официального инструмента для массового скачивания. Каждый инструмент в этой нише, сторонний и построен на тех же публичных endpoint'ах, к которым вы можете обращаться сами.
Безопасен ли Ruby-гем wayback-machine-downloader?
Это давно существующий опенсорс-проект, и он безопасен в обычном смысле: прочитайте код, ставьте из канонического репозитория и с подозрением относитесь к пакетам-дублёрам с похожими именами. Больший практический риск, устаревший форк, который молча ломается на середине большого сайта.
Почему моё скачивание застряло на полпути?
Почти всегда из-за троттлинга. archive.org отвечает агрессивным клиентам ошибками 429. Снизьте параллельность, добавьте задержки между запросами и возобновите. Большинство инструментов умеют подхватывать с того места, где остановились, так что остановка стоит времени, а не прогресса.
Может ли загрузчик скачать страницы, защищённые паролем, или удалённые страницы?
Защищённые паролем, нет: краулер не прошёл дальше логина, и скачивать нечего. Удалённые, да: именно от удаления в живом вебе и защищает архив, при условии, что снимок был сделан до удаления.
Платные приложения-загрузчики лучше бесплатных скриптов?
Иногда это те же бесплатные скрипты с прикрученным интерфейсом. Судите по результату, а не по цене: получаете ли вы оригинальные id_-файлы, нормальную дедупликацию и чистые ссылки, или папку с переписанным HTML. Сервис восстановления вообще снимает этот вопрос, выдавая готовый сайт вместо файлов.
Как превратить скачанные файлы обратно в работающий сайт?
Уберите переписанные ссылки Wayback, сделайте внутренние ссылки относительными, выберите канонический хост, затем задеплойте и протестируйте. Или доверьте все четыре шага сервису восстановления, именно для этого такие сервисы и существуют.
Похожие гайды

wayback download
Скачивание из Wayback: все способы, ранжированные по трудоёмкости
Все способы скачать сайт из Wayback, ранжированные по трудоёмкости: отдельные страницы, скрипты wget, CDX API и автоматические сервисы, которые восстановят весь сайт за вас.

wayback machine download site
Скачать целый сайт из Wayback Machine
Как скачать целый сайт из Wayback Machine: подводные камни обхода, страницы с параметрами запроса, отсутствующие ресурсы и когда автоматическое восстановление выигрывает у самодельных скриптов.

restore website from wayback machine
Восстановление сайта из Wayback Machine: полное руководство
Восстановление сайта из Wayback Machine от начала до конца: выбор нужного снимка, настройка параметров восстановления и развёртывание рабочего сайта с CMS менее чем за час.
