Скачивание из Wayback: все способы, ранжированные по трудоёмкости
От редакционной команды Restorix · 3 мая 2026 г. · 6 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Сайт пропал. Хостинг его стёр, бэкапы, это архивы с пустотой, и единственная копия на Земле лежит в Wayback Machine. Теперь вам нужно скачивание из Wayback, которое реально работает, и существует четыре способа его получить. Они варьируются от двухминутного трюка в браузере до сервиса, который делает всё за вас, а разрыв в трудозатратах между ними, огромный. Ниже разобран каждый способ с оценкой того, сколько часов он у вас отнимет, и с ошибками, о которых не пишут на лендингах.
Что вы на самом деле получаете при скачивании из Wayback
Wayback Machine не хранит ваш сайт. Она хранит ответы: один URL, один обход, один момент времени. У главной страницы может быть 10 000 снимков, а у политики конфиденциальности, два, за 2014 и 2019 годы. Скачивание из Wayback означает получение этих сохранённых ответов по одному URL за раз и сборку их во что-то, отдалённо напоминающее оригинал.
Из этого следуют два последствия. Во-первых, всё, что краулер никогда не видел, утрачено навсегда: ни базы данных, ни исходников PHP, ни админки, ни всего, что за логином. Во-вторых, каждый скачанный файл заморожен на момент обхода, который вы не выбирали. Смешайте таблицу стилей 2016 года с главной страницей 2021-го, и сайт будет выглядеть как записка с выкупом, потому что именно это вы и собрали.
Календарный вид на любой странице снимка делает это наглядным. Синие кружки отмечают обходы, а промежутки между ними на непопулярных страницах могут растягиваться на годы. Поэтому прежде чем вообще выбирать метод, выберите целевую дату: год, когда сайт выглядел так, как вам нужно. После этого каждое решение, какие снимки загружать, каким ассетам доверять, становится проще.

Способ 1: сохранить одну страницу в браузере
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Откройте снимок, нажмите Ctrl+S, выберите «Веб-страница, полностью». Готово. Для одной страницы это самое быстрое скачивание из Wayback, какое существует. Для всего, что больше примерно десяти страниц, это превращается в форму самоистязания, так что знайте, когда остановиться. Если браузер что-то испортил, откройте инструменты разработчика, найдите URL ассетов во вкладке «Сеть» и сохраните эти файлы по отдельности.
- Используйте трюк с id_: вставьте id_ после временной метки в URL снимка, чтобы получить исходный HTML ровно в том виде, в котором он был сохранён, без панели Wayback и без перезаписанных ссылок.
- Сохранённые страницы подгружают ассеты обратно с web.archive.org. Откройте файл офлайн, и половина картинок пропадёт, если вы не сохранили их отдельно.
- Перед сохранением проверьте дату снимка в календарном виде. Схватить не тот год, самая частая ошибка новичков, и архив об этом редко предупреждает.
Способ 2: скрипт wget для скачивания из Wayback
Классический приём, запустить wget в режиме зеркала на архивный URL: wget --mirror --page-requisites --convert-links https://web.archive.org/web/2019/https://example.com. wget идёт по перезаписанным ссылкам, которые добавляет Wayback, что удерживает вас внутри архива, а --page-requisites подтягивает CSS, JavaScript и изображения, нужные каждой странице.
Для сайта-брошюры на 40 страниц это можно доделать за один вечер. Заложите этот вечер на присмотр. archive.org ограничивает агрессивных клиентов, поэтому добавляйте --wait=2 между запросами и будьте готовы перезапустить команду несколько раз, когда она зависнет. Регулярка в --reject, удерживающая wget рядом с нужной временной меткой, не даст ему блуждать по двадцати годам снимков.
В итоге вы получите каталог HTML, в котором всё ещё торчит панель Wayback, временные метки внутри URL каждого ассета и тихие дыры там, где краулер пропустил файл. Превращение этой кучи в готовый к деплою сайт, это уже второй проект, и именно его люди забывают вписать в расписание.
Способ 3: скрипт против CDX API
Когда слепого обхода недостаточно, идите к первоисточнику. CDX API возвращает машиночитаемый список всех снимков для URL или домена: web.archive.org/cdx/search/cdx?url=example.com/*&output=json&filter=statuscode:200&collapse=urlkey. Один этот запрос уже полезнее часа работы wget, потому что он заранее показывает, что вообще существует, прежде чем вы что-то скачаете.
Цикл прост в Python или Node: читаете список, загружаете каждый снимок с суффиксом id_, сохраняете на диск, вежливо спите между запросами. Сила, в фильтрах. Ограничивайте по году или MIME-типу и используйте collapse=digest, чтобы отбрасывать дублирующиеся снимки: тогда каждый уникальный файл вы скачаете один раз, а не сорок.
Это метод, к которому я прибегаю в криминалистике, например, чтобы вытащить все PDF, которые компания когда-либо публиковала, или восстановить один каталог на конкретную дату. Это и настоящий программистский проект: аккуратный скрипт для среднего сайта, это выходные на написание, тестирование и перезапуск после того, как соединение отвалится в два часа ночи.

Способ 4: автоматические сервисы восстановления
Четвёртый вариант, пропустить ручную работу целиком. Сервисы, заточенные под эту задачу, опрашивают архив, скачивают все сохранённые файлы, убирают обвязку Wayback, чинят внутренние ссылки и отдают вам рабочий сайт, а не папку с осколками.
Restorix, это сервис, на который я направляю клиентов. Самой бесплатной оценки стоит ради клика: до того как вы что-либо платите, она показывает точное число архивных файлов, общий размер и зафиксированную цену. Восстановления оплачиваются за файл, причём первый файл бесплатно, а если восстановление или деплой не удались, возврат автоматически падает на ваш баланс. Без тикетов и без споров с поддержкой.
По сравнению с маршрутами «сделай сам» обмен прост и груб: небольшая фиксированная сумма в обмен на ваши выходные, ваши головняки с лимитами запросов и ваш скрипт чистки. На последних трёх проектах, что я оценивал, эта сумма выходила меньше, чем стоили бы клиенту два оплачиваемых часа.
Ошибки, которые губят скачивание из Wayback
- Игнорирование строк запроса. /page.php?id=12 и /page.php?id=13, это разные снимки разных страниц. Пропустите их, и половина блога на WordPress или форума на phpBB исчезнет.
- Слепое смешивание временных меток. Главная страница 2018 года, отрисованная с CSS 2013-го, выглядит как сломанная ксерокопия. Выберите целевую дату и держитесь в пределах нескольких месяцев от неё.
- Забыть о других хостах. Изображения на cdn.example.com или assets.example.net, это отдельные снимки под отдельными префиксами URL, и запрос только по сайту их никогда не увидит.
- Доверять старому покрытию. Архив годами уважал исключения robots.txt, так что целые разделы некоторых сайтов никогда не были сняты вообще.
- Считать, что самый новый снимок, лучший. «Позже» не всегда значит «лучше». Сайт, снятый после взлома, парковки или редиректа, стоит меньше, чем здоровый снимок двумя годами ранее.
- Сохранение перезаписанного HTML. Без суффикса id_ вы впекаете панель Wayback и ссылки на archive.org в каждую страницу, и кому-то потом придётся их вычищать.
Как выбрать подходящий способ для вашего сайта
| Способ | Трудозатраты | Стоимость | Лучше всего для | Не сработает, когда |
|---|---|---|---|---|
| Сохранение в браузере | Минуты на страницу | Бесплатно | 1–10 страниц | Нужно 200 страниц |
| Скрипт wget | Один вечер | Бесплатно | Небольшие статические сайты | Не хватает ассетов, троттлинг |
| Скрипт к CDX API | Выходные и больше | Бесплатно | Точечные выборки с фильтрами | Вы не пишете код |
| Автоматический сервис | Минуты в сумме | Небольшая фиксированная сумма | Возвращение сайта в строй | Вам нравится страдать |
Реалистичный сценарий: у клиента умер 300-страничный маркетинговый сайт без бэкапа. Способ первый стоит 300 ручных сохранений, считайте, десять часов. Способ второй, вечер плюс день на чистку. Способ третий, выходные, если вы уже пишете код. Способ четвёртый стоит фиксированную сумму, которую вы знаете заранее, а сайт возвращается очищенным, с восстановленными ссылками и готовым к деплою. Арифметика по часам получается нехитрая.
Моё правило после многих лет восстановлений: если сайт должен жить снова, сразу к способу четвёртому, потому что именно для этого Restorix и создан. Если нужна одна страница для доказательства или ностальгии, способ первый. Два средних, для тех, кому важен путь, а не пункт назначения.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Законно ли скачивание из Wayback?
Скачивание публично архивированных страниц, чтобы восстановить свой собственный сайт или для личного пользования, обычная практика и в целом несёт низкие риски. Сплошная перепубликация чужого контента, вот где начинаются проблемы с авторскими правами. Если сайт был ваш, вы на твёрдой почве.
Можно ли скачать весь сайт из Wayback Machine бесплатно?
Да, своим трудом. wget и скрипты к CDX ничего не стоят, кроме времени, а скрытая цена, чистка: перезаписанные ссылки Wayback, недостающие ассеты, сломанная навигация. Платные сервисы существуют именно потому, что на чистке бесплатные скачивания и буксуют.
Что означает id_ в URL Wayback?
Добавление id_ после временной метки указывает архиву отдать исходный файл ровно в том виде, в котором он был сохранён, без панели и без перезаписи ссылок на web.archive.org. Для любого серьёзного скачивания это обязательно.
Почему в моём скачивании не хватает картинок?
Краулер снял HTML, но не все ассеты. Лениво загружаемые изображения, фоновые картинки в CSS и всё, что спрятано за JavaScript, обычные жертвы. Попробуйте соседние временные метки: другой обход той же страницы иногда содержит нужный файл.
Почему мой скрипт постоянно получает 429 от archive.org?
Это ограничение скорости. Архив душит клиентов, которые качают слишком быстро. Снизьте до одного-двух одновременных запросов, добавьте задержку в одну-две секунды между запросами и продолжайте, а не начинайте заново. Вежливые скрипты заканчивают; агрессивные, блокируются.
Насколько далеко в прошлое уходит скачивание из Wayback?
Публичные обходы архива начинаются с 1996 года. Для небольших сайтов покрытие до примерно 2005 года жидкое, и многие URL той эпохи сохранились лишь в виде голого HTML, без картинок и таблиц стилей.
Похожие гайды

wayback machine downloader
Инструменты для скачивания из Wayback Machine: что реально работает
Честный обзор инструментов для скачивания из Wayback Machine: опенсорс-скрипты, их реальные ограничения и готовое решение, которое вернёт ваш сайт в онлайн.

wayback machine download site
Скачать целый сайт из Wayback Machine
Как скачать целый сайт из Wayback Machine: подводные камни обхода, страницы с параметрами запроса, отсутствующие ресурсы и когда автоматическое восстановление выигрывает у самодельных скриптов.

download entire website from archive org
Загрузка всего сайта из Archive.org, а не только главной страницы
Чтобы загрузить весь сайт из archive.org, вам нужны все страницы, изображения и стили. Ресурсы скрываются под разными временными метками, вот почему это происходит, а также полный чек-лист.

wayback machine restore
Восстановление из Wayback Machine: 4 ловушки и как их избежать
Восстановление из Wayback Machine может тихо провалиться: припаркованные страницы, цепочки редиректов, отсутствующие изображения, смешанные временные метки. Как распознать каждую ловушку и избежать её.
