Скачать целый сайт из Wayback Machine
От редакционной команды Restorix · 26 мая 2026 г. · 6 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Сохранить одну страницу из Wayback Machine, дело двух минут. Скачать целый сайт, совсем другая задача, которая может съесть все выходные, если действовать вслепую. Архив не хранит ваш сайт в виде аккуратного пакета. В нём тысячи отдельных снимков, каждый зафиксирован в своё время обхода, и собрать их обратно в единый работающий сайт, вот где большинство застревает. Это руководство разбирает подводные камни, которые действительно ломают загрузку целых сайтов, и момент, когда автоматизация перестаёт быть опциональной.
Почему скачать сайт из Wayback Machine сложнее, чем одну страницу
Страница, это один снимок. Сайт, это все URL, которые когда-либо находил краулер, каждый заархивирован по своему расписанию. У вашей главной страницы может быть 9 000 снимков. У страницы возврата товара, три, и самый свежий, возможно, датирован 2017 годом. Когда вы скачиваете сайт из Wayback Machine, вы собираете мозаику из фрагментов, которые никогда не предназначались для того, чтобы подходить друг другу.
С ресурсами всё ещё хуже. Логотип, это один снимок. Таблица стилей, другой, возможно, из другого года. Архив отдаёт каждый с переписанными URL, которые работают только внутри web.archive.org, поэтому простая копия сайта ломается, как только вы открываете её локально. Одна страница прощает эти грехи. Пятьсот страниц их умножают.
Составьте карту сайта, прежде чем что-либо скачивать
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Не начинайте с wget. Начните с CDX API и получите полный перечень того, что на самом деле хранится в архиве:
web.archive.org/cdx/search/cdx?url=example.com/*&matchType=prefix&output=json&collapse=urlkey&filter=statuscode:200
Этот один запрос покажет, сколько существует уникальных URL, какие разделы охватил краулер и где пробелы. В недавней работе, форум на phpBB 2009 года, инвентаризация показала 22 000 уникальных URL. Из них реальным контентом были, возможно, 1 400. Остальное, идентификаторы сессий, дубликаты для печати и страницы календаря, которые никто никогда не читал.
Читайте инвентаризацию как подрядчик
- Подсчитайте URL по директориям. Толстый раздел /images означает, что ресурсы сохранились; тонкий, ждите проблем.
- Проверьте разброс дат по разделам. Если блог заканчивается в 2016, а главная страница доходит до 2023, значит блог был отвязан или заблокирован, а не удалён.
- Ищите мусорные шаблоны заранее: параметры сессий, формы ответа, сортировки. Они раздувают количество и время загрузки.
- Обратите внимание на MIME-типы. Много text/html без записей изображений означает, что архив сохранил скелет, но потерял кожу.
Если хотите получить инвентаризацию, не написав ни одного запроса, бесплатная оценка в Restorix покажет точное количество архивных файлов и общий размер для домена, прежде чем вы что-то потратите. Это число меняет план. Триста файлов, это DIY-послеобеденное занятие. Тридцать тысяч, нет.

Подводные камни, которые ломают загрузку сайта из Wayback Machine
Каждый пункт из этого списка обжигал меня хотя бы раз. Ни один не очевиден, пока вы не проведёте три часа за загрузкой, а результат не будет иметь смысла.
- История robots.txt. Годами архив отказывался обходить или отдавать страницы, заблокированные robots.txt. Если предыдущий владелец неправильно его настроил, целые директории просто отсутствуют в архиве, и никакой инструмент не сможет их наколдовать.
- Разброс хостов. www.example.com, example.com, blog.example.com и старый CDN-хост, это разные наборы снимков. Префиксный запрос по одному хосту молча пропускает остальные, как и скрипт краулера.
- http против https. Одна и та же страница под обеими схемами архивируется дважды, иногда с разными ресурсами. Выбирайте вариант с лучшим покрытием, а не тот, который помните.
- Страницы, отрендеренные JavaScript. Краулер сохранил то, что мог выполнить во время обхода. Сайт на React 2019 года может вернуться как оболочка из пустых div, а реальный контент исчез.
- Дрейф временных меток. Файлы, захваченные в 2014, 2017 и 2021 годах, сшитые в один сайт, дают сломанные макеты и несогласованную навигацию. Привяжите всё к одной целевой дате.
- Хром Wayback. Снимки, отдаваемые обычно, включают панель инструментов архива и переписанные ссылки. Запрашивайте с суффиксом id_ у временной метки или планируйте удалять хром из каждого сохраняемого файла.
Параметры запроса, пагинация и другие ловушки URL
Параметры запроса, это место, где загрузка целого сайта тихо проваливается. Для архива /shop?cat=shoes и /shop?cat=hats, разные URL с разными снимками. Так же как?page=2 и?page=200. В одном магазине на WooCommerce, с которым я работал, было 4 000 архивных URL и всего 90 реальных товаров. Остальное, комбинации фильтров, сортировки и параметры отслеживания.
Стратегия механическая. Получите список CDX, сгруппируйте URL по пути до вопросительного знака и решите, какие параметры несут контент. ID товаров и пагинация: оставить. Идентификаторы сессий, UTM-метки и перестановки фильтров: отбросить. Ошибётесь в одну сторону, потеряете реальные страницы. Ошибётесь в другую, скачаете в десять раз больше мусора и заплатите за это часами.

Когда ваша загрузка сайта из Wayback Machine возвращается с дырами
Отсутствующие ресурсы, это правило, а не исключение. Ожидайте пробелов в:
- Лениво загруженные и внедрённые через JavaScript изображения, которые краулер никогда не активировал
- Фоновые изображения CSS и веб-шрифты, на которые есть ссылки внутри таблиц стилей
- Видео- и аудиофайлы, которые архив захватывает в лучшем случае непоследовательно
- Шрифты и иконки, загружаемые через сторонние наборы, которым требовался действующий API-ключ
- Всё, что отдаётся со стороннего домена, рекламной сети или из-за логина
Для каждой дыры варианты ограничены: попробуйте соседние временные метки, попробуйте варианты www и без www или http и https, либо смиритесь с потерей и восстановите ресурс заново. Вот где манифест окупается. Restorix предоставляет файл-манифест в JSON или SQLite с каждым восстановлением, так что выяснить, каких файлов не хватает, становится запросом с фильтром, а не послеобеденным перещёлкиванием страниц.
Когда перестать писать скрипты и автоматизировать
Посчитайте честно. Надёжный скрипт загрузки для беспорядочного сайта, это выходные на создание и отладку, плюс часы повторных запусков, когда archive.org ограничивает вас на файле 8 000 из 9 000. Затем начинается целый второй проект: удаление перезаписей Wayback, исправление внутренних ссылок, выбор канонического хоста, развёртывание и тестирование.
Автоматизация имеет смысл в тот момент, когда сайт должен снова работать, а не просто существовать на вашем диске. сервис восстановления сайтов выполняет загрузку, очистку и развёртывание в одной задаче: оплата за восстановленный файл, первый файл бесплатно, цена фиксируется в момент оценки, и автоматический возврат на ваш баланс, если что-то не удастся. Путь DIY всё ещё оправдан для небольших сайтов, исследовательских выгрузок и людей, которым искренне нравится головоломка. Я проходил оба пути больше раз, чем могу сосчитать, и точка безубыточности наступает быстрее, чем люди ожидают, обычно ко второму повторному запуску.
От скачанных файлов к работающему сайту
- Удалите панель инструментов Wayback и перепишите каждый URL archive.org обратно в относительный путь.
- Выберите один канонический хост, www или без www, и перенаправьте другой.
- Преобразуйте внутренние ссылки в HTTPS перед развёртыванием где-либо современном.
- Удалите мёртвые сторонние скрипты: старую аналитику, рекламные теги и социальные виджеты, которые звонят домой.
- Разверните, затем пройдите по 50 главным страницам с открытой вкладкой «Сеть» в браузере, чтобы поймать всё, что всё ещё возвращает 404.
На этом этапе всегда отказывают две вещи: контактные формы и поиск. Обе зависели от серверного кода, который архив никогда не захватывал. Замените формы на сервис размещённых форм или простую ссылку mailto, а поиск по сайту, на статический индекс или поле поиска с ограничением по поисковой системе.
Restorix включает всё это в опции восстановления: относительные внутренние ссылки, конвертация в HTTPS, удаление аналитики, развёртывание в один клик на SSH, FTP или S3, а также небольшую встроенную CMS, чтобы восстановленный сайт оставался редактируемым. Сделайте вручную или позвольте сервису сделать это; чек-лист в любом случае один и тот же. Различаются только часы.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Можно ли скачать целый сайт из Wayback Machine бесплатно?
Да, с помощью open-source скриптов и вашего собственного времени. Сама загрузка ничего не стоит; за очистку вы платите часами. Для небольшого статического сайта такой обмен приемлем. Для магазина с 10 000 URL оцените свои выходные, прежде чем браться.
Почему некоторых страниц моего сайта нет в архиве?
Обычные причины: robots.txt заблокировал краулер, на страницу нигде не ссылались там, куда краулер добрался, она требовала входа в систему или существовала лишь недолго между обходами. Инвентаризация через CDX API показывает точно, что есть, поэтому проверьте, прежде чем предполагать.
Как получить список всех архивных URL для моего домена?
Запросите web.archive.org/cdx/search/cdx?url=example.com/*&matchType=prefix&output=json. Добавьте collapse=urlkey для дедупликации по URL и filter=statuscode:200, чтобы отбросить ошибочные снимки. Результат, ваша реальная карта сайта.
Восстанавливать самый новый снимок или более старый?
Самый новый не всегда лучший. Выберите снимок того времени, когда сайт был здоров: до взлома, парковки или разбора на запчасти. Сравните несколько кандидатов по датам в календарном виде и проверьте, насколько полным выглядит каждый, прежде чем остановиться.
Архивирует ли Wayback Machine видео и загружаемые файлы?
Иногда. Крупные медиа захватываются непоследовательно, тогда как PDF и изображения сохраняются гораздо лучше. Отфильтруйте инвентаризацию CDX по MIME-типу, прежде чем обещать кому-либо, что медиатека уцелела.
Сколько времени занимает скачивание целого сайта?
Сайт из 500 страниц через вежливый скрипт: несколько часов с ограничением скорости. Десятки тысяч файлов: день или больше присмотра и повторных запусков. Автоматическое восстановление выполняется на чужой инфраструктуре, пока вы наблюдаете за прогрессом в панели управления.
Похожие гайды

download entire website from archive org
Загрузка всего сайта из Archive.org, а не только главной страницы
Чтобы загрузить весь сайт из archive.org, вам нужны все страницы, изображения и стили. Ресурсы скрываются под разными временными метками, вот почему это происходит, а также полный чек-лист.

wayback download
Скачивание из Wayback: все способы, ранжированные по трудоёмкости
Все способы скачать сайт из Wayback, ранжированные по трудоёмкости: отдельные страницы, скрипты wget, CDX API и автоматические сервисы, которые восстановят весь сайт за вас.

wayback machine restore
Восстановление из Wayback Machine: 4 ловушки и как их избежать
Восстановление из Wayback Machine может тихо провалиться: припаркованные страницы, цепочки редиректов, отсутствующие изображения, смешанные временные метки. Как распознать каждую ловушку и избежать её.

find all pages on a website
Как найти все страницы на сайте (включая удалённые)
Нужно найти все страницы на сайте, включая те, на которые никто не ссылается? Сравните карты сайта, краулеры, API Wayback CDX и экспорты из Search Console.
