Загрузка всего сайта из Archive.org, а не только главной страницы
От редакционной команды Restorix · 15 июля 2026 г. · 7 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Сохранить главную страницу может кто угодно. Главная страница, это простая часть. Именно 4000 файлов за ней отличают «я скачал копию» от «у меня действительно есть сайт». Когда меня просят загрузить весь сайт из archive.org, главная страница обычно уже лежит на рабочем столе, а таблица стилей, нет.
Эта статья посвящена слову «весь». Что на самом деле включает в себя полная копия, почему архив разбрасывает ваши ресурсы по разным временным меткам за многие годы, и чек-лист, который вы можете запустить в конце, чтобы доказать, что вы получили всё, а не просто надеяться на это.
Что означает «весь», когда вы загружаете весь сайт из archive.org
Полная копия состоит из четырех уровней, и большинство людей останавливаются на первом. HTML для каждой существовавшей страницы. Ресурсы, на которые ссылается каждая страница: изображения, таблицы стилей, JavaScript, шрифты, PDF, видео. Внутренние ссылки, переписанные так, чтобы копия работала самостоятельно, не опираясь на серверы archive.org. И манифест того, что было захвачено, чтобы пробелы были задокументированы, а не обнаружены позже клиентом.
- Страницы: каждый URL, который когда-либо видел краулер, а не только те, что в главном меню. Старые сайты прячут целые разделы за забытыми ссылками в футере.
- Ресурсы: изображения, CSS, JS, шрифты и файлы для скачивания, на большинстве сайтов их в пять раз больше, чем страниц.
- Ссылки: переписаны на относительные пути, иначе ваша копия будет работать только до тех пор, пока работает archive.org.
- Манифест: список всех файлов, которые у вас есть, превращающий «кажется, я скачал всё» во что-то проверяемое.
Количество файлов удивляет людей. Скромный корпоративный сайт на 50 страниц обычно содержит 400-800 файлов. Форум phpBB 2009 года с аватарами пользователей и вложениями может насчитывать десятки тысяч файлов. Планируйте по количеству файлов, а не страниц.
Также есть разница между копией для просмотра и копией для развертывания. Копии для просмотра нужны только файлы и рабочие ссылки. Копия, которую вы собираетесь снова разместить на хостинге, требует большего: согласованные канонические URL (выберите www или без www), готовые к HTTPS ссылки и удаление мертвого груза вроде десятилетних скриптов аналитики. Решите, что из двух вы создаете, прежде чем начать, потому что переделка любой из них утомительна.
Почему ресурсы хранятся под разными временными метками
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Wayback Machine не делает снимок всего сайта за один день. Ее краулеры загружают все, до чего могут дотянуться, когда могут дотянуться. Ваша главная страница 2014 года может ссылаться на логотип, последний раз захваченный в 2012 году, таблицу стилей, захваченную шесть раз за пять лет, и главное изображение, которое никогда не было захвачено. Когда вы просматриваете эту страницу, archive.org незаметно подставляет ближайший снимок, который у нее есть, для каждого ресурса. Вот почему страница выглядит нормально в вашем браузере, хотя ее части разбросаны по целому десятилетию.
Из этого следуют два вывода. Во-первых, не существует единой «временной метки сайта», на которую вы можете направить загрузчик, полная загрузка берет каждый файл из его лучшего снимка. Во-вторых, трюк с ближайшим снимком скрывает пробелы: wayback с радостью подставит изображение 2016 года на вашу страницу 2014 года, не упоминая об этом. Это безвредно для обычного просмотра, но стоит знать об этом, если вам важно, действительно ли восстановленная страница относится к 2014 году.
Заархивированная страница, это коллаж. HTML, изображения и CSS были заморожены в разные моменты, и архив склеивает их заново каждый раз, когда кто-то их просматривает.

Любой инструмент или скрипт, который вы используете, должен иметь стратегию для этого. Ленивая стратегия, загрузить всё по одной временной метке, именно то, как вы получаете страницу, полную битых значков изображений, потому что половина ресурсов просто не имеет снимка на той неделе. Правильная стратегия, пофайловая: брать каждый ресурс из его ближайшего хорошего снимка в пределах вашего диапазона дат.
Как загрузить весь сайт из archive.org: начните с инвентаризации
Прежде чем загружать хотя бы один файл, составьте список того, что на самом деле есть в архиве. CDX API дает вам полный реестр для домена: каждый захваченный URL с его временными метками, типом MIME и статусом HTTP. Отфильтруйте по statuscode 200, сверните дубликаты контента, и у вас будет реалистичный список для загрузки, а не догадки.
Изучите инвентаризацию перед загрузкой, и вы узнаете неприятные вещи заранее. В задаче с форумом phpBB список CDX показал 11 000 захваченных URL, и около 3 000 из них были одним и тем же GIF-аватаром, сохраненным с разными строками запроса. Сворачивание дубликатов превратило пугающую задачу в обычную. Тот же список также показывает страницы, которые вообще никогда не были захвачены, и ни один метод загрузки в мире не сможет их вернуть. Лучше узнать об этом в первый же день.
Сгруппируйте оставшиеся файлы по типу MIME, и появится форма задачи: сколько HTML-страниц, сколько изображений, сколько JavaScript, есть ли PDF или видео, о которых стоит беспокоиться. Эта группировка определяет как порядок загрузки, так и финальную проверку полноты.
Чек-лист для загрузки всего сайта из archive.org без пробелов
- Получите инвентаризацию CDX для домена, отфильтрованную по захватам HTTP 200, охватывающую весь ваш диапазон дат.
- Сверните дубликаты контента, чтобы идентичные файлы загружались один раз, а не сотни.
- Сгруппируйте список по типу MIME: сначала HTML-страницы, затем CSS, JS, изображения, шрифты, документы, медиа.
- Загрузите каждый файл из его лучшего снимка, используя модификатор id_ для получения исходных байтов без внедренной разметки wayback.
- Перепишите внутренние ссылки на относительные пути, чтобы копия работала на любом хосте, включая ваш ноутбук.
- Запустите папку локально и пройдитесь по ней кликами. Битые ссылки, отсутствующие изображения и 404 ошибки шрифтов появятся в течение нескольких минут.
- Сравните итоговое количество файлов с инвентаризацией и запишите, чего не хватает и почему.

Последний шаг, тот, который все пропускают, и он отличает резервную копию от кучи файлов. Манифест превращает «кажется, я скачал всё» в список, который можно проверить. Restorix встраивает это: бесплатная оценка сообщает точное количество заархивированных файлов и общий размер до начала работы, а восстановление может экспортировать манифест в формате JSON или SQLite для каждого файла, которое оно вернуло, так что полнота, это число, а не ощущение.
Пробелы, с которыми вы все равно столкнетесь
- Страницы, которые краулер никогда не находил. Если ничто в публичном интернете не ссылалось на страницу, wayback, вероятно, никогда ее не видел.
- Исключения robots.txt. Старые сканирования полностью пропускали запрещенные пути, а некоторые сайты намеренно блокировали архивацию.
- Контент, отрисовываемый JavaScript. Исторически краулеры сохраняли HTML-оболочку, а не то, что скрипты создавали после.
- Входы в систему, корзины и результаты поиска. Все, что находится за POST-запросом или сессией, это стена, через которую краулер не мог пройти.
- Шум в URL. Идентификаторы сессий и параметры отслеживания раздули инвентаризацию тысячами дубликатов «страниц», которые после дедупликации сводятся к нескольким реальным.
Ни одно из этих явлений не является ошибкой вашего метода, это дыры в самом архиве. Ценность инвентаризации в том, что она показывает вам эти дыры до того, как вы пообещаете кому-то полное восстановление.
Когда вы все же находите дыры, задокументируйте их. Одностраничная заметка со списком двенадцати страниц, которые никогда не были захвачены, видео, которое существует только в виде миниатюры, и раздела форума, заблокированного robots.txt, превращает неловкий сюрприз в управляемое ожидание. Клиенты прощают отсутствие файлов. Они не прощают, когда обнаруживают это сами.
Ценность полной копии
Если сайт, это магазин клиента или форум сообщества с десятилетней историей постов, то частичная загрузка, это ответственность, замаскированная под резервную копию. Либо выделите время на самостоятельное прохождение чек-листа, либо поручите сканирование, сопоставление временных меток, переписывание ссылок и создание манифеста инструменту, созданному именно для этой задачи. Оценка ничего не стоит, а альтернатива, обнаружить 300 отсутствующих изображений после запуска сайта.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Могу ли я загрузить весь сайт из archive.org в один клик?
Сам archive.org не предлагает экспорт всего сайта, он создан для просмотра отдельных снимков. Результаты в один клик достигаются с помощью инструментов, которые перебирают индекс архива и загружают каждый файл: скрипты вроде wayback-machine-downloader или сервисы восстановления, такие как Restorix, которые также обрабатывают ресурсы, переписывание ссылок и манифест.
Почему изображения отсутствуют после загрузки всего сайта из archive.org?
Обычно по одной из двух причин. Либо изображение никогда не сканировалось, и копии нигде не существует, либо ваш инструмент загрузил страницу по одной временной метке, а единственный сохранившийся снимок изображения находится под другой. Сопоставление ресурсов между разными временными метками решает второй случай; первый не решит ничто.
Архивирует ли Wayback Machine каждую страницу сайта?
Нет. Она архивирует то, до чего могли добраться ее краулеры: страницы, на которые кто-то ссылается, разрешенные robots.txt, отрисованные без входа в систему или тяжелого JavaScript. Глубокие темы форумов, страницы фасетного поиска и административные разделы обычно отсутствуют. Инвентаризация CDX показывает точно, что существует, до начала работы.
Сколько файлов обычно включает загрузка полного сайта?
Больше, чем ожидают люди. Скромный корпоративный сайт на 50 страниц часто содержит 400-800 файлов, если посчитать изображения, таблицы стилей, скрипты и шрифты. Форумы и магазины насчитывают десятки тысяч. Количество файлов, а не страниц, определяет время и стоимость загрузки.
Включает ли архив PDF, видео и другие файлы для скачивания?
Часто да. Архив хранит документы и медиа, до которых мог добраться, а индекс CDX перечисляет их по типу MIME наряду со страницами. Большие видео являются исключением, они сканировались непоследовательно, поэтому проверяйте их в инвентаризации, а не предполагайте, что они сохранились.
Похожие гайды

download a website from archive org
Как скачать сайт из Archive.org: 3 рабочих способа
Три проверенных способа скачать сайт из archive.org: сохранять страницы вручную, работать через CDX API или запустить автоматическое восстановление. Реалистичные оценки времени для каждого.

archive.org download website
Инструменты для скачивания сайтов с Archive.org: честное сравнение
Честное сравнение инструментов для скачивания сайтов с archive.org: HTTrack, скрипты wayback-machine-downloader и Restorix. Реальные затраты, усилия и работа с ресурсами.

find all pages on a website
Как найти все страницы на сайте (включая удалённые)
Нужно найти все страницы на сайте, включая те, на которые никто не ссылается? Сравните карты сайта, краулеры, API Wayback CDX и экспорты из Search Console.

wayback download
Скачивание из Wayback: все способы, ранжированные по трудоёмкости
Все способы скачать сайт из Wayback, ранжированные по трудоёмкости: отдельные страницы, скрипты wget, CDX API и автоматические сервисы, которые восстановят весь сайт за вас.
