Как скачать сайт из Archive.org: 3 рабочих способа
От редакционной команды Restorix · 8 июня 2026 г. · 6 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Сайт исчез. Хостинг истёк, клиент не делал резервных копий, и единственная копия осталась в Wayback Machine. Я принимал такой звонок больше раз, чем могу сосчитать, и первый вопрос всегда один: можно ли скачать сайт из archive.org и вернуть его?
Да, можно. Есть три реалистичных пути: сохранять страницы вручную, написать скрипт для CDX-индекса или доверить автоматическое восстановление сервису, который сам всё обойдёт. Они очень различаются по трудозатратам, и неправильный выбор стоит вам выходных. Вот как каждый из них реально работает, с честными оценками времени от человека, который этим зарабатывает.
Что на самом деле означает «скачать с Wayback Machine»
Wayback Machine, это не папка с сайтами, которую можно забрать одной кнопкой. Это огромный индекс отдельных снимков: каждая страница, картинка, таблица стилей и скрипт хранятся по отдельности, привязанные к моменту, когда их просканировали. Когда вы открываете старую страницу, браузер берёт HTML из одного снимка, а изображения, из нескольких других, склеивая всё на лету.
Поэтому скачать сайт, значит перебрать сотни или тысячи отдельных файлов, загрузить каждый и переписать внутренние ссылки, чтобы копия работала за пределами archive.org. Держите эту модель в голове, она объясняет, почему все описанные ниже методы работают именно так и почему ни один из них не сводится к одной кнопке «Скачать».
Способ 1: скачать сайт из archive.org постранично вручную
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Наивный подход, и иногда правильный. Открываете снимок в Wayback Machine и сохраняете каждую страницу через браузер. Для сайта-визитки на пять страниц это вполне нормально. Для чего-то большего, это медленное наказание.
- Откройте архивную страницу на нужной дате снимка.
- Используйте «Сохранить как» и выберите «Веб-страница полностью», чтобы подтянулись ресурсы.
- Повторите для каждой страницы, включая те, что доступны только из старых меню.
- Откройте сохранённый HTML и вычистите разметку панели инструментов Wayback из каждого файла.
- Исправьте или примите URL ресурсов, они всё ещё указывают на web.archive.org.
Здесь вас ждут две ловушки. Сохранённый HTML ссылается на web.archive.org для многих ресурсов, поэтому копия ломается, как только вы открываете её офлайн или у архива случается медленный день. А разметку панели инструментов, впечатанную в каждую сохранённую страницу, приходится вычищать вручную, файл за файлом. Я всё ещё использую этот метод для отдельных страниц, одному клиенту для судебного спора нужна была только их старая страница с ценами, и одно сохранение заняло две минуты. Их магазин на 300 страниц получил другое обращение.
- Реалистичные затраты: 5–10 минут на страницу, включая чистку ресурсов.
- Подходит для: до 10 страниц или чтобы забрать одну конкретную страницу для справки.
- Перестаёт работать при: десятках страниц или любой задаче, где нужна чистая оригинальная разметка.

Способ 2: скачать сайт из archive.org через CDX API
CDX API, это индексная точка входа Wayback Machine, через которую находятся все файлы, которые archive.org хранит для домена. Один запрос возвращает полный реестр в JSON:
web.archive.org/cdx/search/cdx?url=example.com/*&output=json&fl=timestamp,original,mimetype,statuscode&filter=statuscode:200&collapse=digest
Так вы получите временные метки, оригинальные URL и MIME-типы всего, что было сохранено. Параметр collapse убирает дубли одинаковых файлов, и вам не придётся скачивать один и тот же логотип 400 раз. Дальше небольшой скрипт проходит по списку и загружает каждый файл. Добавьте суффикс id_ к URL с временной меткой, например, /web/20150312145531id_/http://example.com/style.css, и archive.org отдаст оригинальные байты без своей переписанной разметки. Этот единственный суффикс, разница между чистой копией и страницей, набитой панелью инструментов.
Негероичная часть съедает ваш вечер. Archive.org душит агрессивных клиентов, поэтому скрипту нужны вежливые задержки и логика повторов, иначе вы проведёте несколько часов, глядя на ответы 429. URL со строкой запроса нужно дедуплицировать, иначе идентификаторы сессий превратят сайт на 200 страниц в обход на 9000 файлов. А после того как файлы скачаны, внутренние ссылки всё ещё указывают на исходный домен, поэтому нужен ещё проход переписывания, чтобы копия нормально открывалась офлайн.
- Реалистичные затраты: 2–4 часа на написание и отладку скрипта, если вы регулярно пишете код; выходные, если нет. Сам обход занимает 30–90 минут для нескольких сотен файлов.
- Подходит для: разработчиков, архивистов, всех, кому нужен полный контроль над каждым байтом.
- Перестаёт работать при: людях, которые никогда не открывали терминал, и дедлайнах, измеряемых часами.

Что бы вы ни написали, проверьте результат так, как это делал бы посетитель: поднимите папку через любой локальный веб-сервер и пощёлкайте по ссылкам. Битые пути к картинкам, ссылки, убегающие в живой веб, и недостающие шрифты, всё вылезает за пять минут кликов, и ужасно обнаруживается уже после того, как вы объявили работу законченной.
Способ 3: скачать сайт из archive.org автоматически
Третий путь, позволить сервису восстановления заняться обходом, сопоставлением ресурсов и переписыванием ссылок. Именно сюда я направляю клиентов, когда сайт важнее, чем учебный процесс. В сервисе восстановления сайтов вы вставляете домен и сразу получаете бесплатную оценку: точное число архивных файлов, общий размер и зафиксированную цену до оплаты. Выбираете диапазон дат, переключаете нужные опции, и восстановленная копия готова к просмотру, либо сразу заливается на ваш хостинг через SSH, FTP или S3.
- Полезные опции: относительные внутренние ссылки, вырезание старой аналитики и рекламы, минификация JS/CSS, перевод на HTTPS, канонизация www или не-www.
- Восстановление может экспортировать структурированный манифест (JSON или SQLite), чтобы вы точно знали, что вернулось.
- Неудачные восстановления автоматически возвращаются на ваш баланс, без тикетов в поддержку.
Минус очевиден: это стоит денег. Плата, за каждый восстановленный файл, первый файл бесплатно, цена фиксируется на момент оценки. Для личного блога можно с удовольствием написать скрипт самому. Для приносящего доход WooCommerce-магазина клиента, который должен быть онлайн уже сегодня вечером, эта сумма обычно самая дешёвая строка во всём инциденте. Деплои также включают небольшой однофайловый CMS, чтобы мелкие правки текста после восстановления не требовали повторной загрузки.
Время и усилия, рядом
| Способ | Ваше время | Технические навыки | Оптимальный размер |
|---|---|---|---|
| Сохранение страниц вручную | 5–10 мин на страницу | Не требуются | 1–10 страниц |
| Скрипт для CDX API | 3–6 часов суммарно | Уверенное владение кодом | 10–1000 страниц |
| Автоматическое восстановление | Около 15 минут кликов | Не требуются | Любой размер, особенно 100+ страниц |
Заметьте: таблица измеряет ваше время, а не машинное. Скрипт или сервис может жевать крупный обход часами, но жуёт, пока вы спите. Дефицитный ресурс при любом восстановлении, вечер того, кто его делает, поэтому его я и оцениваю.
Ошибки, которые сжигают целые вечера
- Доверять сохранению браузера для целых сайтов. Вы пропустите каждую страницу, которую не открыли вручную, а на старых сайтах страницы прячутся в местах, о которых вы забыли.
- Забыть про модификатор id_ и потом гадать, почему в каждом HTML впечатана панель инструментов Wayback.
- Молотить archive.org параллельными запросами. Вас задушат, и работа на час растянется на четыре.
- Пропустить этап переписывания ссылок. Копия выглядит нормально, пока вы куда-нибудь не кликнете.
- Считать, что сохранена каждая страница. Сначала проверьте инвентарь CDX, чтобы пробелы были известной величиной, а не сюрпризом в конце.
Какой способ выбрать?
До десяти страниц, сохраняйте вручную и смиритесь с дефектами разметки. Вы пишете код и хотите контроль, соберите скрипт для CDX и заложите вечер. Сайт нужен чистым и быстро, без превращения в архивиста на полставки, выбирайте автоматический путь: инструкция проведёт через полное восстановление за несколько минут, а бесплатная оценка покажет число файлов и цену до любых обязательств.
И последнее: какой бы путь вы ни выбрали, выбирайте сейчас. Archive.org, подарок, но у него бывали и сбои, и юридическое давление, и «заберу попозже», именно так сайты теряются дважды.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Скачивание сайта из archive.org бесплатно?
Сам архив бесплатен для просмотра, ручное сохранение и скрипт для CDX стоят только вашего времени. Сервисы автоматического восстановления берут плату за каждый восстановленный файл; Restorix показывает точную зафиксированную цену в бесплатной оценке до оплаты, а первый файл бесплатен.
Законно ли скачивать сайт из archive.org?
Скачать свой сайт или сайт клиента с его разрешения, стандартная практика, и именно так поступает большинство восстановлений. Для чужого контента копия годится для личного пользования или исследования, а вот перепубликация защищённого авторским правом материала, которым вы не владеете, может создать проблемы. Сомнения, повод спросить юриста, а не комментаторов.
Почему сохранённая страница всё ещё грузит картинки с web.archive.org?
Потому что Wayback Machine переписывает URL ресурсов в HTML так, чтобы они указывали на её собственные серверы, а сохранение через браузер сохраняет эти абсолютные URL. Загрузка файлов с модификатором id_ или проход переписывания ссылок после, дают самодостаточную копию.
Можно ли скачать сайт из archive.org без кода?
Да. Ручное сохранение через браузер вообще не требует кода, а сервисы автоматического восстановления берут скрипты на себя. Только путь через CDX API действительно требует программирования.
Сколько времени занимает скачивание сайта из archive.org?
Ручное сохранение, 5–10 минут на страницу. Скрипт для CDX, несколько часов настройки, затем 30–90 минут обхода для среднего сайта. Автоматическое восстановление занимает минуты вашего времени; ждут машины.
Похожие гайды

download entire website from archive org
Загрузка всего сайта из Archive.org, а не только главной страницы
Чтобы загрузить весь сайт из archive.org, вам нужны все страницы, изображения и стили. Ресурсы скрываются под разными временными метками, вот почему это происходит, а также полный чек-лист.

archive.org download website
Инструменты для скачивания сайтов с Archive.org: честное сравнение
Честное сравнение инструментов для скачивания сайтов с archive.org: HTTrack, скрипты wayback-machine-downloader и Restorix. Реальные затраты, усилия и работа с ресурсами.

wayback machine downloader
Инструменты для скачивания из Wayback Machine: что реально работает
Честный обзор инструментов для скачивания из Wayback Machine: опенсорс-скрипты, их реальные ограничения и готовое решение, которое вернёт ваш сайт в онлайн.

restore website from archive.org
Восстановление сайта из Archive.org: своими руками или заказать?
Стоит ли восстанавливать сайт из Archive.org самостоятельно или лучше довериться профессионалам? Честное сравнение затрат, времени, навыков и рисков, а также алгоритм принятия решения.
