Форматы загрузки Archive.org: WARC, CDX и отдельные файлы
От редакционной команды Restorix · 28 июня 2026 г. · 6 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Вы нашли обход, нажали «Скачать» и теперь смотрите на 900-мегабайтный файл с расширением.warc.gz, который ни одна программа на вашем компьютере не открывает. Добро пожаловать в наименее документированную часть Archive.org: форматы. Библиотека выдаёт сырые данные захвата, а сырые данные захвата предполагают, что у вас есть собственные инструменты для работы с ними.
Три формата покрывают почти всё, что вы когда-либо скачаете: WARC-файлы, вывод JSON CDX и простые отдельные файлы. Вот что каждый из них из себя представляет, когда он нужен и как превратить его во что-то полезное, включая лайфхак для тех, кто просто хочет вернуть свой старый сайт.
Что на самом деле содержит загрузка Archive.org
Снова два мира хранения. Загрузки элементов дают готовые файлы, PDF это PDF, ISO это ISO. Загрузки со стороны Wayback Machine дают данные веб-захвата: HTTP-ответы, замороженные на момент обхода, плюс индексы, описывающие их. Все запутанные форматы приходят из второго мира, плюс есть запасной вариант с одним файлом, который объединяет оба.
Размеры важны для планирования. Один сегмент WARC из коллекции обхода весит около 1 ГБ в сжатом виде. Список CDX для сайта среднего размера может содержать 50 000 строк JSON. Один файл, ну, один файл. Подбирайте формат под задачу до начала передачи, а не после, перекачивать гигабайт, потому что вы скачали не то, это обряд посвящения, который лучше пропустить.
WARC: сырой формат захвата
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
WARC (Web ARChive, стандарт ISO 28500), это контейнер, объединяющий записи. Каждая запись, это один захваченный HTTP-обмен: заголовки ответа, затем точные байты полезной нагрузки, плюс метаданные, такие как время захвата и целевой URL. Записи бывают разных типов, response, resource, metadata, warcinfo, и файлы почти всегда поступают в gzip, по одной записи на элемент gzip, чтобы инструменты могли выполнять поиск без распаковки всего архива.
- Ничего не отображается и не очищается. Вы получаете побайтно то, что видел краулер, включая страницы 404 и цепочки перенаправлений.
- Один WARC содержит тысячи часто несвязанных URL из одного обхода, ваш сайт может составлять 2% файла.
- Вам нужны инструменты для чтения: библиотека Python warcio для извлечения или ReplayWeb.page и pywb для воспроизведения в виде просматриваемых страниц.
Извлечение с помощью warcio, это цикл фильтрации: откройте архив, пропустите записи, чей целевой URL не относится к вашему домену, запишите полезные данные на диск, зеркально отражая исходные пути, удалите дубликаты по дайджесту. Пятьдесят строк на Python, или один долгий вечер изучения того, почему люди платят за это.
Где взять WARC-файлы? Два места. Спасательные обходы Archive Team и коллекции обходов Internet Archive поставляют их как обычные файлы элементов, ищите.warc.gz в блоке загрузки элемента. И если вы когда-нибудь закажете или экспортируете собственный обход, вы получите WARC. Это контейнер мира веб-архивирования: уродливый, стандартизированный и повсеместный.

JSON CDX: индекс, а не содержимое
CDX, это карточный каталог Wayback Machine. Запросите web.archive.org/cdx/search/cdx?url=example.com&output=json и получите массив JSON, где каждая строка описывает один захват: urlkey, timestamp, original URL, mimetype, statuscode, digest и длину в байтах. Никакого содержимого страницы, только точное меню того, что существует, захват за захватом.
Два флага окупаются при каждом запросе: filter=statuscode:200 отбрасывает перенаправления и страницы ошибок, а collapse=digest удаляет дубликаты захватов одинакового содержимого. На одном магазине WooCommerce клиента эти два флага сократили 38 000 сырых строк до 4 100 реальных уникальных страниц. Этот список стал планом восстановления, и оценкой стоимости.
Полезные хитрости запросов: добавьте matchType=prefix, чтобы охватить все URL в пределах пути, и используйте from=2008&to=2012 для ограничения по годам. Подстановочный знак url=example.com/* уже подразумевает префиксное совпадение по всему домену. Начинайте с узкого запроса, нефильтрованный запрос домена на большом сайте возвращает мегабайты JSON и зависшую вкладку браузера.
- Оценка объёма: какая часть сайта была захвачена и в какие годы.
- Анализ пробелов: поиск каталогов изображений и CDN-хостов, которые никогда не были обойдены.
- Списки массовой загрузки: передавайте пары «метка времени+URL» своему загрузчику, по одному id_-запросу каждый.
- Оценки: Restorix использует те же данные CDX для расчёта стоимости восстановления, количество файлов, общий размер, фиксированная цена, предоплата.

Отдельные файлы: простая загрузка с Archive.org
Третий формат, это едва ли формат: один исходный файл, полученный напрямую. Для элементов это ссылка на файл в блоке загрузки. Для снимков это трюк id_, вставьте id_ после метки времени, например web.archive.org/web/20130501000000id_/http://example.com/logo.png, и Wayback Machine вернёт нетронутую полезную нагрузку без панели инструментов и переписанной разметки.
Используйте отдельные файлы, когда вы точно знаете, чего не хватает: таблица стилей, которая не загрузилась, PDF-прайс-лист, изображение-герой, о котором клиент продолжает спрашивать. Я держу папку с такими файлами для каждого проекта. Чего не стоит делать, так это собирать целый сайт таким образом: 4 000 ручных id_-запросов, это скрипт, который просится на свет.
Два ожидаемых режима отказа. Со стороны снимков id_ работает только в том случае, если этот конкретный URL был захвачен, сначала проверьте индекс CDX, а не угадывайте URL. Со стороны элементов прямой шаблон URL archive.org/download/{идентификатор}/{имя_файла} стабилен и поддаётся скриптованию, но имена файлов с пробелами требуют правильного URL-кодирования, иначе wget выдаст 404 на файл, который явно существует.
Какой формат загрузки Archive.org вам нужен?
| Формат | Содержимое | Лучше всего для | Инструменты |
|---|---|---|---|
| WARC (.warc.gz) | Сырые HTTP-ответы массово | Целые обходы, офлайн-архивы | warcio, pywb, ReplayWeb.page |
| JSON CDX | Только метаданные захвата | Оценка объёма, анализ пробелов, списки загрузки | Любой HTTP-клиент плюс скрипт |
| Отдельный файл / id_ | Одна исходная полезная нагрузка | Целевые недостающие ресурсы | Браузер или wget |
| Загрузка элемента | Готовые файлы (PDF, ISO, MP3) | Книги, ПО, медиа | Не требуется, нажми и скачай |
Честная цепочка зависимостей для восстановления сайта: сначала CDX, затем WARC или id_-запросы, и в последнюю очередь отдельные файлы для закрытия пробелов. Пропуск шага CDX, это способ скачать гигабайт данных обхода и всё равно пропустить половину сайта. Загрузки элементов находятся вне этой цепочки: это готовые продукты, и если вам нужна книга или драйвер, прекратите читать и нажимайте.
Работа с загруженным
Подводные камни, на которые попадаются все хотя бы раз. Сжатые WARCs являются многокомпонентными, наивная распаковка gunzip работает, но потоковые читатели не должны останавливаться на первом компоненте. Дайджесты повторяются в разных захватах, поэтому дедуплицируйте перед подсчётом файлов, иначе ваши итоги будут лгать. Кодировки символов 2004 года, это не UTF-8; храните байты как байты, пока не придётся декодировать. И каждый URL внутри захваченного HTML, переписанный Wayback Machine, всё ещё указывает на web.archive.org, пока вы не перепишете его обратно.
Планируйте структуру вывода до извлечения: зеркально отражайте исходные пути URL, ведите манифест того, какая полезная нагрузка пришла из какой записи, и никогда не перезаписывайте вариант, который может понадобиться позже. Restorix может экспортировать именно такой манифест (в JSON или SQLite) при каждом восстановлении, делая это вручную, вы поймёте, зачем эта функция существует.
Или вообще избегайте возни с форматами
Всё вышеописанное можно изучить, но ничто из этого не является хорошим использованием выходных владельца бизнеса. Сервис восстановления сайтов существует именно для этого уровня: он читает данные CDX, извлекает захваты, дедуплицирует, переписывает ссылки и выдаёт вам рабочий сайт. Бесплатная смета показывает количество файлов в архиве, общий размер и фиксированную цену до оплаты, первый файл восстанавливается бесплатно, далее вы платите за файл, автоматический возврат остатка в случае сбоя.
Варианты восстановления соответствуют описанным выше проблемам: относительные внутренние ссылки вместо archive.org-URL, преобразование в HTTPS, удаление старой аналитики и рекламы, сохранение перенаправлений 301. Развёртывание в один клик через SSH/SFTP, FTP/FTPS или S3 из панели восстановления, а встроенная CMS по адресу /webarchive-cms.php, случайно сгенерированный пароль, безопасный режим по умолчанию, позволяет редактировать оживлённый сайт, не касаясь инструментов WARC. Форматы, для архивистов. Вы хотите вернуть свой сайт.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Что такое WARC-файл и как его открыть?
WARC, это ISO-стандартный контейнер захваченных HTTP-ответов: заголовки плюс точные байты полезной нагрузки, обычно в gzip. Откройте его с помощью библиотеки Python warcio для извлечения файлов или воспроизведите в виде просматриваемых страниц с помощью ReplayWeb.page или pywb. Двойной щелчок ничего не даст; нативного настольного просмотрщика не существует.
Что означают поля в выводе JSON CDX?
Каждая строка, это один захват: urlkey (канонизированный URL), timestamp (время захвата, yyyyMMddhhmmss), original (URL в том виде, в котором он был обойдён), mimetype, statuscode, digest (хэш содержимого, одинаковые дайджесты означают одинаковые байты) и length (сжатый размер записи). Он описывает захваты; сам не содержит содержимого страниц.
Как получить исходный файл без переписанного Wayback HTML?
Используйте модификатор id_: вставьте его сразу после метки времени в любом URL снимка, и архив вернёт немодифицированную полезную нагрузку, без панели инструментов и переписанных ссылок. Работает для страниц, изображений, CSS, всего, что было захвачено.
Можно ли преобразовать загрузку Archive.org обратно в рабочий сайт?
Да, с усилиями: перечислите захваты через CDX, извлеките полезные данные из WARC или id_-запросов, перепишите ссылки, залатайте недостающие ресурсы, затем опубликуйте. Для горстки страниц это весёлый вечер. Для настоящего сайта сервис восстановления вроде Restorix автоматизирует всю цепочку и покажет цену до списания средств.
Каков типичный размер загрузки сайта с Archive.org?
Меньше, чем вы боитесь, обычно. Пятилетний сайт-визитка из 200 страниц часто составляет 200-800 МБ во всех захватах; после дедупликации уникальное содержимое может быть 60 МБ. Список CDX показывает реальные цифры до того, как вы что-то скачаете, всегда сначала оценивайте объём.
Похожие гайды

download archive org
Как скачать с Archive.org: элементы, снимки и не только
Все практичные способы загрузки контента с Archive.org, файлы элементов, массовые загрузки через CLI и веб-снимки Wayback Machine, и как выбрать подходящий для вашей задачи.

archive.org download website
Инструменты для скачивания сайтов с Archive.org: честное сравнение
Честное сравнение инструментов для скачивания сайтов с archive.org: HTTrack, скрипты wayback-machine-downloader и Restorix. Реальные затраты, усилия и работа с ресурсами.

wayback download
Скачивание из Wayback: все способы, ранжированные по трудоёмкости
Все способы скачать сайт из Wayback, ранжированные по трудоёмкости: отдельные страницы, скрипты wget, CDX API и автоматические сервисы, которые восстановят весь сайт за вас.

restore website from archive.org
Восстановление сайта из Archive.org: своими руками или заказать?
Стоит ли восстанавливать сайт из Archive.org самостоятельно или лучше довериться профессионалам? Честное сравнение затрат, времени, навыков и рисков, а также алгоритм принятия решения.
