Как скачать с Archive.org: элементы, снимки и не только
От редакционной команды Restorix · 28 апреля 2026 г. · 6 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Фраза «скачать с Archive.org» охватывает два совершенно разных действия, и путаница между ними, верный способ потерять целый день. Первое действие: получить файлы из элемента, книги, драйвера, записи концерта. Второе: извлечь веб-сайт из Wayback Machine. У первого есть кнопка скачивания. У второго её определённо нет.
Я делаю и то, и другое каждую неделю, для восстановления сайтов клиентов и для исследований. Вот все рабочие методы с честным описанием плюсов и минусов: что делается одним кликом, что требует командной строки, а что оказывается ловушкой в обёртке кнопки скачивания.
Два способа скачать с Archive.org
Archive.org хранит контент в виде элементов, автономных пакетов файлов с метаданными, как подписанные папки на полке. Wayback Machine хранит снимки, помеченные временем копии отдельных URL, отображаемые с перезаписанными ссылками. Элементы созданы для скачивания. Снимки созданы для просмотра в браузере.
Всё, что вы можете сделать, вытекает из этого разделения. Загрузка элементов официально поддерживается: кнопки, торренты, CLI, API метаданных. «Загрузка» снимков, это на самом деле реконструкция: вы запрашиваете у CDX API, что существует, скачиваете исходные байты каждого URL, а затем исправляете ссылки. Разные инструменты, разные способы сбоев, разные временные затраты.
Не уверены, в какой области вы находитесь? Посмотрите на URL. archive.org/details/что-то, это элемент, скачиваемый. web.archive.org/web/2012/http://example.com, это снимок, для просмотра. Один архив, две схемы адресов, два набора правил.
Простой способ скачать элементы с Archive.org
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Откройте страницу любого элемента и посмотрите на блок скачивания справа. Вы получите отдельные файлы, обычно ссылку на торрент, а иногда ZIP или ссылку на полнотекстовую версию. Для одного PDF или одного ISO просто нажмите на файл. Готово. Это единственная часть скачивания с Archive.org, которая работает так, как люди ожидают.
- Нажмите «SHOW ALL», чтобы увидеть все файлы в элементе, включая логи и производные форматы, скрытые в блоке.
- Прямые URL предсказуемы: archive.org/download/{identifier}/{filename}, идеально для скриптов и wget.
- Торрент-опция часто лучше HTTP для элементов размером в несколько гигабайт и возобновляется без проблем после обрыва соединения.
- Производные версии, это сгенерированные файлы: распознанный текст, уменьшенные MP4. Оригинальная загрузка помечена как таковая; скачивайте её, когда важна точность.
Ещё один трюк для тех, кто пишет скрипты: добавьте /metadata/{identifier} к archive.org, и вы получите JSON-список каждого файла с его размером, контрольной суммой и форматом. Этот JSON, именно то, что потребляет инструмент командной строки под капотом.

Массовая загрузка с помощью CLI Internet Archive
Для загрузки более чем нескольких элементов установите официальный инструмент командной строки, пакет Python internetarchive, который предоставляет команду ia. Он обрабатывает аутентификацию, возобновление и повторные попытки, и именно он отличает скрипт от выходных, проведённых за кликами.
- Установка: pip install internetarchive, затем запустите ia configure один раз со своим аккаунтом.
- Один элемент: ia download {identifier} зеркалирует весь элемент в локальную папку.
- Выборочно: ia download {identifier} --glob='*.pdf', больше никаких сюрпризов в 40 ГБ.
- Целые поиски: ia search 'collection:archiveteam AND year:2013' --itemlist > list.txt, затем запускайте ia download по этому файлу.
Существуют ограничения скорости. CLI вежливо повторяет попытки сам; ваш грубый цикл wget к archive.org, нет, и чрезмерные запросы приведут к ограничению или блокировке. Будьте вежливы, архив является некоммерческой организацией, а не CDN.
Как скачать веб-снимки с Archive.org
Теперь о сложной части. Снимок Wayback, это не элемент, поэтому кнопки скачивания нет. У вас есть четыре реальных варианта, в порядке возрастания сложности:
- Одна страница, прямо сейчас: откройте снимок и используйте функцию сохранения в браузере. Подходит для одной страницы; сохранённая копия по-прежнему указывает свои ресурсы на web.archive.org.
- Исходные байты одного файла: вставьте id_ после временной метки в URL снимка, web.archive.org/web/20120501000000id_/http://example.com/style.css, и вы получите неизменённые данные. Идеально для отдельных изображений, CSS и PDF.
- Скриптовые загрузки: запросите CDX API для каждого захваченного URL по пути, затем запросите каждый с модификатором id_. Работает, но теперь вы поддерживаете скрапер, дедуплицируете дайджесты и перезаписываете ссылки самостоятельно.
- Инструменты загрузки и сервисы восстановления: инструменты сообщества, такие как гем wayback-machine-downloader, автоматизируют цикл CDX-плюс-загрузка; сервис восстановления, такой как Restorix, делает это плюс очистку и повторное развертывание.
Заметьте закономерность: как только вам нужно больше одной-двух страниц, вы пишете или запускаете инструменты. В этом нет ничего постыдного, просто честно учитывайте это в своих планах.
Одно замечание о трюке с id_, потому что он переоценивает свои возможности: он даёт вам исходные байты только одного ответа, но ничего не исправляет. Страница, полученная с id_, по-прежнему содержит абсолютные URL, которые сайт использовал в 2012 году, по-прежнему ссылается на ресурсы, которые краулер никогда не скачал, и по-прежнему предполагает домен, которым вы можете уже не владеть. Исходные байты, это исходный материал, а не готовый сайт.

Элементы и веб-снимки: когда что использовать
| Вам нужно | Используйте | Метод |
|---|---|---|
| Книга, песня, драйвер, ISO | Элемент | Кнопка скачивания, торрент или ia download |
| Старая версия одной страницы | Снимок | Сохранение в браузере или URL с id_ |
| Одно отсутствующее изображение или CSS-файл | Снимок | URL с id_ прямо в wget |
| Целый мёртвый веб-сайт | Набор снимков | CDX API плюс инструменты или сервис восстановления |
| Сервис, который умер (эпоха GeoCities) | Элемент плюс снимки | WARC-файлы Archive Team, сверенные с CDX |
Последний пункт удивляет многих: когда Archive Team спасает умирающий хост, результат попадает в архив элементов в виде гигантских WARC-файлов. Один и тот же веб-сайт может быть и загрузкой элемента, и набором снимков. Сначала проверьте сторону элемента, готовый набор данных лучше тысячи отдельных загрузок, а наш руководство по форматам объясняет, что делать с этими WARC.
Ошибки при скачивании, которые тратят часы
- Рекурсивный wget к web.archive.org. Каждая ссылка перезаписана, чтобы оставаться на своём домене, поэтому ваш краулер с удовольствием скачивает собственный интерфейс Wayback Machine до конца света.
- Скачивание всего элемента ради одного файла. Клик по «SHOW ALL» занимает десять секунд; ZIP на 40 ГБ занимает весь вечер.
- Доверие снимку как целому сайту. Снимки делаются по URL и избирательно, изображения, размещённые на поддомене CDN, часто отсутствуют полностью.
- Игнорирование кодов состояния в выводе CDX. Редиректы и 404 тоже архивируются; фильтруйте по statuscode:200 и объединяйте дайджесты, иначе вы восстановите заглушки редиректов как страницы.
- Пропуск проверки контрольных сумм. Элементы содержат файлы md5 и sha1, проверяйте большие загрузки перед тем, как на них строиться.
- Предположение, что одной даты снимка достаточно. Главная страница 2011 года с изображениями 2009 года, это нормально; сайты краулились по частям, поэтому ожидайте смешивания дат захвата для полной картины.
У вас есть файлы. Что дальше?
Загрузки элементов сразу встраиваются в вашу медиатеку или инструментарий, эта часть решена. Загрузки снимков, это там, где начинается настоящая работа: перезаписанные URL, отсутствующие ресурсы, мёртвые контактные формы, смешанный HTTP и HTTPS. Превращение папки снимков 2011 года в сайт, который действительно загружается, это задача по восстановлению, а не по скачиванию.
Именно в этот момент я перестал писать скрипты вручную и начал направлять людей к Restorix. Бесплатная оценка считывает архив за вас, точное количество файлов, общий размер, фиксированная цена, прежде чем вы потратите хотя бы цент. Первый файл восстанавливается бесплатно, далее, оплата за файл, разовые дополнения, без подписки. Если восстановление или развертывание не удастся, возврат автоматически поступит на ваш баланс, без обращения в поддержку.
Опции восстановления охватывают сложные моменты, которые вы иначе писали бы в скриптах: удаление аналитики и рекламы, относительные ссылки, принудительный HTTPS, канонизация www, сохранение редиректов. Однократное развертывание отправляет результат на SSH/SFTP, FTP или S3, а встроенный однофайловый CMS в /webarchive-cms.php позволяет исправлять контент на месте, руководство проводит через полный процесс. Загрузки завершают поиск; они не завершают работу.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Можно ли скачать целый веб-сайт с Archive.org?
Не с помощью кнопки. Веб-сайты находятся на стороне Wayback как захваты по URL, поэтому скачивание сайта означает перечисление URL через CDX API и загрузку каждого, а затем исправление ссылок. Для чего-то более чем нескольких страниц используйте инструмент загрузки или сервис восстановления, мы сравниваем варианты в [скачать целый веб-сайт с Archive.org](/ru/download-entire-website-from-archive-org).
Законно ли скачивать с Archive.org?
Элементы в общественном достоянии и по лицензии Creative Commons явно разрешены. Для защищённых авторским правом элементов решение остаётся за правообладателем, скачивание для личных исследований обычно допускается, а перепубликация, нет. Восстановление собственного старого сайта по его снимкам, это классический законный случай.
В чём разница между ia download и торрентами?
Одинаковые байты, разная транспортная система. Торренты хороши для огромных элементов и нестабильных соединений; CLI хорош для скриптов, фильтрации --glob и пакетных задач по множеству идентификаторов. Для одного элемента в 200 МБ обычная кнопка скачивания лучше обоих.
Почему мои загрузки снимков содержат URL web.archive.org повсюду?
Wayback Machine перезаписывает ссылки, чтобы страницы отображались внутри своего плеера. Загружайте с модификатором id_, чтобы получить исходные байты, или запускайте восстановление, которое перезаписывает ссылки обратно, опция относительных ссылок в Restorix существует именно для этой очистки.
Как скачать всю коллекцию вместо одного элемента?
Составьте список элементов с помощью ia search 'collection:имя' --itemlist, затем запускайте ia download для каждого идентификатора с фильтрами --glob, чтобы оставить только нужные типы файлов. Приготовьтесь к тому, что это займет время, большие коллекции исчисляются терабайтами, поэтому проверьте статистику размера коллекции перед началом.
Похожие гайды

archive org download
Форматы загрузки Archive.org: WARC, CDX и отдельные файлы
Что на самом деле содержат форматы загрузки Archive.org, WARC-снимки, JSON-индексы CDX и исходные файлы, и что с каждым из них делать.

download a website from archive org
Как скачать сайт из Archive.org: 3 рабочих способа
Три проверенных способа скачать сайт из archive.org: сохранять страницы вручную, работать через CDX API или запустить автоматическое восстановление. Реалистичные оценки времени для каждого.

download entire website from archive org
Загрузка всего сайта из Archive.org, а не только главной страницы
Чтобы загрузить весь сайт из archive.org, вам нужны все страницы, изображения и стили. Ресурсы скрываются под разными временными метками, вот почему это происходит, а также полный чек-лист.

wayback machine downloader
Инструменты для скачивания из Wayback Machine: что реально работает
Честный обзор инструментов для скачивания из Wayback Machine: опенсорс-скрипты, их реальные ограничения и готовое решение, которое вернёт ваш сайт в онлайн.
