Archive.org: расширенный поиск, фильтры и коллекции
От редакционной команды Restorix · 26 апреля 2026 г. · 6 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Большинство людей заходят на Archive.org ровно один раз. Вставляют мёртвый URL в Wayback Machine, делают скриншот и уходят. Это расточительство, инструмент серьёзный. За тем же логином скрывается полноценная цифровая библиотека, десятки миллионов объектов, с собственным поисковиком, синтаксисом запросов и фильтрами, которыми почти никто не пользуется.
Я годами доставал из Archive.org клиентские сайты, мёртвый софт и отсканированные руководства. Разница между тем, чтобы найти что-то за две минуты и сдаться через двадцать, почти никогда не в везении. Дело в том, какое окно поиска использовать и на какой фильтр нажать. Это рабочий процесс, которому я следую.
Что на самом деле индексирует Archive.org
Путаница начинается здесь. Archive.org управляет двумя разными системами, использующими общий логотип. Архив объектов, то, что вы ищете с главной страницы, хранит загруженные и собранные материалы: книги, концерты, софт, видео, радиопередачи. У каждого объекта есть метаданные, список файлов и отзывы. Wayback Machine, расположенная на web.archive.org, хранит снимки веб-страниц, индексированные по URL. Их более 900 миллиардов.
Почему это важно для старых сайтов? Потому что мёртвый сайт может появиться в обоих местах, но по-разному. На стороне Wayback лежат страницы. На стороне объектов может храниться спасательный обход Archive Team всего сервиса, на котором жил ваш сайт, GeoCities, FortuneCity, MobileMe, упакованный в загружаемые WARC-файлы. Если вы пользуетесь только одной дверью, вы пропускаете другую.
- Тексты: отсканированные книги, руководства, журналы, с полнотекстовым поиском
- Софт: от компакт-дисков с шэрвером до старых браузеров и Flash-проекторов
- Аудио и видео: живые концерты, радиоархивы, кинохроники, реклама
- Веб-объекты: коллекции обходов и сборы Archive Team, хранящиеся в виде WARC-файлов
- Изображения и данные: наборы фото, сканы карт, исследовательские наборы данных
Расширенный поиск на Archive.org
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Поле поиска на главной странице подойдёт для бутлегов Beatles. Для чего-то точного перейдите на страницу расширенного поиска, archive.org/advancedsearch.php, или составьте запрос сами. Синтаксис похож на Lucene и строгий: имена полей в нижнем регистре, диапазоны в квадратных скобках, булевы операторы, заглавными буквами. Ошибётесь хоть в чём-то одном, и молча получите мусорные результаты.
Запрос, который ищет софт, связанный с Joomla, добавленный между 2005 и 2010 годом, выглядит так: title:(joomla) AND mediatype:software AND date:[2005-01-01 TO 2010-12-31]. Вставьте его в поле поиска, и он просто сработает. Никаких форм не нужно.
- identifier:, точный слаг URL объекта; самый быстрый способ поиска
- collection:, ограничить одной коллекцией, например collection:archiveteam
- creator: и title:, нечёткий, но полезный поиск с кавычками вокруг фраз
- date:[YYYY-MM-DD TO YYYY-MM-DD], диапазон дат добавления, а не исходной публикации
- mediatype:, texts, software, audio, movies, image, web, data
- NOT, AND, OR и круглые скобки, свободно комбинируйте, но заглавными буквами
Один подвох: date: фильтрует по дате попадания объекта в архив, а не по дате создания содержимого. Руководство 2003 года, загруженное в 2019, попадёт под 2019.

Фильтры, которые делают основную работу
Когда результаты загрузятся, именно в левой боковой панели экономится время. Можно фильтровать по mediatype, году, коллекции, автору и языку, а сортировать по релевантности, просмотрам (за всё время или за неделю), дате добавления или названию. Большинство поисковых запросов терпит неудачу не потому, что материала нет, а потому, что он лежит на девятой странице за двумя сотнями эпизодов подкастов. Фильтры это исправляют.
- Сначала фильтруйте по mediatype. Поиск по умершей CMS по всем категориям утопит вас в аудио.
- Сортируйте по просмотрам за неделю, когда нужен поддерживаемый материал, толпа, неплохой сигнал качества.
- Комбинируйте фильтры по коллекции и году, чтобы восстановить, как выглядел уголок веба, скажем, в 2008.
| Фильтр | Лучшее применение |
|---|---|
| Mediatype | Отсекает 90% шума одним кликом |
| Год | Восстановление таймлайна жизни сайта |
| Коллекция | Оставаться в рамках проверенного обхода или спасательного проекта |
| Автор / загрузивший | Проследить полный набор одного архивиста |
| Просмотры за неделю | Заметить объекты, которыми до сих пор активно пользуются |
Коллекции, которые стоит знать ради старых сайтов
Коллекции, это курируемые полки, и некоторые из них, чистое золото для тех, кто охотится за старыми сайтами:
- archiveteam, лихорадочные, но любовно сделанные сборы умирающих сервисов: GeoCities, FortuneCity, Posterous, MobileMe. Часто это полные WARC-обходы целых хостинговых платформ.
- geocities и его зеркала, спасение Yahoo! GeoCities, крупнейшее единичное восстановление личных веб-страниц в истории.
- widecrawl и другие коллекции обходов, массовые обходы Internet Archive, полезны, когда в Wayback при показе по URL есть пробелы.
- коллекции библиотеки софта, старые браузеры, Flash, Shockwave, Java-апплеты. Они нужны, чтобы реально запустить то, что подавали старые сайты.
- cd-rom software library, диски с шэрвером, полные аутентичных эпохе конструкторов сайтов, счётчиков и скриптов гостевых книг.
Начинайте со страницы коллекции, а не с поля поиска. Мейнтейнеры обычно документируют, что внутри, как это собиралось и что означает структура файлов, контекст, который избавит вас от догадок в два часа ночи.

Archive.org против Wayback Machine: какой дверью войти
| Поиск по объектам Archive.org | Wayback Machine | |
|---|---|---|
| Что ищете | Объекты по метаданным | URL по адресу |
| Что получаете | Загружаемые файлы | Отрендеренные снимки |
| Лучше всего для | Софт, медиа, массовые обходы | Страницы конкретного сайта |
| Слабая сторона | Нет рендеринга страниц | Нет официальной загрузки всего сайта |
Простое правило: если вы можете назвать URL, начинайте с Wayback Machine. Если можете только описать предмет, ту тему phpBB, которую все использовали в 2007, выигрывает поиск по объектам. Для полного восстановления обычно используются оба: обходы и данные CDX со стороны объектов, снимки страниц со стороны Wayback.
Реальный рабочий процесс: охота за мёртвым форумом клиента
Конкретный случай. Форум клиента на phpBB 2009 года исчез, когда хостер закрылся в 2014. Домен годами висел как парковочный; клиент хотел вернуть контент. Вот последовательность, которая сработала:
- Запрос к Wayback CDX по домену, чтобы составить карту того, какие URL и когда были захвачены, около 1400 снимков, в основном с 2010 по 2012.
- Поиск по объектам по домену и названию сайта внутри collection:archiveteam, в этот раз ничего, но это проверка на тридцать секунд.
- Проверка коллекции по старому хостеру, сам хостер был частично собран Archive Team, что закрыло несколько пробелов в шаблонах и изображениях.
- Поиск софта форума с фильтром по годам, чтобы достать аутентичный эпохе пакет phpBB для справки.
Общее время: около сорока минут, бо́льшая часть, чтение вывода CDX. Поиск, лёгкая часть, когда знаешь двери. Обратите внимание, чего не произошло: никаких догадок про кэш Google, никаких упрашиваний поддержки старого хостера, никаких оплат кому-либо. Архив точно сказал, что уцелело, 1400 снимков, известный пробел в 2013 и частичный спасательный обход, чтобы его закрыть. Те же данные CDX читает оценка Restorix, чтобы посчитать файлы и назначить цену восстановления, и именно на этом история продолжается ниже.
Когда Archive.org недостаточно
Всё перечисленное выше находит материал. Оно не выдаёт вам рабочий сайт. Снимки Wayback идут с переписанными URL, отсутствующими изображениями, мёртвыми формами и абсолютными ссылками на домен, который вы больше не контролируете. Восстанавливать сайт из сырых снимков вручную, это дни sed-скриптов и сожалений.
Этот пробел и есть то, для чего создан сервис Restorix. Вставьте URL, и бесплатная оценка покажет точное число файлов в архиве, общий размер и фиксированную цену, прежде чем вы что-либо платите. Восстановление может вырезать аналитику и рекламу, преобразовать ссылки в относительные, принудительно включить HTTPS и развернуть сайт прямо на ваш VPS, FTP-хостинг или S3, с однофайловой CMS в комплекте, чтобы можно было редактировать восстановленный контент.
Используйте Archive.org для разведки: проверьте, что существовало, когда и сколько уцелело. А затем пусть инструменты займутся реконструкцией. Ваше время стоит дороже, чем выходные, потраченные на разбор WARC.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Archive.org бесплатен?
Да. Поиск, стриминг и загрузка публичных объектов ничего не стоят, и для просмотра аккаунт не нужен. Бесплатный аккаунт добавляет избранное, загрузки и списки. Выдача некоторых современных книг требует аккаунта, но всё, что описано в этом руководстве, открыто.
В чём разница между Archive.org и Wayback Machine?
Archive.org, это родительская цифровая библиотека: объекты вроде книг, софта, аудио и коллекций обходов, доступные для поиска по метаданным. Wayback Machine, один из сервисов внутри неё, хранящий более 900 миллиардов снимков веб-страниц, индексированных по URL. Старые сайты могут появляться в обоих, как снимки в Wayback и как объекты массовых обходов.
Можно ли искать по полному тексту старых веб-страниц на Archive.org?
Нет. Wayback Machine индексирует по URL, а не по тексту страницы, нужен адрес, а не ключевые слова. Полнотекстовый поиск работает только внутри текстовых объектов, таких как отсканированные книги. Для страниц сначала найдите URL (старые ссылки, поисковики, подстановочные запросы CDX), а затем выполните по нему поиск.
Как скачать то, что я нашёл на Archive.org?
На каждой странице объекта есть блок загрузки со списком отдельных файлов, а также опции для торрента и всего объекта целиком. Для сайтов, захваченных Wayback Machine, кнопки загрузки нет, для этого нужны CDX API, инструмент-загрузчик или сервис восстановления вроде Restorix. Наше руководство по [загрузке с Archive.org](/ru/download-archive-org) разбирает все способы.
Почему я вообще не могу найти конкретный старый сайт?
Обычно три причины: robots.txt сайта блокировал краулеры, на сайт никогда не вели ссылки с мест, куда заходили краулеры, или всё было спрятано за логином или тяжёлым Flash и JavaScript. Прежде чем сдаваться, проверьте CDX API по голому домену, снимки иногда прячутся за неожиданными поддоменами или www-вариантом, который вы забыли.
Похожие гайды

wayback machine archive org
Wayback Machine на Archive.org: практический гид по сайту
Практический обзор Wayback Machine на Archive.org: где он находится, как на самом деле работают поиск и календарь, и как уйти с реальными файлами.

archiveorg
Archiveorg: внутри крупнейшей бесплатной библиотеки интернета
Archiveorg, это больше, чем Wayback Machine: бесплатные книги, живая музыка, новостные выпуски ТВ, играбельный софт и более 900 миллиардов веб-страниц. Полный обзор, а ещё, восстановление файлов.

download archive org
Как скачать с Archive.org: элементы, снимки и не только
Все практичные способы загрузки контента с Archive.org, файлы элементов, массовые загрузки через CLI и веб-снимки Wayback Machine, и как выбрать подходящий для вашей задачи.

archive org download
Форматы загрузки Archive.org: WARC, CDX и отдельные файлы
Что на самом деле содержат форматы загрузки Archive.org, WARC-снимки, JSON-индексы CDX и исходные файлы, и что с каждым из них делать.
