История интернет-сайтов: сохранённое, утраченное и почему
От редакционной команды Restorix · 29 мая 2026 г. · 7 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
В апреле 2009 года Yahoo объявила о закрытии GeoCities. Тридцать восемь миллионов пользовательских страниц, MIDI-файлы, анимированные дорожные знаки, фан-сайты обо всём от «Секретных материалов» до тропических рыбок, должны были удалить в октябре. Добровольческая команда под названием Archive Team шесть месяцев скачивала всё, на что хватало пропускной способности, и выложила добычу в виде торрента. Часть раннего интернета выжила благодаря незнакомцам, решившим, что она должна сохраниться. Большинству раннего интернета так не повезло.
Это взгляд на то, что реально было сохранено из первых десятилетий онлайн-эпохи, что исчезло навсегда и какие технические и социальные причины стоят за этим. Если вы пытаетесь восстановить один конкретный старый сайт, переходите к последнему разделу, он для вас.
История интернет-сайтов моложе, чем вы думаете
Интернет стал общедоступным в августе 1991 года, когда Тим Бернерс-Ли представил проект World Wide Web в CERN и направил людей на info.cern.ch. Никто это не архивировал. Не было чем архивировать, крупномасштабные веб-краулеры появились лишь через годы, и идея целенаправленного сохранения сайтов казалась большинству людей накопительством.
Internet Archive основана в мае 1996 года Брюстером Кейлом, а данные краулинга поступали от Alexa Internet. Wayback Machine открылась для публики в октябре 2001 года, уже храня 10 миллиардов страниц. Сегодня в ней более 900 миллиардов. Впечатляет, но разрыв имеет значение. С 1991 по 1996 год систематического архивирования не было вообще. Когда CERN восстановил первый сайт по его оригинальному адресу в 2013 году, самый старый найденный экземпляр датировался ноябрём 1992 года. Оригинал 1991 года, без преувеличения важнейшая страница в истории интернета, сохранился лишь в скриншотах и реконструкциях.
Всё из этой пятилетней бреши сохранилось случайно: резервная лента сисадмина, CD-ROM, приложенный к журналу, FTP-зеркало, которое кто-то забыл удалить.
Кто что сохранил: архивисты, волонтёры и библиотеки
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Сохранением занимались четыре группы, каждая со своими мотивами и охватом.
- Internet Archive ведёт непрерывный краулинг и принимает публичные запросы через Save Page Now. Это хранилище интернета по умолчанию и первое место, куда стоит обращаться.
- Archive Team, волонтёрский коллектив по спасению данных, который активизируется, когда сервис объявляет о закрытии. GeoCities в 2009 году, Google+ и Yahoo Groups в 2019 году, они забирают всё, что могут, и выкладывают в виде торрентов.
- Национальные библиотеки архивируют выборочно. UK Web Archive работает на основании закона о обязательном экземпляре с 2013 года; австралийский архив PANDORA курирует заметные австралийские сайты с 1996 года.
- Common Crawl публикует массивные открытые наборы данных краулинга с 2008 года, бесценно для исследователей, но удобного календарного интерфейса для случайного просмотра нет.
Отдельного упоминания заслуживает archive.today, работающий с 2012 года, он делает снимки по запросу и часто хранит страницы, которые пропустил Internet Archive, особенно заблокированные для его краулеров.

Что сохранила история интернет-сайтов: статичное, публичное, популярное
Посмотрите на то, что лучше всего сохранилось, и вы увидите закономерность. Архивы предвзяты к тому, что краулер мог получить дёшево и часто.
- Статические HTML-страницы с обычными ссылками, родная пища краулера.
- Изображения и файлы, связанные напрямую с захваченной страницей, по крайней мере когда размеры файлов были разумными.
- Страницы с большим количеством входящих ссылок, потому что краулеры следуют по ссылкам, а популярные страницы постоянно пересканировались.
- Сайты, чей robots.txt разрешал сканирование, одна директива Disallow: / скрывала всё.
- Текст любого вида. Он прекрасно сжимается и быстро возвращается.
Сделанная вручную персональная страница 1998 года, фиолетовый фон, счётчик посещений, страница ссылок, обычно извлекается полностью, включая GIF-анимации. Интернет-магазин 2008 года с десятикратным культурным следом часто нет. Популярность и простота побеждают всё остальное.
Что исчезло навсегда и почему
Потери группируются в несколько предсказуемых категорий, и самая большая из них, обычный текстовый файл. До изменения политики в 2017 году Internet Archive учитывал исключения robots.txt и применял их задним числом, одно изменение файла могло скрыть от публичного просмотра годы существующих архивных копий. Домены продаются, новый владелец добавляетrestrictive robots.txt, и десятилетие истории исчезает за ночь. Бесчисленные сайты исчезли из архива именно таким образом, хотя данные технически всё ещё существовали.
Всё, находившееся за авторизацией, никогда не индексировалось: закрытые форумы, ранние социальные сети, сообщества только для участников. Редизайн Friendster в 2011 году стёр годы профилей одним развёртыванием. Динамические страницы, управляемые базой данных, индексировались непоследовательно в лучшем случае, краулеры обрабатывают GET-ссылки, а не POST-формы, поэтому поисковые результаты, корзины покупок и отфильтрованные списки по сути никогда не существовали для архивов.

Тяжёлый медиа-контент тоже пострадал. Потоковое аудио и видео эпохи RealPlayer, Java-апплеты и всё, что передавалось по необычным протоколам, пропускалось или сохранялось с ошибками. Flash, известный пограничный случай:.swf-файлы часто сохранялись, но годами оставались невоспроизводимыми, пока эмулятор Ruffle не вернул многие из них к жизни в 2020 году. Фрагменты Flash, которые никто не сохранил, просто исчезли.
Цифры мрачны даже для недавнего интернета. Исследование Pew Research в 2024 году показало, что 38 процентов страниц, существовавших в 2013 году, больше недоступны. Гарвардское исследование о «гниении ссылок» обнаружило, что около половины URL-адресов, упомянутых в решениях Верховного суда США, уже мертвы. Сохранение, исключение. Распад, правило.
Почему динамические сайты сломали архивирование
Краулер запрашивает URL-адреса. В этом весь фокус. Форум phpBB 2005 года или магазин osCommerce, это не коллекция URL-адресов, это база данных, надевшая URL-адреса как костюм, генерирующая страницы по запросу из строк запроса типа viewtopic.php?t=4821&start=40. Пространство URL-адресов по сути бесконечно, поэтому краулеры лишь пробуют его. Они захватывают индексные страницы и темы, которые были хорошо связаны в том месяце, и пропускают остальное.
Сессии и cookies усугубляют проблему: один и тот же URL возвращает разный контент для разных посетителей, поэтому при захвате может сохраниться только страница неавторизованного пользователя или редирект. Есть и чисто экономический фактор, текст дёшево загружать и хранить, медиа, нет. При ограниченном краулинге большие файлы пропускались для снижения затрат, поэтому так много архивных страниц загружаются как текст с серыми дырами там, где были изображения.
В результате: архивы обычно содержат скелет сайта, домашние страницы, статические статьи, несколько хорошо связанных тем, но не живой организм. Поисковая строка, список участников, процесс оформления заказа: всё это никогда не могло быть захвачено сколько-нибудь осмысленно.
Как самостоятельно исследовать историю интернет-сайтов
Для конкретного сайта порядок действий прост:
- Введите домен на web.archive.org. Спарклайн над календарём показывает плотность архивных копий по годам, насыщенные годы означают тщательную оцифровку.
- Сначала откройте самый ранний снимок, затем двигайтесь вперёд. Ранние снимки показывают оригинальную структуру и старые шаблоны URL.
- Ищете конкретный URL? Запросите индекс CDX или вставьте адрес прямо в строку Wayback, моё руководство по поиску всех страниц сайта охватывает API-приёмы.
- Сверьтесь с archive.today на предмет того, что пропустил Internet Archive.
- Для материалов до 1996 года ищите зеркала от операторов, университетские коллекции и ностальгические проекты, а не формальные архивы.
Если вам нужна общая картина, а не одна страница, наши руководства по поиску истории сайта и углублённому исследованию истории сайта подробно охватывают календарь, коллекции и альтернативные архивы.
Когда просмотра прошлого недостаточно
Wayback Machine, это читальный зал, а не кнопка восстановления. Когда вам нужен actualный сайт обратно, файлы, изображения, внутренние ссылки, работающие на вашем собственном домене, ручное сохранение становится неэффективным после примерно дюжины страниц. Правая кнопка мыши, сохранить как, исправить пути, повторить: это полдня на раздел, и результатом будет папка с фрагментами.
Сервис Restorix создан именно для этой задачи. Вставьте домен, и бесплатная оценка покажет точное количество архивных файлов, общий размер и фиксированную цену до оплаты. Вы платите за каждый восстановленный файл, первый файл бесплатен, а восстановления можно фильтровать по диапазону дат и очищать, удалять старую аналитику и рекламу, делать ссылки относительными, применять HTTPS. Восстановленный сайт развёртывается на вашем хостинге в один клик или экспортируется как структурированные данные. Руководство показывает весь процесс.
История интернет-сайтов фрагментарна, но то, что сохранилось, обычно можно восстановить, если использовать правильный инструмент для задачи.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Как далеко назад простирается история интернет-сайтов в Wayback Machine?
Архивные копии начинаются с 1996 года, когда Internet Archive начал краулинг. Интернет сам начался в 1991 году, поэтому первые пять лет существуют только в частных резервных копиях и реконструкциях, например, восстановленный CERN первый сайт взят из копии ноября 1992 года.
Всё ли из раннего интернета где-то заархивировано?
Нет. Страницы, заблокированные robots.txt, контент за авторизацией, тяжёлый медиа-контент и динамически генерируемые страницы редко захватывались. Если ни Wayback Machine, ни archive.today не содержат страницу, она, скорее всего, сохранилась только в частных руках, если вообще сохранилась.
Почему старая страница показывает 'not in archive', хотя сайт точно старый?
Обычно одна из четырёх причин: robots.txt блокировал краулеры, на страницу не было входящих ссылок, по которым краулеры могли бы пройти, она генерировалась динамически, или архивные копии домена были скрыты после смены владельца. Один возраст никогда не гарантировал оцифровку.
Что случилось со всеми сайтами GeoCities?
Yahoo удалила их в октябре 2009 года. Archive Team спасла большую часть и выложила её в виде торрента примерно на 900 ГБ, а зеркала вроде Reocities позволяют просматривать отдельные фрагменты. Многие страницы GeoCities также хранятся в Wayback Machine, но полная официальная резервная копия так и не была обнародована.
Может ли владелец сайта стереть свой сайт из веб-архивов?
Internet Archive выполняет запросы на удаление от владельцев сайтов, а изменения в robots.txt исторически скрывали архивные копии задним числом до изменения политики в 2017 году. Продажа доменов также приводила к закрытию публичного доступа к архивам. Однако удаление сайта с вашего сервера само по себе не удаляет существующие архивные копии.
Удаление моего сайта удаляет его из Wayback Machine?
Не автоматически. Уже сделанные архивные копии остаются доступными, если владелец домена не подаст запрос на исключение. Если вы хотите что-то удалить из архива, нужно запросить это, просто отключение сайта оставляет историю на месте.
Похожие гайды

website history
История сайта: снимки, WHOIS, DNS и инструменты для каждого
История сайта может означать архивные снимки, записи WHOIS, изменения DNS или старые рейтинги. Узнайте, какой инструмент отвечает на какой вопрос, и как восстановить утраченный сайт.

search website history
Как проверить историю сайта перед покупкой домена
Проверьте историю сайта перед покупкой домена: старые снапшоты, смены владельцев, спам-след и товарные знаки, 30-минутный чек-лист проверки.

historical web
Исторический веб как исследовательский ресурс: что выдерживает проверку
Как учёные, журналисты и юристы используют исторический веб: где хранятся записи, как оценить качество сохранности и когда снимок считается доказательством.

wayback machine
Wayback Machine: Полное руководство по просмотру истории веб-страниц
Wayback Machine архивирует более 900 миллиардов веб-страниц. Узнайте, как работают сканирование, снимки, календарь и синтаксис поиска, и как восстановить потерянный сайт.
