Как найти все страницы на сайте (включая удалённые)
От редакционной команды Restorix · 25 мая 2026 г. · 7 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Сколько страниц на нашем сайте? Звучит как вопрос с базой данных за ним. На самом деле, редко. В прошлом году один клиент клялся, что на сайте около 400 страниц. Карта сайта говорила 1 900. Краулер нашёл 3 400. Индекс Wayback Machine содержал 11 000 URL-адресов, которые когда-либо обслуживались, половина из них давно удалена. Четыре источника, четыре ответа, и все четыре были правильными, каждый о своём.
Вот четыре метода, которые я использую для поиска всех страниц на сайте, что каждый из них реально охватывает, и как объединить их в один чистый список, с которым можно работать.
Почему найти все страницы сайта так сложно
Единого мастер-списка не существует, если только CMS сама его не ведёт, и даже тогда она знает только саму себя. Реальные сайты накапливают страницы, которые выпадают из любого единого реестра: страницы-сироты, на которые не ссылается меню, разделы, оставшиеся от старой миграции, загрузки, на которые ссылались один раз в email-рассылке, URL-адреса с фильтрами, генерируемые на лету, целые поддомены, которые кто-то создал в 2016 году и забыл о них.
Каждый метод обнаружения видит свой срез этого хаоса. Карта сайта, это самоотчёт CMS. Краулер строит карту связей. Индекс Wayback Machine помнит историю. Search Console сообщает, что Google реально показывал пользователям. Ни один не полон; вместе они приближаются к полноте.
Прежде чем собирать список, решите, для чего он нужен. Перечень для миграции, SEO-аудит и восстановление мёртвого сайта используют один и тот же исходный материал, но требуют разной обработки.
Карта сайта: самый быстрый способ найти все страницы сайта
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Начните с /sitemap.xml. Если возвращает 404, проверьте robots.txt на директиву Sitemap:, многие сайты размещают файл по нестандартному пути. WordPress core предоставляет /wp-sitemap.xml начиная с версии 5.5; Yoast и Rank Math генерируют /sitemap_index.xml, который разветвляется на дочерние карты по типам записей. Получите индекс, затем все дочерние файлы.
Протокол ограничивает каждый файл карты сайта 50 000 URL и 50 МБ несжатого файла, поэтому крупные сайты всегда используют индексы, не останавливайтесь на первом найденном файле.
Теперь оговорки, потому что карты сайта врут умолчанием. Карта сайта содержит только то, о чём знает CMS: нет сирот-медиафайлов, нет страниц, удалённых годы назад, нет устаревших разделов, работающих вне CMS, ничего от того кастомного скрипта в /old-tools/. А на самописных или устаревших картах сайта даже известный список, фикция. Сверьте даты lastmod с недавно обновлёнными страницами; если они не совпадают, не доверяйте ничему.

Обходите сайт как Googlebot
Краулер начинает с главной страницы и следует по каждой видимой ссылке, так же как это делает поисковая система. Screaming Frog, индустриальный стандарт, бесплатен до 500 URL; Sitebulb удобнее для аудитов; для полного контроля, небольшой Python-скрипт с requests и BeautifulSoup, или wget в режиме spider, ничего не стоит.
Краулинг находит то, что пропускают карты сайта: постраничные архивы, которые никто не добавил в карту, страницы тегов и категорий, битые ссылки на существующие страницы, цепочки редиректов, сжигающие краулинговый бюджет.
Его слепые зоны, зеркальное отражение карты сайта. Если на страницу ничего не ссылается, краулер её не найдёт. Меню, рендерящиеся на JavaScript, требуют безголового браузера, иначе краулинг остановится на главной странице. А фильтрованная навигация, фильтры, календари, порядок сортировки, могут раздуть магазин с 500 страниц до 500 000 URL-ловушек; задайте правила исключения до старта, не после. На сайтах, которые вам не принадлежат, держите низкую параллельность и уважайте robots.txt.
API Wayback CDX: найдите все страницы сайта, прошлые и настоящие
Этот метод почти никто не использует, хотя он находит больше всего. CDX-сервер Internet Archive выдаст список всех URL, которые он когда-либо захватывал для хоста, включая страницы, удалённые десять лет назад, чего никакой живой метод не увидит.
Одна команда curl даёт полную инвентаризацию:
curl "https://web.archive.org/cdx/search/cdx?url=example.com/*&output=text&fl=timestamp,original,statuscode&filter=statuscode:200&collapse=urlkey&from=2010&to=2020"
Параметры, которые важны: collapse=urlkey убирает дубликаты повторных захватов одного URL; filter=statuscode:200 отсеивает 404 и редиректы; matchType=domain расширяет охват на поддомены; from и to задают рамки по годам. Для мёртвого сайта этот временной коридор, то самое место.
Ожидайте объёма. Долгоиграющий форум или магазин может вернуть миллионы строк, а параметры запросов, идентификаторы сессий, трекинговые параметры, раздувают список. API бесплатен, но имеет ограничение скорости, поэтому с крупными доменами запаситесь терпением, а огромные выборки разбейте на годовые фрагменты.

Если хотите ответ без возни с кодом, Restorix обрабатывает этот же индекс для бесплатной оценки, вставьте домен, и сервис за секунды сообщит точное количество архивных файлов и общий размер по фиксированной цене, без запросов к API.
Google Search Console: найдите все страницы, которые Google показывает из вашего сайта
Для сайтов, которые вам принадлежат, Search Console добавляет тот набор данных, которого нет больше нигде: что Google реально проиндексировал и показывал. Подтвердите права, затем работайте с двумя отчётами.
- Отчёт «Эффективность», вкладка «Страницы»: каждый URL, получивший показ, можно экспортировать. Веб-интерфейс ограничивает экспорт 1 000 строками; Search Analytics API запрашивает данные далеко за этим пределом, а массовый экспорт в BigQuery даёт полный набор данных ежедневно.
- Отчёт «Индексирование», раздел «Страницы»: проиндексированные versus обнаруженные-но-не-индексированные, с примерами URL, быстрая оценка того, сколько сайта Google вообще считает нужным держать в индексе.
Уникальная ценность, данные о показах: страницы, до которых реальные пользователи добрались, включая сирот, на которые ничего не ссылается. Если забытая лендинг-страница всё ещё набирает тридцать кликов в месяц, она в списке на сохранение. Bing Webmaster Tools предлагает аналогичные отчёты, если трафик с Bing вам важен.
Объедините, дедуплицируйте и очистите список
Четыре источника, четыре формата, вот где появляется ценность. Сгрузите всё в один CSV, затем нормализуйте перед дедупликацией, иначе одна страница появится шесть раз в шести обличьях.
Эти обличья, не гипотетические. Одна реальная карточка товара может фигурировать как https://www.example.com/page/?utm_source=newsletter, http://example.com/page, example.com/page/#comments, example.com/page?fbclid=abc123, www.example.com/page/index.html и EXAMPLE.com/page, шесть строк, один документ. Регистр, протокол, www, параметры, фрагменты и имена файлов по умолчанию, всё нужно свернуть к одной канонической форме, иначе дедупликация ничего не значит. Пропустите это, и ваш список из 11 000 URL, это на самом деле 6 000 URL в маскарадных костюмах.
- Приведите хост к нижнему регистру; уберите фрагменты (#section) полностью.
- Удалите трекинговые параметры: utm_*, fbclid, gclid, ref. Оставшиеся параметры запроса отсортируйте.
- Выберите одно соглашение о завершающем слэше и применяйте его.
- Сверните варианты протокола и www к канонической форме.
После дедупликации классифицируйте каждый URL: живой 200, редиректит, 404 сейчас, но был в архиве, или пропал совсем. Третья корзина, удалённое, но присутствующее в данных CDX, та, которую при миграциях забывают и потом жалеют. Двадцать строк Python обрабатывают всё это для большинства сайтов; электронные таблицы справляются до нескольких тысяч URL.
Быстрое сравнение четырёх источников:
| Источник | Видит удалённые страницы? | Нужен доступ к сайту? | Что реально охватывает |
|---|---|---|---|
| sitemap.xml | Нет | Нет | Страницы, которые CMS признаёт, прямо сейчас |
| Краулер | Нет | Нет | Всё, достижимое по ссылкам |
| Wayback CDX API | Да | Нет | Каждый URL, который архив когда-либо захватывал |
| Search Console | Нет | Да | URL, которые Google проиндексировал или показывал |
Вы нашли все страницы, что дальше
Для миграции список становится картой редиректов: каждый URL с показами в Search Console или захватами в данных CDX получает 301 на ближайший современный аналог. Для SEO-аудита колонки краулинга и индекса обнажают тонкие разделы и ловушки краулинга. И то, и другое, несколько вечеров честной работы.
Если список нужен для мёртвого сайта, который вы хотите вернуть, забудьте о ручной перестройке. Restorix восстанавливает весь сайт из Wayback Machine: бесплатная оценка показывает точное количество файлов и размер по фиксированной цене, оплата за восстановленный файл, первый файл бесплатно, а опции очистки удаляют старую аналитику, конвертируют ссылки в относительные и минифицируют ассеты. Результат деплоится на ваш хостинг в один клик или экспортируется как XML, CSV или JSON с полным манифестом файлов, если хотите сырой материал. В любом случае перечисление, которое вы только что сделали, точно говорит, что должно содержать качественное восстановление.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Карта сайта содержит все страницы сайта?
Нет. Карта сайта перечисляет только то, что публикует CMS: нет сирот-страниц, нет загрузок, ничего удалённого и ничего, живущего за пределами CMS. Воспринимайте её как самоотчёт сайта, а не перепись.
Как найти страницы-сироты, на которые не указывают внутренние ссылки?
Комбинируйте три источника: данные о показах из Search Console, индекс Wayback CDX и логи сервера, если есть. Сироты, которые когда-либо получали трафик или были захвачены, появятся хотя бы в одном из трёх.
Можно ли найти страницы, удалённые годы назад?
Да, именно это и даёт API Wayback CDX: каждый URL, который Internet Archive когда-либо захватывал, включая страницы, удалённые десять лет назад. Живые методы вроде карт сайта и краулеров не видят удалённый контент вообще.
Законно ли обходить чужой сайт?
Вежливый обход публичных страниц общепринят, и суды в нескольких юрисдикциях признали скрейпинг публичных данных законным, но уважайте robots.txt, соблюдайте условия использования сайта, держите низкую частоту запросов и помните, что перепубликация защищённого контента, отдельный вопрос от его чтения.
Почему мой краулинг находит больше страниц, чем проиндексировал Google?
Обходимое и индексируемое, разные вещи. Google отказывается индексировать страницы, которые считает тонкими, дублирующимися или малополезными, а фильтрованная навигация может раздуть ваш краулинг квазидубликатами URL. Отчёт об индексировании в Search Console показывает, к какой категории относится каждая страница.
Какой самый быстрый способ получить полную инвентаризацию страниц?
Получите карту сайта, затем выгрузите индекс CDX с collapse=urlkey, объедините два списка и дедуплицируйте. Для большинства сайтов это меньше часа работы и охватывает и настоящее, и всю архивную историю.
Похожие гайды

wayback machine downloader
Инструменты для скачивания из Wayback Machine: что реально работает
Честный обзор инструментов для скачивания из Wayback Machine: опенсорс-скрипты, их реальные ограничения и готовое решение, которое вернёт ваш сайт в онлайн.

download entire website from archive org
Загрузка всего сайта из Archive.org, а не только главной страницы
Чтобы загрузить весь сайт из archive.org, вам нужны все страницы, изображения и стили. Ресурсы скрываются под разными временными метками, вот почему это происходит, а также полный чек-лист.

find website history
Поиск истории сайта: докажите, что и когда было опубликовано
Найдите историю сайта, которая выдержит проверку: архивные снимки, временные метки и независимые источники для споров, журналистики и OSINT-расследований.

restore deleted site
Восстановление удалённого сайта: что делать в первые 48 часов
Хостинг удалил ваш сайт? Следуйте этому плану действий на 48 часов, а затем восстановите удалённый сайт из веб-архивов шаг за шагом.
