Jak znaleźć wszystkie strony witryny (również te usunięte)
Autor: zespół redakcyjny Restorix · 25 maja 2026 · 7 min czytania

Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Ile stron ma nasza witryna? Brzmi jak pytanie, za którym stoi baza danych. Rzadko tak jest. W zeszłym roku klient twierdził, że jego strona ma około 400 podstron. Mapa witryny wskazywała 1 900. Crawler znalazł 3 400. Indeks Wayback Machine wymieniał 11 000 adresów URL, jakie kiedykolwiek wyświetliła witryna – połowę z nich dawno usunięto. Cztery źródła, cztery odpowiedzi – i wszystkie były poprawne, ale każde dotyczyło czegoś innego.
Oto cztery metody, których używam, aby znaleźć wszystkie strony witryny, co każda z nich faktycznie obejmuje i jak połączyć je w jedną czystą listę, na której możesz działać.
Dlaczego trudno jest znaleźć wszystkie strony witryny
Nie istnieje żadna główna lista, chyba że CMS akurat taką prowadzi – a nawet wtedy zna tylko siebie. Prawdziwe witryny gromadzą strony, które wykraczają poza jakikolwiek pojedynczy spis: osierocone strony, do których nie prowadzi żadne menu, sekcje pozostawione po starej migracji, pliki raz przywołane w kampanii e-mailowej, fasetowane adresy URL generowane na bieżąco, całe subdomeny, które ktoś założył w 2016 roku i o nich zapomniał.
Każda metoda odkrywania widzi inny wycinek tego bałaganu. Mapa witryny to samoopis CMS-a. Crawler mapuje graf linków. Indeks CDX Wayback Machine pamięta historię. Search Console raportuje to, co Google faktycznie wyświetlił użytkownikom. Żadna nie jest kompletna; razem są blisko.
Zdecyduj, do czego lista ma służyć, zanim ją zbudujesz. Inwentaryzacja migracyjna, audyt SEO i odzyskiwanie martwej witryny potrzebują tych samych surowców, ale innego oczyszczania.
Mapa witryny: najszybszy sposób na znalezienie wszystkich stron witryny
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Zacznij od /sitemap.xml. Jeśli zwraca błąd 404, sprawdź w robots.txt dyrektywę Sitemap: – wiele witryn umieszcza plik w nietypowej ścieżce. WordPress od wersji 5.5 udostępnia /wp-sitemap.xml; Yoast i Rank Math generują /sitemap_index.xml, który rozgałęzia się na podmapy dla poszczególnych typów treści. Pobierz indeks, a następnie każdą podmapę.
Protokół ogranicza każdy plik sitemap do 50 000 adresów URL i 50 MB nieskompresowanych, więc duże witryny zawsze używają indeksów – nie zatrzymuj się na pierwszym znalezionym pliku.
A teraz zastrzeżenia, ponieważ mapy witryny kłamią przez pominięcie. Mapa witryny wymienia tylko to, co wie CMS: żadnych osieroconych plików multimedialnych, żadnych stron usuniętych lata temu, żadnych starych sekcji działających poza CMS-em, niczego, co generuje ten niestandardowy skrypt w /old-tools/. A w przypadku ręcznie tworzonych lub nieaktualnych map witryny nawet znana lista jest fikcją. Sprawdź wyrywkowo daty ostatniej modyfikacji na stronach, które ostatnio aktualizowałeś; jeśli się różnią, nie ufaj niczemu.

Przecrawluj witrynę tak, jak zrobiłby to Googlebot
Crawler zaczyna od strony głównej i podąża za każdym widocznym linkiem, tak samo jak robi to wyszukiwarka. Screaming Frog to standard branżowy i jest darmowy do 500 adresów URL; Sitebulb jest przyjaźniejszy dla audytów; dla pełnej kontroli mały skrypt w Pythonie z requests i BeautifulSoup – lub wget w trybie pająka – nic nie kosztuje.
Crawling znajduje to, co pomijają mapy witryny: archiwa stronicowane, których nikt nie dodał do mapy, strony tagów i kategorii, zepsute linki prowadzące do stron, które nadal istnieją, łańcuchy przekierowań pochłaniające budżet indeksowania.
Jego martwe pola to lustrzane odbicie map witryny. Jeśli do strony nie prowadzi żaden link, crawler jej nie znajdzie. Menu renderowane w JavaScript wymagają przeglądarki bezgłowej, w przeciwnym razie crawling zatrzymuje się na stronie głównej. A fasetowana nawigacja – filtry, kalendarze, sortowanie – może rozdmuchać 500-stronicowy sklep w pułapkę na crawla z 500 000 adresów URL; ustaw reguły wykluczeń przed rozpoczęciem, a nie po. Na witrynach, których nie jesteś właścicielem, utrzymuj niską współbieżność i honoruj robots.txt.
Wayback CDX API: znajdź wszystkie strony witryny, dawne i obecne
To metoda, której prawie nikt nie używa, a która znajduje najwięcej. Serwer CDX Internet Archive wyświetli każdy adres URL, jaki kiedykolwiek przechwycił dla hosta – włącznie ze stronami usuniętymi dekadę temu, których żadna aktywna metoda nie jest w stanie zobaczyć.
Jedno polecenie curl daje pełny spis:
curl "https://web.archive.org/cdx/search/cdx?url=example.com/*&output=text&fl=timestamp,original,statuscode&filter=statuscode:200&collapse=urlkey&from=2010&to=2020"
Parametry, które się liczą: collapse=urlkey usuwa duplikaty wielokrotnych przechwyceń tego samego adresu URL; filter=statuscode:200 odrzuca błędy 404 i przekierowania; matchType=domain poszerza zakres na subdomeny; from i to określają zakres lat. Dla martwej witryny to właśnie w tym przedziale dat znajduje się złoto.
Spodziewaj się dużych wolumenów. Długo działające forum lub sklep może zwrócić miliony wierszy, a szum w parametrach zapytania – identyfikatory sesji, parametry śledzące – rozdyma listę. API jest darmowe, ale z limitem żądań, więc bądź cierpliwy w przypadku dużych domen i podziel ogromne pobieranie na roczne fragmenty.

Jeśli chcesz uzyskać odpowiedź bez zagłębiania się w szczegóły, Restorix używa tego samego indeksu w swojej bezpłatnej wycenie – wklej domenę, a w ciągu kilku sekund poda dokładną liczbę zarchiwizowanych plików i całkowity rozmiar, bez konieczności wykonywania zapytań.
Google Search Console: znajdź wszystkie strony, które Twoja witryna pokazuje Google
W przypadku witryn, których jesteś właścicielem, Search Console dodaje jeden zestaw danych, którego nikt inny nie ma: co Google faktycznie zaindeksował i wyświetlał. Zweryfikuj własność, a następnie przeanalizuj dwa raporty.
- Raport skuteczności, zakładka Strony: każdy adres URL, który uzyskał wyświetlenie, można wyeksportować. Interfejs internetowy ogranicza eksport do 1 000 wierszy; Search Analytics API umożliwia stronicowanie daleko poza ten limit, a eksport zbiorczy do BigQuery dostarcza pełny zestaw danych codziennie.
- Indeksowanie, raport Strony: zaindeksowane a przecrawlowane-obecnie-niezaindeksowane, z przykładowymi adresami URL – szybki wgląd w to, jak dużą część witryny Google w ogóle zadaje sobie trud utrzymać.
Unikalną wartością są dane o wyświetleniach: strony, do których dotarli prawdziwi użytkownicy, w tym osierocone, do których nic nie linkuje. Jeśli zapomniana strona docelowa wciąż generuje trzydzieści kliknięć miesięcznie, trafia na listę do zachowania. Narzędzia Bing Webmaster Tools oferują te same raporty, jeśli ruch z Bing ma dla Ciebie znaczenie.
Połącz, usuń duplikaty i oczyść listę
Cztery źródła, cztery formaty – łączenie to moment, w którym pojawia się wartość. Wrzuć wszystko do jednego pliku CSV, a następnie znormalizuj przed deduplikacją, w przeciwnym razie ta sama strona pojawi się sześć razy w sześciu przebraniach.
Te przebrania nie są hipotetyczne. Jedna prawdziwa strona produktu może pojawić się jako https://www.example.com/page/?utm_source=newsletter, http://example.com/page, example.com/page/#comments, example.com/page?fbclid=abc123, www.example.com/page/index.html i EXAMPLE.com/page – sześć wierszy, jeden dokument. Wielkość liter, protokół, www, parametry, fragmenty i domyślne nazwy plików muszą zostać zredukowane do jednej formy kanonicznej, zanim deduplikacja będzie miała sens. Pomiń to, a Twój spis 11 000 adresów URL to tak naprawdę 6 000 adresów URL w kostiumach.
- Zamień hostname na małe litery; usuń fragmenty (#section) całkowicie.
- Usuń parametry śledzące: utm_*, fbclid, gclid, ref. Posortuj pozostałe parametry zapytania.
- Wybierz jedną konwencję dotyczącą końcowego ukośnika i egzekwuj ją.
- Zredukuj warianty protokołu i www do swojej formy kanonicznej.
Po deduplikacji sklasyfikuj każdy adres URL: aktywny (200), przekierowujący, obecnie 404, ale zarchiwizowany, lub całkowicie usunięty. Ten trzeci koszyk – usunięty, ale obecny w danych CDX – to ten, o którym migracje zapominają i którego później żałują. Dwudziestowierszowy skrypt w Pythonie radzi sobie z tym w przypadku większości witryn; arkusze kalkulacyjne dają radę do kilku tysięcy adresów URL.
Szybkie porównanie czterech źródeł:
| Źródło | Widzi usunięte strony? | Wymaga dostępu do witryny? | Co faktycznie obejmuje |
|---|---|---|---|
| sitemap.xml | Nie | Nie | Strony, które CMS przyznaje, obecnie |
| Crawler | Nie | Nie | Wszystko osiągalne przez linki |
| Wayback CDX API | Tak | Nie | Każdy adres URL, jaki kiedykolwiek przechwyciło archiwum |
| Search Console | Nie | Tak | Adresy URL, które Google zaindeksował lub wyświetlił |
Znalazłeś wszystkie strony – i co dalej?
W przypadku migracji lista staje się mapą przekierowań: każdy adres URL z wyświetleniami w Search Console lub przechwyceniami w danych CDX otrzymuje przekierowanie 301 do najbliższego współczesnego odpowiednika. W przypadku audytu SEO kolumny crawl i indeks ujawniają cienkie sekcje i pułapki indeksowania. Każde z tych zadań to kilka popołudni uczciwej pracy.
Jeśli lista jest dla martwej witryny, którą chcesz przywrócić, pomiń ręczną odbudowę. Restorix przywraca całość z Wayback Machine: bezpłatna wycena pokazuje dokładną liczbę plików i rozmiar z ustaloną ceną, płacisz za każdy przywrócony plik, pierwszy jest gratis, a opcje czyszczenia usuwają stare analityki, konwertują linki na względne i minifikują zasoby. Wynik wdraża się na Twoim hostingu jednym kliknięciem lub eksportuje jako XML, CSV lub JSON z pełnym manifestem plików, jeśli wolisz surowy materiał. W obu przypadkach praca inwentaryzacyjna, którą właśnie wykonałeś, mówi Ci dokładnie, co powinno zawierać dobre przywrócenie.
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
FAQ
Czy mapa witryny wymienia wszystkie strony witryny?
Nie. Mapa witryny wymienia tylko to, co publikuje CMS: żadnych osieroconych stron, żadnych przesłanych plików, nic usuniętego i niczego działającego poza CMS-em. Traktuj ją jako samoopis witryny, a nie spis powszechny.
Jak znaleźć osierocone strony, do których nie prowadzą żadne wewnętrzne linki?
Połącz trzy źródła: dane o wyświetleniach z Search Console, indeks Wayback CDX i logi serwera, jeśli je masz. Osierocone strony, które kiedykolwiek miały ruch lub zostały przechwycone, pojawią się w co najmniej jednym z tych trzech.
Czy mogę znaleźć strony usunięte lata temu?
Tak – to właśnie daje Ci Wayback CDX API: każdy adres URL, jaki kiedykolwiek przechwyciło Internet Archive, w tym strony usunięte dekadę temu. Aktywne metody, takie jak sitemapy i crawlery, w ogóle nie widzą usuniętych treści.
Czy legalne jest indeksowanie cudzej witryny?
Indeksowanie publicznych stron w sposób kulturalny jest ogólnie akceptowane, a sądy w kilku jurysdykcjach uznały skrobanie danych publicznych za zgodne z prawem – ale honoruj robots.txt, przestrzegaj regulaminu witryny, utrzymuj niską częstotliwość żądań i pamiętaj, że ponowne publikowanie treści chronionych prawem autorskim to osobna kwestia niż ich odczyt.
Dlaczego mój crawl znajduje więcej stron niż Google zaindeksował?
Możliwość indeksowania a faktyczne indeksowanie to różne rzeczy. Google odmawia indeksowania stron, które uzna za cienkie, duplikujące się lub o niskiej wartości, a fasetowana nawigacja może rozdąć Twój crawl o prawie-duplikaty adresów URL. Raport indeksowania w Search Console pokazuje, do której kategorii należy każda strona.
Jaki jest najszybszy sposób na uzyskanie pełnego spisu stron?
Pobierz mapę witryny, a następnie wyciągnij indeks CDX z parametrem collapse=urlkey, połącz obie listy i usuń duplikaty. W przypadku większości witryn to mniej niż godzina pracy i obejmuje zarówno teraźniejszość, jak i całą zarchiwizowaną przeszłość.
Powiązane poradniki

wayback machine downloader
Narzędzia do pobierania z Wayback Machine: co naprawdę działa
Szczere spojrzenie na narzędzia do pobierania z Wayback Machine: skrypty open-source, ich realne ograniczenia i opcja typu „gotowe rozwiązanie”, która przywraca Twoją witrynę do sieci.

download entire website from archive org
Pobierz całą witrynę z archive.org, nie tylko stronę główną
Aby pobrać całą witrynę z archive.org, potrzebujesz każdej strony, obrazu i arkusza stylów. Zasoby kryją się pod różnymi znacznikami czasu, oto dlaczego, plus pełna lista kontrolna.

find website history
Znajdź historię strony: udowodnij, co strona mówiła i kiedy
Historia strony, która się broni: archiwalne zrzuty, znaczniki czasu i źródła potwierdzające do sporów, dziennikarstwa i dochodzeń OSINT.

restore deleted site
Przywracanie usuniętej strony: co robić w ciągu pierwszych 48 godzin
Twój hosting usunął stronę? Postępuj zgodnie z tym 48-godzinnym planem działania, a następnie krok po kroku przywróć usuniętą stronę z archiwów internetowych.
