Pobieranie całej witryny z Wayback Machine
Autor: zespół redakcyjny Restorix · 26 maja 2026 · 6 min czytania

Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Zapisanie jednej strony z Wayback Machine zajmuje dwie minuty. Zapisanie całej witryny to zupełnie inne zadanie, takie, które może pochłonąć cały weekend, jeśli podejdziesz do niego bez przygotowania. Archiwum nie przechowuje Twojej witryny jako spójnej całości. Zawiera tysiące oddzielnych zrzutów, każdy zamrożony w swoim własnym czasie indeksowania, a złożenie ich z powrotem w jedną działającą witrynę to moment, w którym większość osób utyka. Ten przewodnik omawia pułapki, które faktycznie psują pobieranie całych witryn, oraz moment, w którym automatyzacja przestaje być opcjonalna.
Dlaczego pobranie witryny z Wayback Machine jest trudniejsze niż jednej strony
Strona to jeden zrzut. Witryna to każdy adres URL, jaki crawler kiedykolwiek znalazł, zarchiwizowany według własnego harmonogramu. Twoja strona główna może mieć 9 000 zrzutów. Strona zwrotów może mieć trzy, a najnowszy może pochodzić z 2017 roku. Pobierając witrynę z Wayback Machine, składasz mozaikę z kafelków, które nigdy nie były zaprojektowane, by do siebie pasować.
Zasoby dodatkowo komplikują sprawę. Logo to jeden zrzut. Arkusz stylów to inny, prawdopodobnie z innego roku. Archiwum serwuje każdy z nich z przepisanymi adresami URL, które działają tylko wewnątrz web.archive.org, więc naiwna kopia witryny psuje się w momencie otwarcia jej lokalnie. Jedna stronie wybacza te grzechy. Pięćset stron je mnoży.
Zmapuj witrynę, zanim cokolwiek pobierzesz
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Nie zaczynaj od wget. Zacznij od CDX API i pobierz pełny wykaz tego, co archiwum faktycznie przechowuje:
web.archive.org/cdx/search/cdx?url=example.com/*&matchType=prefix&output=json&collapse=urlkey&filter=statuscode:200
To jedno zapytanie mówi Ci, ile unikalnych adresów URL istnieje, które sekcje crawler pokrył i gdzie są luki. Przy niedawnym projekcie, forum phpBB z 2009 roku, wykaz pokazał 22 000 unikalnych adresów URL. Może 1 400 z nich to była rzeczywista treść. Reszta to identyfikatory sesji, duplikaty wersji do druku i strony kalendarza, których nikt nigdy nie czytał.
Czytaj wykaz jak wykonawca
- Policz adresy URL według katalogów. Obszerny katalog /images oznacza, że zasoby przetrwały; szczupły zapowiada problemy później.
- Sprawdź rozkład dat dla każdej sekcji. Jeśli Twój blog kończy się w 2016 roku, ale strona główna sięga 2023, blog został odłączony lub zablokowany, a nie usunięty.
- Wczesne wykrywanie wzorców śmieci: parametry sesji, formularze odpowiedzi, sortowanie. Zawyżają liczbę i czas pobierania.
- Zwróć uwagę na typy MIME. Dużo text/html bez wpisów obrazów oznacza, że archiwum zachowało szkielet, a straciło skórę.
Jeśli chcesz uzyskać wykaz bez pisania ani jednego zapytania, darmowa wycena w Restorix pokazuje dokładną liczbę zarchiwizowanych plików i całkowity rozmiar dla domeny, zanim cokolwiek zapłacisz. Ta liczba zmienia plan. Trzysta plików to popołudnie zrób-to-sam. Trzydzieści tysięcy już nie.

Pułapki, które psują pobieranie witryny z Wayback Machine
Każdy punkt na tej liście kosztował mnie przynajmniej raz. Żaden nie jest oczywisty, dopóki nie jesteś trzy godziny w pobieraniu, a wynik nie ma sensu.
- Historia robots.txt. Przez lata archiwum odmawiało indeksowania lub serwowania stron zablokowanych przez robots.txt. Jeśli poprzedni właściciel źle go skonfigurował, całe katalogi po prostu nie istnieją w archiwum i żadne narzędzie ich nie przywoła.
- Rozrost hostów. www.example.com, example.com, blog.example.com i stary host CDN to różne zestawy zrzutów. Zapytanie prefiksowe o jednym hoście po cichu pomija pozostałe, a tak samo działa skrypt crawlera.
- http versus https. Ta sama strona pod obu schematami jest archiwizowana dwukrotnie, czasem z różnymi zasobami. Wybierz wariant z lepszym pokryciem, nie ten, który pamiętasz.
- Strony renderowane przez JavaScript. Crawler zapisał to, co potrafił wykonać w czasie indeksowania. Witryna React z 2019 roku może wrócić jako pusta powłoka div-ów bez faktycznej treści.
- Przesunięcie znaczników czasu. Pliki z 2014, 2017 i 2021 roku złączone w jedną witrynę dają zepsute układy i niedopasowaną nawigację. Zakotwicz wszystko na jednej dacie docelowej.
- Nakładka Wayback. Zrzuty serwowane normalnie zawierają pasek narzędzi archiwum i przepisane linki. Pobieraj z sufiksem id_ przy znaczniku czasu albo planuj usuwanie nakładki z każdego zapisanego pliku.
Ciągi zapytań, paginacja i inne pułapki URL
Strategia jest mechaniczna. Pobierz listę CDX, pogrupuj adresy URL według ścieżki przed znakiem zapytania i zdecyduj, które parametry niosą treść. Identyfikatory produktów i paginacja: zachowaj. Identyfikatory sesji, tagi UTM i permutacje filtrów: odrzuć. Pomyłka w jedną stronę kosztuje Cię prawdziwe strony. Pomyłka w drugą, pobierasz dziesięciokrotnie więcej śmieci i płacisz za to godzinami.
The strategy is mechanical. Pull the CDX list, group URLs by the path before the question mark, and decide which parameters carry content. Product IDs and pagination: keep. Session IDs, UTM tags, and filter permutations: drop. Get this wrong in one direction and you lose real pages. Get it wrong in the other and you download ten times the junk and pay for it in hours.

Gdy pobranie witryny z Wayback Machine wraca z lukami
Brakujące zasoby to reguła, nie wyjątek. Spodziewaj się luk w:
- Obrazach ładowanych leniwie i wstrzykiwanych przez JavaScript, których crawler nigdy nie wyzwolił
- Obrazach tła CSS i czcionkach webowych odwoływanych z wnętrza arkuszy stylów
- Plikach wideo i audio, które archiwum przechowuje co najwyżej niespójnie
- Czcionkach i ikonach ładowanych przez zestawy zewnętrznych dostawców wymagające aktywnego klucza API
- Wszystkim serwowanym z zewnętrznej domeny, sieci reklamowej lub za loginem
Dla każdej luki Twoje opcje są ograniczone: spróbuj sąsiednich znaczników czasu, wariantów www i bez www albo http i https, albo zaakceptuj stratę i wygeneruj zasób ponownie. Tu manifest udowadnia swoją wartość. Restorix dostarcza manifest plików w formacie JSON lub SQLite przy każdym przywracaniu, więc ustalenie, których plików brakuje, staje się zapytaniem filtrowania zamiast popołudniem klikania przez strony.
Kiedy przestać pisać skrypty i zautomatyzować
Policz to uczciwie. Solidny skrypt pobierania dla chaotycznej witryny to weekend budowania i debugowania, plus godziny ponownych uruchomień, gdy archive.org zacznie Cię ograniczać przy pliku 8 000 z 9 000. Potem zaczyna się cały drugi projekt: usuwanie przepisań Wayback, naprawa linków wewnętrznych, wybór kanonicznego hosta, wdrożenie i testowanie.
Automatyzacja ma sens w momencie, gdy witryna ma znowu działać, a nie tylko istnieć na Twoim dysku. usługa przywracania witryn obsługuje pobieranie, czyszczenie i wdrożenie w jednym zadaniu: płacisz za przywrócony plik, pierwszy plik za darmo, cena zablokowana w momencie wyceny, a automatyczny zwrot na saldo, jeśli cokolwiek się nie uda. Droga zrób-to-sam nadal ma sens dla małych witryn, pobierania do badań i osób, które naprawdę lubią rozwiązywać zagadki. Przeszedłem obie ścieżki więcej razy, niż potrafię zliczyć, a próg opłacalności nadchodzi szybciej, niż się oczekuje, zwykle przy drugim ponownym uruchomieniu.
Od pobranych plików do działającej witryny
- Usuń pasek narzędzi Wayback i przepisz każdy adres archive.org z powrotem na ścieżkę względną.
- Wybierz jeden kanoniczny host, www lub bez www, i przekieruj drugi.
- Przekonwertuj linki wewnętrzne na HTTPS przed wdrożeniem w dowolnym nowoczesnym środowisku.
- Usuń martwe skrypty zewnętrzne: stare analityki, tagi reklamowe i widżety społecznościowe, które łączą się z domami.
- Wdróż, a potem kliknij przez 50 najważniejszych stron z otwartą kartą sieci w przeglądarce, aby wyłapać, co nadal zwraca 404.
Dwie rzeczy zawsze zawodzą na tym etapie: formularze kontaktowe i wyszukiwarka. Obie zależały od kodu serwerowego, którego archiwum nigdy nie przechwyciło. Zastąp formularze usługą formularzy hostowaną lub zwykłym linkiem mailto, a wyszukiwarkę witryny zamień na statyczny indeks lub pole wyszukiwania ograniczone do wyszukiwarki.
Restorix zawiera to wszystko w opcjach przywracania: względne linki wewnętrzne, konwersja HTTPS, usuwanie analityk, wdrożenie jednym kliknięciem przez SSH, FTP lub S3, oraz mały wbudowany CMS, dzięki któremu przywrócona witryna pozostaje edytowalna. Zrób to ręcznie lub pozwól usłudze to zrobić, lista kontrolna jest ta sama. Różnią się tylko godziny.
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
FAQ
Czy mogę pobrać całą witrynę z Wayback Machine za darmo?
Tak, korzystając ze skryptów open-source i własnego czasu. Samo pobieranie nic nie kosztuje; to czyszczenie jest tym, za co płacisz w godzinach. Dla małej witryny statycznej ta wymiana jest w porządku. Dla sklepu z 10 000 adresów URL wycen swój weekend, zanim się zaangażujesz.
Dlaczego niektóre strony mojej witryny nie są w archiwum?
Zwykłe powody: robots.txt blokował crawlera, strona nigdy nie była nigdzie linkowana, gdzie crawler mógłby ją znaleźć, wymagała loginu lub istniała tylko krótko między indeksowaniami. Wykaz CDX API pokazuje dokładnie, co istnieje, więc sprawdź, zanim założysz.
Jak uzyskać listę wszystkich zarchiwizowanych adresów URL dla mojej domeny?
Odpytaj web.archive.org/cdx/search/cdx?url=example.com/*&matchType=prefix&output=json. Dodaj collapse=urlkey, aby usunąć duplikaty według adresu URL, i filter=statuscode:200, aby odrzucić zrzuty błędów. Wynik to Twoja rzeczywista mapa witryny.
Czy przywracać najnowszy zrzut czy starszy?
Najnowszy nie jest automatycznie najlepszy. Wybierz zrzut z czasu, gdy witryna była zdrowa: zanim została zhakowana, zaparkowana lub rozebrana na części. Porównaj kilka dat kandydujących w widoku kalendarza i sprawdź, jak kompletna wygląda każda, zanim się zdecydujesz.
Czy Wayback Machine archiwizuje wideo i pliki do pobrania?
Czasem. Duże media są przechwytywane niespójnie, podczas gdy pliki PDF i obrazy wypadają znacznie lepiej. Przefiltruj wykaz CDX według typu MIME, zanim komukolwiek obiecasz, że biblioteka mediów przetrwała.
Jak długo trwa pobieranie całej witryny?
Witryna 500-stronicowa przez uprzejmy skrypt: kilka godzin z ograniczeniem tempa. Dziesiątki tysięcy plików: dzień lub więcej nadzorowania i ponownych uruchomień. Automatyczne przywracanie działa na infrastrukturze kogoś innego, podczas gdy Ty obserwujesz postęp w panelu.
Powiązane poradniki

download entire website from archive org
Pobierz całą witrynę z archive.org, nie tylko stronę główną
Aby pobrać całą witrynę z archive.org, potrzebujesz każdej strony, obrazu i arkusza stylów. Zasoby kryją się pod różnymi znacznikami czasu, oto dlaczego, plus pełna lista kontrolna.

wayback download
Pobieranie z Wayback: każda metoda uszeregowana według nakładu pracy
Każda metoda pobierania z Wayback uszeregowana według nakładu pracy: pojedyncze strony, skrypty wget, API CDX oraz automatyczne usługi, które odbudowują za Ciebie całą witrynę.

wayback machine restore
Odtwarzanie z Wayback Machine: 4 pułapki i jak ich uniknąć
Odtwarzanie z wayback machine może zawieść po cichu: strony parkingowe, łańcuchy przekierowań, brakujące obrazy, pomieszane daty. Jak rozpoznać każdą pułapkę i jej uniknąć.

find all pages on a website
Jak znaleźć wszystkie strony witryny (również te usunięte)
Potrzebujesz znaleźć wszystkie strony witryny – także te, do których nikt nie linkuje? Porównaj mapy witryny (sitemap), crawlery, interfejs Wayback CDX API oraz eksporty z Search Console.
