Pobierz całą witrynę z archive.org, nie tylko stronę główną
Autor: zespół redakcyjny Restorix · 15 lipca 2026 · 6 min czytania

Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Każdy potrafi zapisać stronę główną. Strona główna to łatwa część, to 4000 plików za nią odróżnia 'złapałem kopię' od 'naprawdę mam tę witrynę'. Gdy ktoś prosi mnie o pobranie całej witryny z archive.org, strona główna zwykle już leży na jego pulpicie, a arkusz stylów, nie.
Ten tekst dotyczy słowa 'cała'. Co naprawdę zawiera kompletna kopia, dlaczego archiwum rozrzuca twoje zasoby na lata różnych znaczników czasu, oraz lista kontrolna, którą możesz uruchomić na końcu, aby udowodnić, że masz wszystko, zamiast mieć nadzieję, że tak jest.
Co oznacza 'cała', gdy pobierasz całą witrynę z archive.org
Kompletna kopia ma cztery warstwy, a większość ludzi zatrzymuje się po pierwszej. HTML dla każdej strony, która istniała. Zasoby, do których odwołuje się każda strona: obrazy, arkusze stylów, JavaScript, czcionki, PDF-y, filmy. Linki wewnętrzne przepisane tak, aby kopia działała samodzielnie, bez opierania się na serwerach archive.org. Oraz manifest tego, co zostało przechwycone, aby luki były udokumentowane, a nie odkrywane później przez klienta.
- Strony: każdy URL, który kiedykolwiek zobaczył robot indeksujący, nie tylko te w głównym menu. Stare witryny ukrywają całe sekcje za zapomnianymi linkami w stopce.
- Zasoby: obrazy, CSS, JS, czcionki i pliki do pobrania, na większości witryn jest ich pięć razy więcej niż stron.
- Linki: przepisane na ścieżki względne, w przeciwnym razie twoja kopia działa tylko tak długo, jak archive.org.
- Manifest: lista plik po pliku tego, co masz, zamieniająca 'wydaje mi się, że mam wszystko' w coś sprawdzalnego.
Liczba plików zaskakuje. Skromna, 50-stronicowa witryna firmowa rutynowo liczy 400–800 plików. Forum phpBB z 2009 roku z awatarami użytkowników i załącznikami może sięgać dziesiątek tysięcy. Planuj według liczby plików, nie stron.
Jest też różnica między kopią do przeglądania a kopią do ponownego wdrożenia. Kopia do przeglądania potrzebuje tylko plików i działających linków. Kopia, którą zamierzasz ponownie umieścić na hostingu, wymaga więcej: spójnych kanonicznych adresów URL (wybierz www lub bez www), odwołań gotowych na HTTPS oraz usunięcia zbędnego balastu, takiego jak dziesięcioletnie skrypty analityczne. Zdecyduj, którą z nich budujesz, zanim zaczniesz, bo dostosowywanie którejkolwiek z nich później jest żmudne.
Dlaczego zasoby znajdują się pod różnymi znacznikami czasu
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Wayback Machine nie fotografuje całej witryny w jedno popołudnie. Jego roboty pobierają to, co mogą osiągnąć, kiedy akurat im się to uda. Twoja strona główna z 2014 roku może odwoływać się do logo ostatnio przechwyconego w 2012, arkusza stylów przechwyconego sześć razy na przestrzeni pięciu lat i obrazu głównego, który nigdy nie został przechwycony. Gdy przeglądasz tę stronę, archive.org po cichu podstawia najbliższe dostępne przechwycenie dla każdego zasobu. Dlatego strona wygląda dobrze w przeglądarce, mimo że jej części są rozrzucone na przestrzeni dekady.
Wynikają z tego dwie konsekwencje. Po pierwsze, nie ma jednego 'znacznika czasu witryny', który można wskazać narzędziu do pobierania, kompletne pobranie wyciąga każdy plik z jego własnego najlepszego przechwycenia. Po drugie, sztuczka z najbliższym przechwyceniem ukrywa luki: wayback chętnie wstawi obraz z 2016 roku na twoją stronę z 2014, nie wspominając o tym. Nieszkodliwe przy zwykłym przeglądaniu, warte uwagi, gdy zależy ci na tym, czy odtworzona strona naprawdę jest tą z 2014.
Zarchiwizowana strona to kolaż. HTML, obrazy i CSS zostały zamrożone w różnych momentach, a archiwum skleja je ponownie za każdym razem, gdy ktoś na nią patrzy.

Każde narzędzie lub skrypt, którego używasz, potrzebuje na to strategii. Leniwą strategią, pobranie wszystkiego z jednego znacznika czasu, dokładnie tak kończysz ze stroną pełną ikon uszkodzonych obrazów, ponieważ połowa zasobów po prostu nie ma przechwycenia w tym tygodniu. Właściwą strategią jest podejście per plik: pobierz każdy zasób z jego własnego najbliższego dobrego przechwycenia w twoim zakresie dat.
Jak pobrać całą witrynę z archive.org: zacznij od inwentaryzacji
Zanim pobierzesz choć jeden plik, sprawdź, co archiwum faktycznie zawiera. API CDX daje ci pełny rejestr dla domeny: każdy przechwycony URL z jego znacznikami czasu, typem MIME i statusem HTTP. Przefiltruj do kodu statusu 200, zwiń duplikaty skrótów treści i masz realistyczną listę zakupów zamiast domysłów.
Przeczytaj inwentaryzację przed pobieraniem, a dowiesz się nieprzyjemnych rzeczy wcześnie. W przypadku tamtego forum phpBB, lista CDX pokazała 11 000 przechwyconych URL-i, a około 3 000 z nich to ten sam GIF awatara zapisany pod różnymi ciągami zapytań. Zwijanie duplikatów zmieniło przerażające zadanie w zwykłe. Ta sama lista ujawnia również strony, które nigdy nie zostały przechwycone, a których żadna metoda pobierania na świecie nie jest w stanie przywrócić. Lepiej wiedzieć to od pierwszego dnia.
Pogrupuj ocalałe według typu MIME, a ukaże się kształt zadania: ile stron HTML, ile obrazów, ile JavaScriptu, czy są PDF-y lub filmy, o które trzeba się martwić. To grupowanie napędza zarówno kolejność pobierania, jak i ostateczną kontrolę kompletności.
Lista kontrolna, aby pobrać całą witrynę z archive.org bez luk
- Pobierz inwentaryzację CDX dla domeny, przefiltrowaną do przechwyceń HTTP 200, obejmującą cały zakres dat.
- Zwiń duplikaty skrótów treści, aby identyczne pliki pobierały się raz, a nie setki razy.
- Pogrupuj listę według typu MIME: najpierw strony HTML, potem CSS, JS, obrazy, czcionki, dokumenty, multimedia.
- Pobierz każdy plik z jego własnego najlepszego przechwycenia, używając modyfikatora id_, aby uzyskać oryginalne bajty bez wstrzykiwanego znacznika wayback.
- Przepisz linki wewnętrzne na ścieżki względne, aby kopia działała na dowolnym hoście, w tym na twoim laptopie.
- Udostępnij folder lokalnie i przeklikaj go. Uszkodzone linki, brakujące obrazy i błędy 404 czcionek pojawią się w ciągu kilku minut.
- Porównaj ostateczną liczbę plików z inwentaryzacją i zapisz, czego brakuje i dlaczego.

Ten ostatni krok to ten, który wszyscy pomijają, i to on stanowi różnicę między kopią zapasową a stertą plików. Manifest zamienia 'wydaje mi się, że mam wszystko' w listę, którą można skontrolować. Nasza funkcja przywracania ma to wbudowane: darmowa wycena podaje dokładną liczbę zarchiwizowanych plików i całkowity rozmiar przed rozpoczęciem, a odtworzenie może wyeksportować manifest JSON lub SQLite każdego przywróconego pliku, więc kompletność jest liczbą, a nie odczuciem.
Luki, na które i tak trafisz
- Strony, których robot nigdy nie znalazł. Jeśli nic w publicznej sieci nie linkowało do strony, wayback prawdopodobnie nigdy jej nie widział.
- Wykluczenia robots.txt. Starsze indeksowania całkowicie pomijały niedozwolone ścieżki, a niektóre witryny celowo blokowały archiwizację.
- Treści renderowane przez JavaScript. Roboty historycznie przechowywały szkielet HTML, a nie to, co skrypty zbudowały później.
- Logowania, koszyki i wyniki wyszukiwania. Wszystko za żądaniem POST lub sesją to ściana, której robot nie mógł pokonać.
- Szum URL-i. Identyfikatory sesji i parametry śledzenia nadmuchują inwentaryzację tysiącami zduplikowanych 'stron', które po deduplikacji sprowadzają się do kilku prawdziwych.
Żadne z nich nie jest porażką twojej metody, to dziury w samym archiwum. Wartość inwentaryzacji polega na tym, że pokazuje ci te dziury, zanim obiecasz komukolwiek pełne odtworzenie.
Gdy znajdziesz dziury, udokumentuj je. Jednostronicowa notatka wymieniająca dwanaście stron, które nigdy nie zostały przechwycone, film, który istnieje tylko jako miniatura, i sekcję forum zablokowaną przez robots.txt zamienia niezręczną niespodziankę w zarządzane oczekiwanie. Klienci wybaczają brakujące pliki. Nie wybaczają odkrywania ich na własną rękę.
Ile warta jest kompletna kopia
Jeśli witryna to sklep klienta lub forum społecznościowe z dekadą postów, połowiczne pobranie to zobowiązanie przebrane za kopię zapasową. Albo zaplanuj godziny na samodzielne wykonanie listy kontrolnej, albo przekaż indeksowanie, dopasowywanie znaczników czasu, przepisywanie linków i tworzenie manifestu narzędziu zbudowanemu dokładnie do tego zadania. Wycena nic nie kosztuje, a alternatywą jest znalezienie brakujących 300 obrazów po uruchomieniu witryny.
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
FAQ
Czy mogę pobrać całą witrynę z archive.org jednym kliknięciem?
Samo Archive.org nie oferuje eksportu całej witryny, jest zbudowane do przeglądania pojedynczych przechwyceń. Wyniki jednym kliknięciem pochodzą z narzędzi, które wyliczają indeks archiwum i pobierają każdy plik: skryptów takich jak wayback-machine-downloader lub usług odtwarzania, takich jak Restorix, które obsługują również zasoby, przepisywanie linków i manifest.
Dlaczego brakuje obrazów po pobraniu całej witryny z archive.org?
Zwykle z jednego z dwóch powodów. Albo obraz nigdy nie został zindeksowany, więc nigdzie nie istnieje jego kopia, albo twoje narzędzie pobrało stronę z jednego znacznika czasu, podczas gdy jedyne zachowane przechwycenie obrazu znajduje się pod innym. Dopasowywanie zasobów między znacznikami czasu naprawia drugi przypadek; nic nie naprawia pierwszego.
Czy Wayback Machine archiwizuje każdą stronę witryny?
Nie. Archiwizuje to, do czego mogły dotrzeć jego roboty: strony, do których prowadzą linki, dozwolone przez robots.txt, renderowane bez logowania i ciężkiego JavaScriptu. Głębokie wątki forum, strony z fasetowym wyszukiwaniem i obszary administracyjne są rutynowo nieobecne. Inwentaryzacja CDX pokazuje dokładnie, co istnieje, zanim zaczniesz.
Ile plików zwykle obejmuje kompletne pobranie witryny?
Więcej, niż ludzie się spodziewają. Skromna, 50-stronicowa witryna firmowa często liczy 400–800 plików, gdy policzysz obrazy, arkusze stylów, skrypty i czcionki. Fora i sklepy sięgają dziesiątek tysięcy. To liczba plików, a nie stron, decyduje o czasie i koszcie pobierania.
Czy PDF-y, filmy i inne pliki do pobrania są uwzględnione w archiwum?
Często tak. Archiwum przechowuje dokumenty i multimedia, do których mogło dotrzeć, a indeks CDX wymienia je według typu MIME obok stron. Duże filmy są wyjątkiem, były indeksowane niespójnie, więc zweryfikuj je w inwentaryzacji, zamiast zakładać, że przetrwały.
Powiązane poradniki

download a website from archive org
Jak pobrać stronę internetową z Archive.org: 3 skuteczne sposoby
Trzy sprawdzone sposoby na pobranie strony z archive.org: ręczne zapisywanie stron, skryptowanie API CDX lub automatyczne odtwarzanie. Realistyczne szacunki czasu dla każdej metody.

archive.org download website
Narzędzia do pobierania stron z Archive.org: Uczciwe porównanie
Uczciwe porównanie narzędzi do pobierania stron z Archive.org: HTTrack, skrypty wayback-machine-downloader i Restorix. Rzeczywiste koszty, nakład pracy i obsługa zasobów.

find all pages on a website
Jak znaleźć wszystkie strony witryny (również te usunięte)
Potrzebujesz znaleźć wszystkie strony witryny – także te, do których nikt nie linkuje? Porównaj mapy witryny (sitemap), crawlery, interfejs Wayback CDX API oraz eksporty z Search Console.

wayback download
Pobieranie z Wayback: każda metoda uszeregowana według nakładu pracy
Każda metoda pobierania z Wayback uszeregowana według nakładu pracy: pojedyncze strony, skrypty wget, API CDX oraz automatyczne usługi, które odbudowują za Ciebie całą witrynę.
