Jak pobrać stronę internetową z Archive.org: 3 skuteczne sposoby
Autor: zespół redakcyjny Restorix · 8 czerwca 2026 · 6 min czytania

Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Strona zniknęła. Hosting wygasł, klient nigdy nie zrobił kopii zapasowej, a jedyna wersja pozostała w Wayback Machine. Odbierałem ten telefon więcej razy, niż potrafię zliczyć, a pierwsze pytanie zawsze brzmi tak samo: czy można pobrać stronę z archive.org i ją odzyskać?
Tak, można. Istnieją trzy realistyczne ścieżki: ręczne zapisywanie stron, skryptowanie z wykorzystaniem API CDX lub zlecenie automatycznego odtwarzania serwisowi. Różnią się one znacząco nakładem pracy, a zły wybór kosztuje Cię cały weekend. Oto jak każda z nich działa w praktyce, wraz ze szczerymi szacunkami czasu, opartymi na doświadczeniu zawodowym.
Co naprawdę oznacza pobieranie z Wayback Machine
Wayback Machine to nie folder ze stronami, który można pobrać jednym kliknięciem. To ogromny indeks pojedynczych zrzutów – każda strona, obraz, arkusz stylów i skrypt przechowywane są osobno, każdy powiązany z momentem, w którym został zarchiwizowany. Gdy przeglądasz starą stronę, Twoja przeglądarka pobiera HTML z jednego zrzutu, a obrazy z kilku innych, łącząc je na bieżąco.
Pobranie strony oznacza więc wyliczenie setek lub tysięcy pojedynczych plików, pobranie każdego z nich i przepisanie wewnętrznych linków, aby kopia działała poza archive.org. Miej ten model w głowie – wyjaśnia on, dlaczego każda z poniższych metod działa tak, a nie inaczej, i dlaczego żadna nie sprowadza się do jednego przycisku pobierania.
Metoda 1: ręczne pobieranie strony z archive.org
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Naiwne podejście, ale czasami właściwe. Otwierasz zrzut w Wayback Machine i zapisujesz każdą stronę za pomocą przeglądarki. Dla pięciostronicowej wizytówki to naprawdę wystarczy. Przy większych serwisach to powolna tortura.
- Otwórz zarchiwizowaną stronę z wybraną datą zrzutu.
- Użyj opcji Zapisz jako i wybierz „Strona internetowa, kompletna”, aby pobrać również zasoby.
- Powtórz dla każdej strony, w tym tych dostępnych tylko ze starych menu.
- Otwórz zapisany HTML i usuń znaczniki paska narzędzi Wayback z każdego pliku.
- Popraw lub zaakceptuj adresy URL zasobów, które wciąż wskazują na web.archive.org.
Czyhają tu dwie pułapki. Zapisany HTML odwołuje się do web.archive.org w przypadku wielu zasobów, więc kopia przestaje działać, gdy otworzysz ją offline lub archiwum ma gorszy dzień. Ponadto znaczniki paska narzędzi wbudowane w każdą zapisaną stronę trzeba usuwać ręcznie, plik po pliku. Wciąż używam tej metody dla pojedynczych stron – klient potrzebował kiedyś tylko starej strony z cennikiem do sporu prawnego i jedno zapisanie zajęło dwie minuty. Ich 300-stronicowy sklep został potraktowany inaczej.
- Realistyczny nakład pracy: 5–10 minut na stronę, po uwzględnieniu czyszczenia zasobów.
- Dobre dla: maksymalnie około 10 stron lub pobrania jednej konkretnej strony do celów referencyjnych.
- Zawodzi przy: dziesiątkach stron lub każdym zadaniu, gdzie potrzebny jest czysty, oryginalny kod.

Metoda 2: pobieranie strony z archive.org za pomocą API CDX
API CDX to punkt końcowy indeksu Wayback Machine i to dzięki niemu znajdujesz każdy plik, jaki archive.org przechowuje dla domeny. Jedno zapytanie zwraca pełny rejestr w formacie JSON:
web.archive.org/cdx/search/cdx?url=example.com/*&output=json&fl=timestamp,original,mimetype,statuscode&filter=statuscode:200&collapse=digest
Otrzymujesz znaczniki czasu, oryginalne adresy URL i typy MIME dla wszystkiego, co zostało zarchiwizowane. Parametr collapse deduplikuje identyczne pliki, więc nie pobierasz tego samego logo 400 razy. Następnie mały skrypt przechodzi przez listę i pobiera każdy plik. Dodaj id_ do adresu URL ze znacznikiem czasu – np. /web/20150312145531id_/http://example.com/style.css – a archive.org zwróci oryginalne bajty bez przepisanego kodu. Ten jeden przyrostek to różnica między czystą kopią a stroną pełną paska narzędzi.
To, co pożera Twój wieczór, to mało efektowne szczegóły. Archive.org ogranicza agresywnych klientów, więc skrypt potrzebuje uprzejmych opóźnień i logiki ponawiania, bo inaczej spędzisz godziny, wpatrując się w odpowiedzi 429. Adresy URL z ciągami zapytań wymagają deduplikacji, w przeciwnym razie identyfikatory sesji zamienią 200-stronicową witrynę w indeksowanie 9 000 plików. A gdy pliki już się znajdą, linki wewnętrzne wciąż wskazują na oryginalną domenę, więc potrzebujesz przebiegu przepisywania, zanim kopia będzie poprawnie przeglądana offline.
- Realistyczny nakład pracy: 2–4 godziny na napisanie i debugowanie skryptu, jeśli regularnie programujesz; weekend, jeśli nie. Samo indeksowanie zajmuje 30–90 minut dla kilkuset plików.
- Dobre dla: programistów, archiwistów, każdego, kto chce pełnej kontroli nad każdym bajtem.
- Zawodzi przy: osobach, które nigdy nie otwierały terminala, i terminach mierzonych w godzinach.

Cokolwiek napiszesz, przetestuj wynik tak, jak zrobiłby to odwiedzający: udostępnij folder za pomocą dowolnego lokalnego serwera WWW i poklikaj. Uszkodzone ścieżki obrazów, linki uciekające do działającej sieci i brakujące czcionki dają o sobie znać w ciągu pięciu minut klikania – i są przykre do odkrycia po ogłoszeniu zadania za wykonane.
Metoda 3: automatyczne pobieranie strony z archive.org
Trzecia ścieżka pozwala usłudze odtwarzania zająć się indeksowaniem, dopasowywaniem zasobów i przepisywaniem linków. To właśnie polecam klientom, gdy strona jest ważniejsza niż doświadczenie edukacyjne. W Restorix wklejasz domenę i otrzymujesz darmową natychmiastową wycenę: dokładną liczbę zarchiwizowanych plików, całkowity rozmiar i zablokowaną cenę, zanim cokolwiek zapłacisz. Wybierasz zakres dat, włączasz wybrane opcje, a odtworzona kopia jest gotowa do przeglądania – lub wdrażana bezpośrednio na Twój hosting przez SSH, FTP lub S3.
- Opcje warte poznania: względne linki wewnętrzne, usuwanie starych analityk i reklam, minifikacja JS/CSS, konwersja na HTTPS, kanonizacja www lub bez www.
- Odtwarzanie może wyeksportować ustrukturyzowany manifest (JSON lub SQLite), dzięki czemu dokładnie wiesz, co wróciło.
- Nieudane odtworzenia są automatycznie zwracane na Twoje saldo – bez zgłoszeń do pomocy technicznej.
Haczyk jest oczywisty: to kosztuje. Płacisz za odtworzony plik, pierwszy plik jest darmowy, a cena jest zablokowana w momencie wyceny. W przypadku osobistego bloga możesz z przyjemnością napisać skrypt. W przypadku generującego przychody sklepu WooCommerce klienta, który musi wrócić dziś wieczorem, opłata jest zwykle najtańszą pozycją w całym incydencie. Wdrożenia obejmują również mały, jednoplikowy CMS, więc drobne poprawki tekstowe po odtworzeniu nie wymagają ponownego przesyłania czegokolwiek.
Czas i nakład pracy – porównanie
| Metoda | Twój czas | Umiejętności techniczne | Najlepszy rozmiar |
|---|---|---|---|
| Ręczne zapisywanie stron | 5–10 min na stronę | Brak | 1–10 stron |
| Skryptowanie API CDX | Łącznie 3–6 godzin | Swoboda w kodowaniu | 10–1 000 stron |
| Automatyczne odtwarzanie | Około 15 minut klikania | Brak | Dowolny rozmiar, szczególnie 100+ stron |
Zauważ, że tabela mierzy Twój czas, nie czas maszyny. Skrypt lub usługa mogą przetwarzać duże indeksowanie godzinami, ale robią to, gdy śpisz. Deficytowym zasobem w każdym odtwarzaniu jest wieczór osoby, która je wykonuje, więc to właśnie wyceniam.
Błędy, które kosztują całe popołudnia
- Ufanie zapisom przeglądarki w przypadku całych witryn. Pominiesz każdą stronę, której nie otworzyłeś ręcznie, a stare witryny ukrywają strony w miejscach, o których zapomniałeś.
- Ignorowanie modyfikatora id_, a potem zastanawianie się, dlaczego każdy plik HTML ma wbudowane znaczniki paska narzędzi Wayback.
- Zasypywanie archive.org równoległymi żądaniami. Zostajesz ograniczony i godzina pracy zamienia się w cztery.
- Pomijanie etapu przepisywania linków. Kopia wygląda dobrze, dopóki w cokolwiek nie klikniesz.
- Zakładanie, że każda strona została zarchiwizowana. Najpierw sprawdź inwentarz CDX, aby luki były znaną wielkością, a nie niespodzianką na końcu.
Którą metodę wybrać?
Poniżej dziesięciu stron: zapisz je ręcznie i zaakceptuj niedoskonałości kodu. Piszesz kod i chcesz kontroli: zbuduj skrypt CDX i zarezerwuj wieczór. Potrzebujesz strony z powrotem, czystej, bez zostawania archiwistą na pół etatu: wybierz ścieżkę automatyczną – samouczek przeprowadzi Cię przez pełne odtwarzanie w kilka minut, a darmowa wycena poda liczbę plików i cenę, zanim się do czegokolwiek zobowiążesz.
Ostatnia rzecz: którąkolwiek ścieżkę wybierzesz, zrób to teraz. Archive.org to dar, ale w przeszłości zdarzały się awarie i presja prawna, a „zrobię to później” to dokładnie sposób, w jaki strony giną po raz drugi.
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
FAQ
Czy pobieranie strony z archive.org jest darmowe?
Samo archiwum jest darmowe do przeglądania, a ręczne zapisywanie lub skryptowanie CDX nie kosztuje nic poza Twoim czasem. Automatyczne usługi odtwarzania pobierają opłatę za odtworzony plik; Restorix pokazuje dokładną, zablokowaną cenę w darmowej wycenie przed zapłatą, a Twój pierwszy plik jest darmowy.
Czy pobieranie strony z archive.org jest legalne?
Pobieranie własnej strony lub strony klienta za jego zgodą to standardowa praktyka i tak wygląda większość odtworzeń. W przypadku cudzych treści kopia jest w porządku do użytku osobistego lub badań, ale ponowne publikowanie materiałów chronionych prawem autorskim, których nie jesteś właścicielem, może wpędzić Cię w kłopoty. W razie wątpliwości zapytaj prawnika, a nie sekcji komentarzy.
Dlaczego moja zapisana strona wciąż ładuje obrazy z web.archive.org?
Ponieważ Wayback Machine przepisuje adresy URL zasobów w HTML, aby wskazywały z powrotem na jego własne serwery, a zapis przeglądarki zachowuje te bezwzględne adresy URL. Pobieranie plików z modyfikatorem id_ lub późniejsze uruchomienie procesu przepisywania linków daje Ci samodzielną kopię.
Czy mogę pobrać stronę z archive.org bez kodowania?
Tak. Ręczne zapisywanie przeglądarki nie wymaga żadnego kodu, a automatyczne usługi odtwarzania zajmują się skryptowaniem za Ciebie. Ścieżka API CDX jest jedyną, która naprawdę wymaga programowania.
Jak długo trwa pobieranie strony z archive.org?
Ręczne zapisywanie zajmuje 5–10 minut na stronę. Skrypt CDX wymaga kilku godzin na przygotowanie, a następnie 30–90 minut na indeksowanie średniej wielkości witryny. Automatyczne odtwarzanie zajmuje minuty Twojego czasu; maszyny czekają.
Powiązane poradniki

download entire website from archive org
Pobierz całą witrynę z archive.org, nie tylko stronę główną
Aby pobrać całą witrynę z archive.org, potrzebujesz każdej strony, obrazu i arkusza stylów. Zasoby kryją się pod różnymi znacznikami czasu, oto dlaczego, plus pełna lista kontrolna.

archive.org download website
Narzędzia do pobierania stron z Archive.org: Uczciwe porównanie
Uczciwe porównanie narzędzi do pobierania stron z Archive.org: HTTrack, skrypty wayback-machine-downloader i Restorix. Rzeczywiste koszty, nakład pracy i obsługa zasobów.

wayback machine downloader
Narzędzia do pobierania z Wayback Machine: co naprawdę działa
Szczere spojrzenie na narzędzia do pobierania z Wayback Machine: skrypty open-source, ich realne ograniczenia i opcja typu „gotowe rozwiązanie”, która przywraca Twoją witrynę do sieci.

restore website from archive.org
Przywróć stronę z Archive.org: samodzielnie czy zlecić?
Przywracać stronę z Archive.org samodzielnie czy zapłacić za usługę? Szczere porównanie kosztu, czasu, umiejętności i ryzyka oraz ramy decyzyjne.
