Narzędzia do pobierania stron z Archive.org: Uczciwe porównanie
Autor: zespół redakcyjny Restorix · 7 lipca 2026 · 6 min czytania

Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Istnieją trzy rozsądne sposoby na wydobycie strony z Wayback Machine i użyłem ich wszystkich w prawdziwych projektach: HTTrack, gem Ruby wayback-machine-downloader i jego skryptowe odpowiedniki oraz Restorix – usługa, którą polecam klientom, gdy strona ma wrócić działająca, a nie jako stos plików.
Żadne z nich nie jest 'najlepsze'. Rozwiązują różne problemy w różnych cenach, a cenę płaci się głównie w godzinach, nie w dolarach. Oto, co każde z nich faktycznie robi, gdzie zawodzi i kto powinien wybrać które. Bez rankingów w stylu afiliacyjnym – tylko to, co widziałem, że działało i co szło nie tak.
Co narzędzie do pobierania stron z Archive.org musi robić dobrze
Ocenianie tych narzędzi po szybkości pobierania mija się z celem. Trudne aspekty pobierania strony z Archive.org są mało efektowne i to właśnie w nich narzędzia cicho się różnią:
- Znalezienie każdego pliku. Indeks archiwum jest jedynym kompletnym źródłem – podążanie za linkami ze strony głównej pomija wszystkie osierocone strony.
- Dopasowanie zasobów z różnych znaczników czasu. Strona z 2014 roku może potrzebować logo z jedynego zachowanego zrzutu z 2012 roku.
- Uzyskanie oryginalnych bajtów. Zrobione nieostrożnie, zapisujesz znaczniki paska narzędzi Wayback wbudowane w każdy plik HTML.
- Przepisywanie wewnętrznych linków, aby kopia działała bez opierania się na serwerach archive.org.
- Przetrwanie ograniczania przepustowości. Archive.org ogranicza prędkość niecierpliwym klientom, a ponowienia muszą być uprzejme i cierpliwe.
Zapamiętaj te pięć punktów. Wyjaśniają one każdy wiersz w poniższej tabeli porównawczej, a większość złych opinii o tych narzędziach wynika z jednego z nich.
HTTrack: darmowy, oldskulowy i wciąż w grze
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
HTTrack to weteran: darmowa, otwartoźródłowa przeglądarka offline, która kopiuje strony od lat 90. Wskaż jej adres URL z Wayback Machine, a podąży za linkami, zapisując wszystko, co znajdzie, na dysku. Ma interfejs graficzny dla Windows, cena jest odpowiednia, a do szybkiego skopiowania małej strony naprawdę działa.
Używany przeciwko archive.org, zastrzeżenia się piętrzą. HTTrack nic nie wie o indeksie archiwum – znajduje tylko strony osiągalne przez podążanie za linkami z początkowego adresu URL, więc osierocone strony pozostają w tyle. Pobiera ten zrzut, do którego wayback przekierowuje, mieszając znaczniki czasu bez informowania cię. A jego reguły filtrów wymagają prawdziwego dostrojenia: ustaw je źle, a twoja kopia bloga z 2013 roku zboczy z linku na żywą sieć i pobierzesz obecną stronę. Nie pytaj, skąd to wiem.
Realistyczny test: skopiowanie 40-stronicowego bloga WordPress z 2012 roku przez Wayback Machine zajęło mi około 40 minut konfiguracji i dwie godziny bezobsługowego indeksowania, a i tak spędziłem kolejną godzinę na czyszczeniu folderu z zabłąkanych elementów z żywej sieci. Taki jest uczciwy obraz pracy z HTTrack – tani, w większości automatyczny i nigdy do końca nieukończony, gdy indeksowanie się kończy.
- Koszt: darmowy.
- Wysiłek: godzina lub dwie na naukę składni filtrów; kopie działają potem bez nadzoru.
- Najlepszy do: szybkich kopii małych, dobrze polinkowanych stron, gdy idealna wierność nie jest celem.
- Uważaj na: zbaczanie na żywą sieć, pomieszane znaczniki czasu zrzutów i przepisane adresy URL waybacka trafiające do twoich plików.

wayback-machine-downloader i ścieżka skryptowa
wayback-machine-downloader to gem Ruby, który odpytuje indeks CDX archiwum, a następnie pobiera każdy plik wymieniony dla twojej domeny, opcjonalnie w zakresie dat. Ponieważ czyta indeks zamiast podążać za linkami, znajduje strony, których HTTrack nigdy nie widzi. Kilka skryptów Pythona krążących po GitHubie robi to samo z różnymi flagami i różnym poziomem dopracowania.
Kompromisy są typowe dla open source. Potrzebujesz zainstalowanego Ruby lub Pythona i pewności siebie, by przeczytać README. Projekty w tej niszy potrafią milknąć na lata, więc sprawdź listę zgłoszeń, zanim postawisz na któryś termin. A gdy indeksowanie się zakończy, cała praca montażowa należy do ciebie: wewnętrzne linki wciąż wskazują na oryginalną domenę, znaczniki czasu zrzutów wymagają sprawdzenia, a wszelkie porządki – usuwanie starych tagów analitycznych, naprawianie kanonicznych adresów URL, konwersja na HTTPS – to twoje sobotnie popołudnie.
- Koszt: darmowy, plus twoje godziny.
- Wysiłek: pół dnia, jeśli czujesz się swobodnie w terminalu; samo indeksowanie działa potem samodzielnie.
- Najlepszy dla: programistów i archiwistów, którzy chcą pełnej kontroli nad każdym bajtem i czerpią z tego przyjemność.
- Uważaj na: ograniczane indeksowanie bez logiki ponawiania, przepisywanie linków pozostawione jako praca domowa i luki w utrzymaniu repozytorium.
Dwa nawyki sprawiają, że ścieżka skryptowa jest do przeżycia. Zachowaj odpowiedź CDX, od której zacząłeś – służy jako manifest, gdy ktoś zapyta, co powinno być w folderze. I uruchom wynik lokalnie, zanim uznasz go za gotowy: pięć minut klikania po kopii na localhost znajdzie brakujące zasoby szybciej niż jakikolwiek plik dziennika.
Restorix: opcja pobierania strony z Archive.org zrobiona za ciebie
Restorix znajduje się na płatnym, zrobionym za ciebie końcu spektrum i jest zbudowany specjalnie do przywracania z archive.org, a nie do ogólnego scrapowania. Wprowadzasz domenę i otrzymujesz darmową natychmiastową wycenę: dokładną liczbę zarchiwizowanych plików, całkowity rozmiar i zablokowaną cenę. Wybierasz zakres dat i opcje – względne linki wewnętrzne, usuwanie analityki i reklam, konwersję na HTTPS, minifikację JS/CSS, kanonizację www lub bez www – a usługa zajmuje się enumeracją indeksu, dopasowywaniem zasobów między znacznikami czasu, ograniczaniem prędkości i przepisywaniem linków.
Wynik pobiera się jako czystą, przeglądalną kopię lub wdraża bezpośrednio na twój hosting przez SSH/SFTP, FTP/FTPS lub S3, z dołączonym małym, jednoplikowym CMS-em do edycji odzyskanych stron. Płacisz za odzyskany plik, pierwszy plik jest darmowy, a nieudane odzyskiwania są automatycznie zwracane na twoje konto. Nie ma subskrypcji – doładowania są jednorazowe, kartą lub krypto. To nie jest ścieżka hobbystyczna i nie próbuje nią być.

Narzędzia do pobierania stron z Archive.org, obok siebie
| HTTrack | Skrypty (gem / Python) | Restorix | |
|---|---|---|---|
| Cena | Darmowy | Darmowy | Płatność za plik, pierwszy plik darmowy |
| Znajduje niepolinkowane strony | Nie – podąża tylko za linkami | Tak – czyta indeks CDX | Tak – czyta indeks CDX |
| Dopasowywanie zasobów między znacznikami czasu | Nie | Częściowo | Tak |
| Oryginalne bajty bez znaczników paska narzędzi | Nie | Tak, z odpowiednimi flagami | Tak |
| Przepisane linki wewnętrzne | Częściowo | Przepisujesz je samodzielnie | Tak, opcjonalne linki względne |
| Wdraża na twój hosting | Nie | Nie | Tak – SSH, FTP, S3 |
| Typowy wysiłek z twojej strony | Godziny dostrajania filtrów | Pół dnia plus montaż | Około 15 minut |
| Najlepszy do | Szybkich małych kopii | Programistów, którzy chcą kontroli | Przywrócenia strony do działania |
Przeczytaj wiersz o wysiłku dwa razy. Każde narzędzie z tej listy może ostatecznie wyprodukować ten sam folder plików – tak naprawdę wybierasz, kto wykona żmudne 20% pracy: ty czy coś innego.
Jeszcze jeden wiersz, którego tabela nie może pomieścić: ryzyko. Przy darmowych narzędziach nieudana robota kosztuje cię kolejny wieczór. Przy płatnej usłudze szukaj warunków niepowodzenia – automatyczne zwroty na konto, cena zablokowana przed rozpoczęciem i darmowa wycena oznaczają, że ryzyko finansowe nieudanego odzyskania wynosi praktycznie zero.
Które wybrać?
Szczera rada. Jeśli potrzebujesz skopiować jedną małą stronę do celów referencyjnych i lubisz darmowe narzędzia, HTTrack zrobi to dziś wieczorem na twoim dysku. Jeśli piszesz kod, chcesz surowe pliki i masz weekend do spędzenia, ścieżka z gemem jest naprawdę dobra i naprawdę darmowa. Jeśli strona jest zasobem biznesowym – sklepem WooCommerce klienta, forum z dziesięcioma latami postów, dziełem twojego życia – zapłać opłatę za plik i spędź wieczór na czymś innym. Poradnik pokazuje pełny proces odzyskiwania, zanim wydasz choćby centa, a darmowa wycena oznacza, że możesz zobaczyć dokładną cenę przed podjęciem decyzji.
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
FAQ
Czy istnieje oficjalna funkcja pobierania strony z archive.org?
Nie. Wayback Machine jest zbudowana do przeglądania pojedynczych zrzutów, a archive.org nie oferuje eksportu całej strony. Każda metoda masowa – HTTrack, skrypty pobierające, usługi przywracania – to narzędzie zewnętrzne odczytujące te same publiczne zrzuty i ten sam publiczny indeks.
Czy HTTrack czy wayback-machine-downloader jest lepszy do archive.org?
Różne zadania. HTTrack indeksuje linki i nadaje się do małych, prostych kopii. wayback-machine-downloader czyta indeks archiwum, więc znajduje niepolinkowane strony i właściwie obsługuje zakresy dat. Dla czegokolwiek większego niż kilkadziesiąt stron podejście oparte na indeksie wygrywa.
Ile kosztuje przywrócenie strony za pomocą Restorix?
Płacisz niewielką stałą opłatę za odzyskany plik, pierwszy plik jest darmowy, a cena jest zablokowana w momencie wyceny – więc widzisz dokładną sumę dla swojej konkretnej strony, zanim cokolwiek zapłacisz. Doładowania są jednorazowe, kartą lub krypto, istnieją kody promocyjne. Nic się nie odnawia.
Czy te narzędzia mogą umieścić stronę z powrotem na moim hostingu, czy tylko pobierają pliki?
HTTrack i skrypty kończą na plikach na twoim dysku; wgrywanie, naprawianie linków i konfiguracja hostingu należy do ciebie. Restorix może wdrożyć odzyskaną kopię bezpośrednio na serwery SSH/SFTP, hosting współdzielony FTP/FTPS lub S3 i zawiera prosty CMS do późniejszej edycji stron.
Czy muszę znać wszystkie stare adresy URL przed pobraniem?
Nie. Narzędzia oparte na indeksie wyliczają każdy zarchiwizowany URL z API CDX, więc potrzebujesz tylko domeny. Crawlery linków, takie jak HTTrack, potrzebują tylko początkowego adresu URL, ale pominą wszystko, co nie było polinkowane z miejsca, do którego ich indeksowanie mogło dotrzeć.
Powiązane poradniki

wayback machine downloader
Narzędzia do pobierania z Wayback Machine: co naprawdę działa
Szczere spojrzenie na narzędzia do pobierania z Wayback Machine: skrypty open-source, ich realne ograniczenia i opcja typu „gotowe rozwiązanie”, która przywraca Twoją witrynę do sieci.

web downloader
Narzędzia do pobierania stron WWW: co zapisują, a co psują
Jak działa web downloader, co tak naprawdę zachowują HTTrack, wget, SiteSucker i zapis strony w przeglądarce, co każdy z nich psuje i kiedy lepszym wyborem jest przywracanie strony.

download a website from archive org
Jak pobrać stronę internetową z Archive.org: 3 skuteczne sposoby
Trzy sprawdzone sposoby na pobranie strony z archive.org: ręczne zapisywanie stron, skryptowanie API CDX lub automatyczne odtwarzanie. Realistyczne szacunki czasu dla każdej metody.
