Jak pobierać z Archive.org: elementy, migawki i nie tylko
Autor: zespół redakcyjny Restorix · 28 kwietnia 2026 · 6 min czytania

Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Fraza 'pobieranie z Archive.org' obejmuje dwie zupełnie różne czynności, a ich pomylenie to sposób, w jaki ludzie tracą popołudnia. Zadanie pierwsze: pobieranie plików z elementu, książki, sterownika, nagrania koncertu. Zadanie drugie: wyodrębnianie strony internetowej z Wayback Machine. Pierwsze ma przycisk pobierania. Drugie zdecydowanie nie.
Robię obie rzeczy co tydzień, dla przywracania stron klientów i do badań. Oto każda metoda, która nadal działa, z uczciwymi kompromisami: co jest jednym kliknięciem, co jest linią poleceń, a co jest pułapką ubraną w szaty przycisku pobierania.
Dwa sposoby pobierania z Archive.org
Archive.org przechowuje treści jako elementy, samodzielne pakiety plików z metadanymi, jak oznakowany folder na półce. Wayback Machine przechowuje migawki, oznaczone znacznikami czasu kopie poszczególnych adresów URL, serwowane z przepisanymi linkami. Elementy są przeznaczone do pobierania. Migawki są przeznaczone do przeglądania w przeglądarce.
Wszystko, co możesz zrobić, wynika z tego podziału. Pobieranie elementów jest oficjalnie obsługiwane: przyciski, torrenty, CLI, API metadanych. 'Pobieranie' migawek to tak naprawdę rekonstrukcje, pytasz API CDX, co istnieje, pobierasz oryginalne bajty każdego adresu URL, a następnie naprawiasz linki. Inne narzędzia, inne tryby awarii, inne budżety czasowe.
Nie jesteś pewien, w którym świecie się znajdujesz? Spójrz na URL. archive.org/details/coś to element, do pobrania. web.archive.org/web/2012/http://przyklad.com to migawka, do przeglądania. To samo archiwum, dwa schematy adresów, dwa zestawy zasad.
Pobieranie elementów Archive.org w prosty sposób
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Otwórz dowolną stronę elementu i spójrz na okno pobierania po prawej stronie. Otrzymujesz poszczególne pliki, zwykle link do torrenta, a czasami skrót ZIP lub pełny tekst. W przypadku jednego PDF-a lub ISO, kliknij plik. Gotowe. To jedyna część pobierania z Archive.org, która działa tak, jak ludzie oczekują.
- Kliknij 'SHOW ALL', aby zobaczyć każdy plik w elemencie, w tym logi i formaty pochodne, które okno ukrywa.
- Bezpośrednie adresy URL są przewidywalne: archive.org/download/{identifier}/{filename}, idealne dla skryptów i wget.
- Opcja torrenta często bije HTTP w przypadku wielogigabajtowych elementów, a po przerwaniu połączenia wznawia czysto.
- Pochodne to wygenerowane wersje, tekst z OCR, mniejsze MP4. Oryginalny przesył jest oznaczony jako taki; chwyć go, gdy wierność ma znaczenie.
Jeszcze jedna sztuczka dla skrypterów: dodaj /metadata/{identifier} do archive.org, a otrzymasz listę JSON każdego pliku, jego rozmiar, sumę kontrolną i format. Ten JSON jest dokładnie tym, co narzędzie wiersza poleceń wykorzystuje pod maską.

Masowe pobieranie za pomocą Internet Archive CLI
W przypadku więcej niż kilku elementów zainstaluj oficjalne narzędzie wiersza poleceń, pakiet Python internetarchive, który dostarcza polecenie ia. Obsługuje uwierzytelnianie, wznawianie i ponawianie prób, i to jest różnica między skryptem a weekendem klikania.
- Instalacja: pip install internetarchive, a następnie uruchom ia configure raz ze swoim kontem.
- Jeden element: ia download {identifier} kopiuje cały element do lokalnego folderu.
- Wybór: ia download {identifier} --glob='*.pdf', żadnych więcej niespodzianek 40 GB.
- Całe wyszukiwania: ia search 'collection:archiveteam AND year:2013' --itemlist > list.txt, a następnie pętla ia download na tym pliku.
Limity szybkości istnieją. CLI samo grzecznie ponawia próby; twój surowy wget w pętli przeciwko archive.org nie będzie, a walenie skutkuje ograniczeniem lub blokadą. Bądź tym grzecznym, archiwum jest organizacją non-profit, a nie CDN.
Jak pobierać migawki internetowe Archive.org
Teraz trudniejsza połowa. Migawka Wayback nie jest elementem, więc nie ma okna pobierania. Masz cztery realistyczne ścieżki, w kolejności nakładu pracy:
- Pojedyncza strona, natychmiast: otwórz migawkę i użyj funkcji zapisu przeglądarki. W porządku dla jednej strony; zapisana kopia nadal wskazuje zasoby na web.archive.org.
- Oryginalne bajty jednego pliku: wstaw id_ po znaczniku czasu w adresie URL migawki, web.archive.org/web/20120501000000id_/http://przyklad.com/style.css, i otrzymujesz niemodyfikowany ładunek. Idealne dla pojedynczych obrazów, CSS i PDF-ów.
- Skryptowe pobieranie: zapytaj API CDX o każdy przechwycony URL pod ścieżką, a następnie żądaj każdego z modyfikatorem id_. Działa, ale teraz utrzymujesz skrobak, deduplikujesz skróty i samodzielnie przepisujesz linki.
- Narzędzia do pobierania i usługi przywracania: narzędzia społecznościowe, takie jak gem wayback-machine-downloader, automatyzują pętlę CDX-plus-pobieranie; usługa przywracania taka jak Restorix robi to plus czyszczenie i ponowne wdrożenie.
Zauważ wzór: w momencie, gdy chcesz więcej niż jedną lub dwie strony, piszesz lub uruchamiasz narzędzia. Nie ma w tym wstydu, po prostu zaplanuj to uczciwie.
Jedno zastrzeżenie co do sztuczki z id_, ponieważ jest przereklamowana: daje ci oryginalne bajty tej jednej odpowiedzi, ale niczego nie naprawia. Strona pobrana za pomocą id_ nadal zawiera wszelkie bezwzględne adresy URL, których strona używała w 2012 roku, nadal odwołuje się do zasobów, których robot nigdy nie pobrał, i nadal zakłada domenę, której możesz już nie posiadać. Oryginalne bajty to materiał wyjściowy, a nie gotowa strona.

Elementy a migawki internetowe: kiedy które stosować
| Chcesz | Użyj | Metoda |
|---|---|---|
| Książka, piosenka, sterownik, ISO | Element | Przycisk pobierania, torrent lub ia download |
| Stara wersja jednej strony | Migawka | Zapis w przeglądarce lub URL z id_ |
| Brakujący obraz lub plik CSS | Migawka | URL z id_ bezpośrednio do wget |
| Cała martwa strona internetowa | Zestaw migawek | API CDX plus narzędzia lub usługa przywracania |
| Usługa, która umarła (era GeoCities) | Element plus migawka | WARC od Archive Team, sprawdzone krzyżowo z CDX |
Ten ostatni wiersz zaskakuje ludzi: gdy Archive Team ratuje umierający host, wynik trafia do archiwum elementów jako ogromne pliki WARC. Ta sama strona internetowa może być zarówno pobraniem elementu, jak i zestawem migawek. Sprawdź najpierw stronę elementu, wstępnie spakowane przeszukiwanie bije tysiąc indywidualnych pobrań, a nasz przewodnik po formatach wyjaśnia, co robić z tymi WARC.
Błędy pobierania, które marnują godziny
- Rekurencyjny wget przeciwko web.archive.org. Każdy link jest przepisywany, aby pozostać w swojej domenie, więc twój robot z radością pobiera interfejs samej Wayback Machine aż do śmierci cieplnej wszechświata.
- Pobieranie całego elementu dla jednego pliku. Kliknięcie 'SHOW ALL' zajmuje dziesięć sekund; 40 GB ZIP zajmuje ci wieczór.
- Ufanie migawce jako całej stronie. Migawki są per-URL i oportunistyczne, obrazy serwowane z subdomeny CDN często są całkowicie nieobecne.
- Ignorowanie kodów statusu w wyjściu CDX. Przekierowania i 404 również są archiwizowane; filtruj do statuscode:200 i zwijaj skróty, w przeciwnym razie przywrócisz stuby przekierowań jako strony.
- Pomijanie sum kontrolnych. Elementy zawierają pliki md5 i sha1, zweryfikuj duże pobrania, zanim na nich zbudujesz.
- Zakładanie, że jedna data migawki wystarczy. Strona główna z 2011 roku z obrazami z 2009 jest normalna; strony były indeksowane fragmentarycznie, więc spodziewaj się mieszania dat migawek, aby uzyskać pełny obraz.
Masz pliki. Co teraz?
Pobrania elementów wpadają prosto do biblioteki multimediów lub łańcucha narzędzi, ta część jest rozwiązana. Pobieranie migawek to miejsce, gdzie zaczyna się prawdziwa praca: przepisane adresy URL, brakujące zasoby, martwe formularze kontaktowe, mieszane HTTP i HTTPS. Przekształcenie folderu migawek z 2011 roku w stronę, która faktycznie się ładuje, to zadanie przebudowy, a nie pobierania.
To jest moment, w którym przestałem samodzielnie pisać skrypty i zacząłem kierować ludzi do profesjonalnego serwisu odzyskiwania witryn. Darmowa wycena odczytuje archiwum za ciebie, dokładna liczba plików, całkowity rozmiar, zablokowana cena, zanim wydasz centa. Pierwszy plik przywrócony za darmo, płatność za plik po tym, jednorazowe doładowania, bez subskrypcji. Jeśli przywracanie lub wdrożenie się nie powiedzie, zwrot pieniędzy trafia na twoje konto automatycznie, bez potrzeby zgłaszania problemu.
Opcje przywracania obejmują drobne elementy, które w przeciwnym razie musiałbyś skryptować: usuwanie analityki i reklam, tworzenie linków względnych, wymuszanie HTTPS, kanonizacja www, zachowanie przekierowań. Wdrożenie jednym kliknięciem wysyła wynik do SSH/SFTP, FTP lub S3, a dołączony jednoplikowy CMS pod /webarchive-cms.php pozwala naprawiać treść na miejscu, samouczek przeprowadza przez całe zadanie. Pobieranie kończy poszukiwania; nie kończy pracy.
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
FAQ
Czy mogę pobrać całą stronę internetową z Archive.org?
Nie za pomocą przycisku. Strony internetowe żyją po stronie Wayback jako migawki per-URL, więc pobranie strony oznacza wyliczenie URL-i przez API CDX i pobranie każdego, a następnie naprawienie linków. W przypadku czegoś więcej niż kilka stron, użyj narzędzia do pobierania lub usługi przywracania, porównujemy opcje w [pobieranie całej strony internetowej z Archive.org](/pl/download-entire-website-from-archive-org).
Czy pobieranie z Archive.org jest legalne?
Elementy z domeny publicznej i Creative Commons są wyraźnie dozwolone. Elementy objęte prawami autorskimi pozostają decyzją właściciela praw, pobieranie do badań osobistych jest ogólnie tolerowane, ponowne publikowanie nie. Odbudowa własnej starej strony z jej migawek to klasyczny uzasadniony przypadek.
Jaka jest różnica między ia download a torrentami?
Te same bajty, inny transport. Torrenty sprawdzają się w przypadku ogromnych elementów i niestabilnych połączeń; CLI sprawdza się w skryptowaniu, filtrowaniu --glob i zadaniach wsadowych dla wielu identyfikatorów. W przypadku pojedynczego elementu 200 MB, zwykły przycisk pobierania bije oba.
Dlaczego moje pobrane migawki zawierają wszędzie adresy URL web.archive.org?
Wayback Machine przepisuje linki, aby strony renderowały się w jego odtwarzaczu. Pobierz z modyfikatorem id_, aby uzyskać oryginalne bajty, lub uruchom przywracanie, które przepisuje linki z powrotem, opcja względnych linków Restorix istnieje właśnie do tego czyszczenia.
Jak pobrać całą kolekcję zamiast jednego elementu?
Zbuduj listę elementów za pomocą ia search 'collection:nazwa' --itemlist, a następnie uruchom ia download dla każdego identyfikatora, z filtrami --glob, aby zachować tylko potrzebne typy plików. Spodziewaj się, że to zajmie trochę czasu, duże kolekcje sięgają terabajtów, więc przed rozpoczęciem sprawdź statystyki rozmiaru kolekcji.
Powiązane poradniki

archive org download
Formaty pobierania z Archive.org: WARC, CDX i pojedyncze pliki
Co faktycznie zawiera każdy format pobierania z Archive.org, dane przechwycenia WARC, indeksy JSON CDX i pojedyncze oryginalne pliki, oraz co z każdym z nich zrobić.

download a website from archive org
Jak pobrać stronę internetową z Archive.org: 3 skuteczne sposoby
Trzy sprawdzone sposoby na pobranie strony z archive.org: ręczne zapisywanie stron, skryptowanie API CDX lub automatyczne odtwarzanie. Realistyczne szacunki czasu dla każdej metody.

download entire website from archive org
Pobierz całą witrynę z archive.org, nie tylko stronę główną
Aby pobrać całą witrynę z archive.org, potrzebujesz każdej strony, obrazu i arkusza stylów. Zasoby kryją się pod różnymi znacznikami czasu, oto dlaczego, plus pełna lista kontrolna.

wayback machine downloader
Narzędzia do pobierania z Wayback Machine: co naprawdę działa
Szczere spojrzenie na narzędzia do pobierania z Wayback Machine: skrypty open-source, ich realne ograniczenia i opcja typu „gotowe rozwiązanie”, która przywraca Twoją witrynę do sieci.
