Formaty pobierania z Archive.org: WARC, CDX i pojedyncze pliki
Autor: zespół redakcyjny Restorix · 28 czerwca 2026 · 7 min czytania

Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Znalazłeś zapis, kliknąłeś pobieranie i teraz patrzysz na 900-megabajtowy plik z rozszerzeniem.warc.gz, którego nic na twoim komputerze nie potrafi otworzyć. Witaj w najbardziej niedokumentowanej części Archive.org: w formatach. Biblioteka udostępnia surowe dane przechwycenia, a surowe dane przechwycenia oczekują, że przyniesiesz własne narzędzia.
Trzy formaty obejmują prawie wszystko, co kiedykolwiek pobierzesz: pliki WARC, dane wyjściowe JSON CDX i zwykłe pojedyncze pliki. Oto, czym naprawdę każdy z nich jest, kiedy go potrzebujesz i jak zamienić go w coś użytecznego, w tym skrót dla tych, którzy po prostu chcą odzyskać swoją starą stronę.
Co faktycznie zawiera pobranie z Archive.org
Znowu dwa światy przechowywania. Pobrania przedmiotów (items) dają ci gotowe pliki, PDF to PDF, ISO to ISO. Pobrania ze strony Wayback dają ci dane przechwycenia sieci: zamrożone w czasie indeksowania odpowiedzi HTTP oraz indeksy je opisujące. Mylące formaty pochodzą wszystkie z tego drugiego świata, a do tego istniejefurtka w postaci pojedynczych plików, która mostkuje oba światy.
Rozmiary mają znaczenie dla planowania. Pojedynczy segment WARC z kolekcji indeksów ma około 1 GB po skompresowaniu. Wpis CDX średniej wielkości strony może mieć 50 000 wierszy JSON. Pojedynczy plik to, cóż, jeden plik. Dopasuj format do zadania przed rozpoczęciem pobierania, nie po, ponowne pobieranie gigabajtów, bo chwyciłeś nie to, to rytuał przejścia, którego najlepiej unikać.
WARC: Surowy format przechwycenia
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
WARC, Web ARChive, norma ISO 28500, to kontener, który łączy rekordy. Każdy rekord to jedna przechwycona wymiana HTTP: nagłówki odpowiedzi, po których następuje dokładna zawartość bajtów, plus metadane takie jak czas przechwycenia i docelowy URL. Rekordy mają typy, response, resource, metadata, warcinfo, a pliki niemal zawsze przychodzą spakowane gzipem, jeden rekord na człon gzipa, aby narzędzia mogły szukać bez dekompresowania całego archiwum.
- Nic nie jest renderowane ani czyszczone. Dokładnie bajt po bajcie dostajesz to, co widział robot indeksujący, w tym strony 404 i łańcuchy przekierowań.
- Jeden plik WARC zawiera tysiące często niepowiązanych URL-i z indeksowania, twoja strona może stanowić 2% pliku.
- Potrzebujesz narzędzi do odczytu: biblioteki Python warcio do ekstrakcji lub ReplayWeb.page i pywb do odtwarzania ich jako przeglądanych stron.
Ekstrakcja za pomocą warcio to pętla filtrowania: otwórz archiwum, pomiń rekordy, których docelowy URL jest poza twoją domeną, zapisz zawartości na dysk, odwzorowując oryginalne ścieżki, usuwając duplikaty identycznych skrótów. Pięćdziesiąt linijek Pythona, albo jeden długi wieczór nauki, dlaczego ludzie za to płacą.
Skąd tak naprawdę bierzesz WARC-i? Z dwóch miejsc. Ratunkowe indeksowania Archive Team i kolekcje indeksów Internet Archive dostarczają je jako zwykłe pliki przedmiotów, szukaj.warc.gz w oknie pobierania przedmiotu. A jeśli kiedykolwiek zlecisz lub wyeksportujesz własne indeksowanie, WARC to to, co otrzymasz. To kontener transportowy świata archiwizacji sieci: brzydki, ustandaryzowany i wszędzie.

JSON CDX: Indeks, nie treść
CDX to katalog kart maszyny Wayback. Wpisz zapytanie web.archive.org/cdx/search/cdx?url=example.com&output=json, a otrzymasz tablicę JSON, w której każdy wiersz opisuje jedno przechwycenie: urlkey, timestamp, oryginalny URL, mimetype, statuscode, digest i rozmiar w bajtach. Żadnej zawartości strony, tylko precyzyjna lista tego, co istnieje, przechwycenie po przechwyceniu.
Dwa znaczniki są przydatne w każdym zapytaniu: filter=statuscode:200 odrzuca przekierowania i strony błędów, a collapse=digest usuwa zduplikowane przechwycenia identycznej zawartości. W jednym sklepie WooCommerce klienta te dwa znaczniki zmniejszyły 38 000 surowych wierszy do 4 100 prawdziwych, unikalnych stron. Ta lista stała się planem odtworzenia, i szacunkiem kosztów.
Sztuczki z zapytaniami, które warto znać: dodaj matchType=prefix, aby objąć każdy URL pod ścieżką, i użyj from=2008&to=2012, aby ograniczyć lata. Znak wildcard, taki jak url=example.com/*, już implikuje dopasowanie prefiksu do całej domeny. Zacznij wąsko, nieprzefiltrowane zapytanie domeny na dużej stronie zwraca megabajty JSON-a i zamrożoną kartę przeglądarki.
- Zakres: ile strony zostało kiedykolwiek przechwycone i w których latach.
- Analiza luk: znajdowanie katalogów obrazów i hostów CDN, które nigdy nie zostały zindeksowane.
- Listy wsadowego pobierania: przekazuj pary czas-stempl + URL do narzędzia pobierającego, po jednym żądaniu id_.
- Szacunki: Restorix odczytuje te same dane CDX, aby wycenić odtworzenie, liczba plików, łączny rozmiar, cena stała, z góry.

Pojedyncze pliki: Łatwe pobieranie z Archive.org
Trzeci format to ledwo format: jeden oryginalny plik, pobrany bezpośrednio. Dla przedmiotów (items) jest to link do pliku w oknie pobierania. Dla migawek jest to sztuczka id_, wstaw id_ zaraz po znaczniku czasu, np. web.archive.org/web/20130501000000id_/http://example.com/logo.png, a maszyna Wayback zwróci nietknięty ładunek bez paska narzędzi i bez przepisanego kodu HTML.
Sięgaj po pojedyncze pliki, gdy już dokładnie wiesz, czego brakuje: arkusz stylów, który się nie zindeksował, cennik PDF, obraz hero, o który klient wciąż pyta. Prowadzę folder z takimi plikami na każdy projekt. Czego nie powinieneś robić, to budować w ten sposób całej strony, 4000 ręcznych żądań id_ to skrypt, który aż się prosi o napisanie.
Dwa spodziewane tryby awarii. Po stronie migawek id_ działa tylko wtedy, gdy ten dokładny URL został przechwycony, najpierw sprawdź indeks CDX zamiast zgadywać URL-e. Po stronie przedmiotów wzorzec bezpośredniego URL archive.org/download/{identyfikator}/{nazwa_pliku} jest stabilny i nadaje się do skryptowania, ale nazwy plików ze spacjami wymagają prawidłowego kodowania URL, bo w przeciwnym razie wget zwróci błąd 404 dla pliku, który wyraźnie istnieje.
Który format pobierania z Archive.org jest Ci potrzebny?
| Format | Zawiera | Najlepszy do | Narzędzia |
|---|---|---|---|
| WARC (.warc.gz) | Surowe odpowiedzi HTTP hurtowo | Całe indeksowania, archiwa offline | warcio, pywb, ReplayWeb.page |
| JSON CDX | Tylko metadane przechwycenia | Określanie zakresu, analiza luk, listy pobierania | Dowolny klient HTTP plus skrypt |
| Pojedynczy plik / id_ | Jeden oryginalny ładunek | Celowane brakujące zasoby | Przeglądarka lub wget |
| Pobranie przedmiotu (Item download) | Gotowe pliki (PDF, ISO, MP3) | Książki, oprogramowanie, multimedia | Żadne, kliknij i pobierz |
Uczciwy łańcuch zależności dla odtworzenia strony to najpierw CDX, potem WARC lub żądania id_, a na końcu pojedyncze pluki do załatania dziur. Pominięcie kroku CDX to sposób na pobranie gigabajta danych indeksowania i nadal pominięcie połowy strony. Pobrania przedmiotów (items) stoją całkowicie poza tym łańcuchem, to towary gotowe, a jeśli potrzebujesz książki lub sterownika, przestań czytać i idź kliknąć.
Praca z tym, co pobrałeś
Pułapki, które ugryzą każdego raz. Spakowane gzipem WARC-i mają wielu członków, zwykły gunzip działa, ale czytniki strumieniowe nie powinny zatrzymywać się na pierwszym członie. Skrótowe skróty (digests) powtarzają się między przechwyceniami, więc usuwaj duplikaty przed liczeniem plików, bo twoje sumy będą kłamać. Kodowania znaków z 2004 roku to nie UTF-8; trzymaj bajty jako bajty, dopóki nie musisz dekodować. I każdy URL przepisany przez Wayback wewnątrz przechwyconego HTML wciąż wskazuje na web.archive.org, dopóki go nie przepiszesz z powrotem.
Zaplanuj strukturę wyjściową przed ekstrakcją: odwzorowuj oryginalne ścieżki URL, prowadź manifest, który ładunek pochodzi z którego rekordu, i nigdy nie nadpisuj wariantów, które mogą ci się przydać później. Restorix potrafi eksportować dokładnie tego rodzaju manifest (JSON lub SQLite) przy każdym odtworzeniu, robiąc to ręcznie, zrozumiesz, dlaczego ta funkcja istnieje.
Albo pomiń całe to zmaganie się z formatami
Wszystko powyżej da się nauczyć, a żadna z tych rzeczy nie jest dobrym sposobem na weekend właściciela firmy. Nasze narzędzie istnieje dokładnie na tej warstwie: odczytuje dane CDX, pobiera przechwycenia, usuwa duplikaty, przepisuje linki i przekazuje ci działającą stronę. Bezpłatny szacunek pokazuje liczbę zarchiwizowanych plików, łączny rozmiar i stałą cenę, zanim zapłacisz, pierwszy plik odtworzony za darmo, płacisz za każdy kolejny plik, automatyczny zwrot salda, jeśli coś zawiedzie.
Opcje odtworzenia odpowiadają jeden do jednego powyższym punktom bólu: względne wewnętrzne zamiast URL-i archive.org, konwersja na HTTPS, usunięcie starych analityk i reklam, zachowanie przekierowań 301. Wdrożenie jednym kliknięciem na SSH/SFTP, FTP/FTPS lub S3 z panelu odtwarzania, a dołączony CMS w /webarchive-cms.php, hasło generowane losowo, tryb bezpieczny domyślnie włączony, oznacza, że możesz edytować ożywioną stronę bez dotykania ani jednej linii narzędzi WARC. Formaty są dla archiwistów. Ty chcesz swoją stronę z powrotem.
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
FAQ
Czym jest plik WARC i jak go otworzyć?
WARC to kontener zgodny z normą ISO dla przechwyconych odpowiedzi HTTP, nagłówki plus dokładne bajty ładunku, zwykle spakowane gzipem. Otwórz go za pomocą biblioteki Pythona warcio, aby wyodrębnić pliki, lub odtwórz go jako przeglądane strony za pomocą ReplayWeb.page lub pywb. Kliknięcie dwukrotne nic nie robi; nie ma natywnego programu do przeglądania na pulpicie.
Co oznaczają pola w danych wyjściowych JSON CDX?
Każdy wiersz to jedno przechwycenie: urlkey (znormalizowany URL), timestamp (czas przechwycenia, yyyyMMddhhmmss), original (URL, jak został zaindeksowany), mimetype, statuscode, digest (skrót zawartości, identyczne skróty oznaczają identyczne bajty) oraz length (rozmiar skompresowanego rekordu). Opisuje przechwycenia; sam nie zawiera treści strony.
Jak uzyskać oryginalny plik bez przepisanego HTML-a z Wayback?
Użyj modyfikatora id_: wstaw go zaraz po znaczniku czasu w dowolnym URL-u migawki, a archiwum zwróci niezmodyfikowany ładunek, bez paska narzędzi, bez przepisanych linków. Działa dla stron, obrazów, CSS, czegokolwiek, co zostało przechwycone.
Czy mogę przekonwertować pobranie z Archive.org z powrotem na działającą stronę internetową?
Tak, z pewnym wysiłkiem: wylicz przechwycenia za pomocą CDX, wyodrębnij ładunki z WARC lub żądań id_, przepisz linki, załataj brakujące zasoby, a potem wdróż. Dla kilku stron to miły wieczór. Dla prawdziwej strony usługa odtwarzania taka jak Restorix automatyzuje cały łańcuch i pokazuje ci cenę, zanim coś zostanie naliczone.
Jaki jest rozmiar typowego pobrania strony z Archive.org?
Zazwyczaj mniejszy, niż się obawiasz. Pięcioletnia, 200-stronowa strona informacyjna ma zwykle 200-800 MB łącznie we wszystkich przechwyceniach; po usunięciu duplikatów unikalna zawartość może mieć 60 MB. Lista CDX podaje ci prawdziwe liczby, zanim cokolwiek pobierzesz, zawsze najpierw określ zakres.
Powiązane poradniki

download archive org
Jak pobierać z Archive.org: elementy, migawki i nie tylko
Każdy praktyczny sposób na pobieranie treści z Archive.org, pliki elementów, masowe pobieranie CLI i migawki internetowe Wayback, oraz jak wybrać odpowiedni dla swojego zadania.

archive.org download website
Narzędzia do pobierania stron z Archive.org: Uczciwe porównanie
Uczciwe porównanie narzędzi do pobierania stron z Archive.org: HTTrack, skrypty wayback-machine-downloader i Restorix. Rzeczywiste koszty, nakład pracy i obsługa zasobów.

wayback download
Pobieranie z Wayback: każda metoda uszeregowana według nakładu pracy
Każda metoda pobierania z Wayback uszeregowana według nakładu pracy: pojedyncze strony, skrypty wget, API CDX oraz automatyczne usługi, które odbudowują za Ciebie całą witrynę.

restore website from archive.org
Przywróć stronę z Archive.org: samodzielnie czy zlecić?
Przywracać stronę z Archive.org samodzielnie czy zapłacić za usługę? Szczere porównanie kosztu, czasu, umiejętności i ryzyka oraz ramy decyzyjne.
