Strona Archive.org: wyszukiwanie zaawansowane, filtry i kolekcje
Autor: zespół redakcyjny Restorix · 26 kwietnia 2026 · 6 min czytania

Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Większość osób zagląda na stronę Archive.org dokładnie raz. Wklejają martwy adres URL do Wayback Machine, robią zrzut ekranu i wychodzą. To marnotrawstwo poważnego narzędzia. Za tym samym logowaniem kryje się pełna biblioteka cyfrowa, dziesiątki milionów obiektów, z własną wyszukiwarką, składnią zapytań i filtrami, z których prawie nikt nie korzysta.
Od lat wyciągam z Archive.org witryny klientów, martwe oprogramowanie i zeskanowane instrukcje. Różnica między znalezieniem czegoś w dwie minuty a rezygnacją po dwudziestu rzadko zależy od szczęścia. Chodzi o to, które pole wyszukiwania wybrać i który filtr kliknąć. To jest workflow, który faktycznie stosuję.
Co faktycznie indeksuje strona Archive.org
Tutaj zaczyna się zamieszanie. Archive.org prowadzi dwa różne systemy, które dzielą to samo logo. Archiwum obiektów, przeszukiwane ze strony głównej, zawiera przesłane i zaindeksowane obiekty: książki, koncerty, oprogramowanie, filmy, nagrania radiowe. Każdy obiekt ma metadane, listę plików i recenzje. Wayback Machine, dostępna pod adresem web.archive.org, przechowuje snapshoty stron indeksowane po adresie URL. Ponad 900 miliardów z nich.
Dlaczego to ważne w przypadku starych witryn? Bo martwa strona może pojawić się w obu miejscach, w różnej formie. Strona Wayback Machine trzyma strony. Strona obiektów może zawierać ratunkowy crawl Archive Team całej usługi, w której żyła twoja witryna, GeoCities, FortuneCity, MobileMe, zapakowany jako pliki WARC do pobrania. Jeśli korzystasz zawsze tylko z jednych drzwi, ominiesz te drugie.
- Teksty: zeskanowane książki, instrukcje, magazyny, przeszukiwalne w pełnym tekście
- Oprogramowanie: wszystko, od płyt shareware po stare przeglądarki i projektory Flash
- Audio i wideo: koncerty na żywo, archiwa radiowe, kroniki filmowe, reklamy
- Obiekty web: kolekcje crawlów i łupy Archive Team, przechowywane jako pliki WARC
- Obrazy i dane: zestawy zdjęć, skany map, zbiory badawcze
Wyszukiwanie zaawansowane na stronie Archive.org
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Pole na stronie głównej wystarczy do bootlegów Beatlesów. W przypadku czegokolwiek precyzyjnego przejdź do strony wyszukiwania zaawansowanego, archive.org/advancedsearch.php, albo sam napisz zapytanie. Składnia jest wzorowana na Lucene i ścisła: nazwy pól są małymi literami, zakresy używają nawiasów kwadratowych, a operatory logiczne muszą być wielkimi literami. Pomyl się w którymkolwiek z tych elementów, a po cichu dostaniesz śmieciowe wyniki.
Zapytanie, które znajduje oprogramowanie powiązane z Joomlą dodane między 2005 a 2010 rokiem, wygląda tak: title:(joomla) AND mediatype:software AND date:[2005-01-01 TO 2010-12-31]. Wklej je w pole wyszukiwania i po prostu działa. Bez formularza.
- identifier:, dokładny slug URL obiektu; najszybsze możliwe wyszukiwanie
- collection:, zawężenie do jednej kolekcji, np. collection:archiveteam
- creator: i title:, niedokładne, ale przydatne z cudzysłowami wokół fraz
- date:[YYYY-MM-DD TO YYYY-MM-DD], zakres daty dodania, nie daty pierwotnej publikacji
- mediatype:, texts, software, audio, movies, image, web, data
- NOT, AND, OR oraz nawiasy, łącz swobodnie, ale wielkimi literami
Jedna pułapka: date: filtruje po dacie trafienia obiektu do archiwum, a nie po dacie powstania treści. Instrukcja z 2003 roku wgrana w 2019 pasuje do 2019.

Filtry, które robią największą robotę
Gdy tylko wyniki się załadują, lewy pasek boczny to miejsce, w którym oszczędza się czas. Możesz filtrować po mediatype, roku, kolekcji, twórcy i języku oraz sortować po trafności, wyświetleniach (całkowitych lub tygodniowych), dacie dodania lub tytule. Większość wyszukiwań kończy się niepowodzeniem nie dlatego, że materiału nie ma, ale dlatego, że siedzi na stronie dziewiątej za dwustu odcinkami podcastów. Filtry to naprawiają.
- Najpierw filtruj po mediatype. Wyszukiwanie nieistniejącego CMS-a po wszystkim topi cię w plikach audio.
- Sortuj po tygodniowych wyświetleniach, gdy szukasz materiału aktywnie utrzymywanego, tłum to niezły sygnał jakości.
- Łącz filtry kolekcji i roku, żeby odtworzyć, jak wyglądał zakątek sieci, powiedzmy, w 2008 roku.
| Filtr | Najlepsze zastosowanie |
|---|---|
| Mediatype | Odcinanie 90% szumu jednym kliknięciem |
| Rok | Odtwarzanie osi czasu wokół życia witryny |
| Kolekcja | Pozostawanie w zaufanym crawlu lub projekcie ratunkowym |
| Twórca / uploader | Śledzenie pełnego zestawu jednego archiwisty |
| Tygodniowe wyświetlenia | Wychwytywanie obiektów, które ludzie nadal aktywnie używają |
Kolekcje warte poznania przy starych witrynach
Kolekcje to kuratorowane półki, a kilka z nich jest złotem dla każdego, kto poluje na stare witryny:
- archiveteam, spanikowane, pełne miłości łupy umierających usług: GeoCities, FortuneCity, Posterous, MobileMe. Często kompletne crawle WARC całych platform hostingowych.
- geocities i jego mirrory, akcja ratunkowa Yahoo! GeoCities, największe pojedyncze odzyskanie osobistych stron WWW w historii.
- widecrawl i inne kolekcje crawlów, masowe crawle Internet Archive, przydatne, gdy widok Wayback Machine dla konkretnego adresu URL ma luki.
- kolekcje biblioteki oprogramowania, stare przeglądarki, Flash, Shockwave, aplety Javy. Są potrzebne, żeby faktycznie uruchomić to, co serwowały stare witryny.
- cd-rom software library, płyty shareware pełne wiernych swojej epoce kreatorów stron, liczników i skryptów księgi gości.
Zacznij od strony kolekcji, nie od pola wyszukiwania. Opiekunowie zwykle dokumentują, co jest w środku, jak crawlowano i co oznacza układ plików, kontekst, który ratuje cię przed zgadywaniem o drugiej w nocy.

Strona Archive.org vs. Wayback Machine: którymi drzwiami wejść
| Wyszukiwanie obiektów Archive.org | Wayback Machine | |
|---|---|---|
| Przeszukujesz | Obiekty po metadanych | Adresy URL po adresie |
| Otrzymujesz | Pliki do pobrania | Wyrenderowane snapshoty |
| Najlepsza do | Oprogramowanie, media, masowe crawle | Strony konkretnej witryny |
| Słabość | Brak renderowania stron | Brak oficjalnego pobierania całej witryny |
Zasada kciuka: jeśli znasz adres URL, zacznij od Wayback Machine. Jeśli potrafisz tylko opisać rzecz, tę skórkę phpBB, której wszyscy używali w 2007, wygrywa wyszukiwanie obiektów. Przy pełnym odtwarzaniu zwykle i tak kończysz, korzystając z obu: crawlów i danych CDX od strony obiektów, snapshotów stron od strony Wayback.
Prawdziwy workflow: polowanie na martwe forum klienta
Konkretny przypadek. Forum phpBB klienta z 2009 roku zniknęło, gdy hosting padł w 2014. Domena przez lata stała zaparkowana; klient chciał odzyskać treść. Oto sekwencja, która zadziałała:
- Zapytanie Wayback CDX na domenie, żeby zmapować, które adresy URL zostały przechwycone i kiedy, około 1400 przechwyceń, większość z lat 2010–2012.
- Wyszukiwanie obiektów dla domeny i nazwy witryny wewnątrz collection:archiveteam, tym razem nic, ale to trzydziestosekundowe sprawdzenie.
- Sprawdzenie kolekcji starego hostingu, sam hosting został częściowo przejęty przez Archive Team, co wypełniło kilka luk w szablonach i obrazach.
- Wyszukiwanie oprogramowania forum z filtrem roku, żeby pobrać wierny epoce pakiet phpBB do odniesienia.
Łączny czas: około czterdzieści minut, większość na czytaniu wyjścia CDX. Wyszukiwanie jest łatwą częścią, gdy znasz drzwi. Zauważ, co się nie wydarzyło: żadnego zgadywania cache Google, żadnego błagania supportu starego hostingu, żadnych płatności, na razie. Archiwum powiedziało nam dokładnie, co przetrwało, 1400 przechwyceń, znaną lukę w 2013 i częściowy crawl ratunkowy, który ją łata. Te same dane CDX odczytuje wycena Restorix, żeby policzyć pliki i wycenić odtworzenie, tu ta historia się ciągnie dalej.
Kiedy strona Archive.org nie wystarcza
Powyższe metody pozwalają znaleźć materiał. Nie dają ci gotowej, działającej witryny. Snapshoty Wayback Machine mają przepisane adresy URL, brakujące obrazy, martwe formularze i bezwzględne linki wskazujące na domenę, której już nie kontrolujesz. Ręczne odbudowywanie witryny z surowych przechwyceń to dni skryptów sed i żalu.
Dokładnie tę lukę wypełnia Restorix CMS. Wklej adres URL, a darmowa wycena pokaże dokładną liczbę zarchiwizowanych plików, łączny rozmiar i ustaloną cenę, zanim cokolwiek zapłacisz. Odtworzenia mogą usuwać analitykę i reklamy, konwertować linki na względne, wymuszać HTTPS i wdrażać od razu na twój VPS, hosting FTP lub S3, z dołączonym CMS-em w jednym pliku, żebyś mógł edytować przywróconą treść.
Używaj strony Archive.org do zwiadu: sprawdź, co istniało, kiedy i ile z tego przetrwało. Potem pozwól narzędziom zająć się odbudową. Twój czas jest wart więcej niż weekend parsowania WARC-ów.
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
FAQ
Czy korzystanie ze strony Archive.org jest darmowe?
Tak. Wyszukiwanie, strumieniowanie i pobieranie publicznych obiektów nic nie kosztuje, a do przeglądania nie trzeba konta. Darmowe konto dodaje ulubione, uploady i listy. Wypożyczanie niektórych nowszych książek wymaga konta, ale wszystko, co obejmuje ten przewodnik, jest otwarte.
Czym różni się strona Archive.org od Wayback Machine?
Archive.org to nadrzędna biblioteka cyfrowa: obiekty takie jak książki, oprogramowanie, audio i kolekcje crawlów, przeszukiwane po metadanych. Wayback Machine to jedna z usług w jej ramach, przechowująca ponad 900 miliardów snapshotów stron indeksowanych po adresie URL. Stare witryny mogą pojawiać się w obu, jako snapshoty Wayback Machine i jako obiekty masowych crawlów.
Czy mogę przeszukiwać stare strony WWW w Archive.org w pełnym tekście?
Nie. Wayback Machine indeksuje po adresie URL, a nie po tekście strony, potrzebujesz adresu, nie słów kluczowych. Wyszukiwanie pełnotekstowe działa tylko w obrębie obiektów tekstowych, takich jak zeskanowane książki. Dla stron najpierw znajdź adres URL (stare linki, wyszukiwarki, symbole wieloznaczne CDX), a potem go wyszukaj.
Jak pobrać coś znalezionego na stronie Archive.org?
Każda strona obiektu ma pole pobierania z listą poszczególnych plików oraz opcjami torrenta i całego obiektu. Dla witryn przechwyconych przez Wayback Machine nie ma przycisku pobierania, potrzebne jest API CDX, narzędzie do pobierania albo usługa odtwarzania, taka jak Restorix. Nasz przewodnik po [pobieraniu z Archive.org](/pl/download-archive-org) przeprowadza przez każdą metodę.
Dlaczego w ogóle nie mogę znaleźć konkretnej starej witryny?
Trzy najczęstsze powody: robots.txt witryny blokował crawlery, witryna nigdy nie była podlinkowana w miejscu, które crawler odwiedził, albo wszystko stało za logowaniem bądź dużą ilością Flasha i JavaScriptu. Zanim się poddasz, sprawdź API CDX dla samej domeny, przechwycenia czasem chowają się pod dziwnymi subdomenami albo wariantem www, o którym zapomniałeś.
Powiązane poradniki

wayback machine archive org
Wayback Machine na Archive.org: Praktyczny przewodnik
Praktyczny przewodnik po Wayback Machine na Archive.org: gdzie się znajduje, jak działają wyszukiwarka i kalendarz oraz jak zdobyć rzeczywiste pliki.

archiveorg
Archiveorg: Wewnątrz największej darmowej biblioteki internetowej
Archiveorg to więcej niż Wayback Machine: darmowe książki, muzyka na żywo, wiadomości telewizyjne, grywalne oprogramowanie i ponad 900 miliardów stron internetowych. Pełny przewodnik oraz odzyskiwanie plików.

download archive org
Jak pobierać z Archive.org: elementy, migawki i nie tylko
Każdy praktyczny sposób na pobieranie treści z Archive.org, pliki elementów, masowe pobieranie CLI i migawki internetowe Wayback, oraz jak wybrać odpowiedni dla swojego zadania.

archive org download
Formaty pobierania z Archive.org: WARC, CDX i pojedyncze pliki
Co faktycznie zawiera każdy format pobierania z Archive.org, dane przechwycenia WARC, indeksy JSON CDX i pojedyncze oryginalne pliki, oraz co z każdym z nich zrobić.
