Sito Web Archive.org: Ricerca Avanzata, Filtri e Collezioni
A cura di la redazione di Restorix · 26 aprile 2026 · 8 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
La maggior parte delle persone visita il sito web Archive.org esattamente una volta. Incollano un URL morto nella Wayback Machine, catturano uno screenshot e se ne vanno. È uno spreco di uno strumento serio. Dietro lo stesso login si trova un'intera biblioteca digitale, decine di milioni di elementi, con il proprio motore di ricerca, sintassi di query e filtri che quasi nessuno usa.
Ho recuperato siti clienti, software abbandonati e manuali scansionati da Archive.org per anni. La differenza tra trovare qualcosa in due minuti e arrendersi dopo venti è raramente fortuna. È sapere quale casella di ricerca usare e quale filtro cliccare. Questo è il flusso di lavoro che seguo realmente.
Cosa Indicizza Effettivamente il Sito Web Archive.org
La confusione inizia qui. Archive.org gestisce due sistemi diversi che condividono lo stesso logo. L'archivio degli elementi, ciò che cerchi dalla pagina iniziale, contiene oggetti caricati e raccolti: libri, concerti, software, video, programmi radio. Ogni elemento ha metadati, un elenco di file e recensioni. La Wayback Machine, su web.archive.org, contiene istantanee di pagine web indicizzate per URL. Oltre 900 miliardi di esse.
Perché è importante per i vecchi siti web? Perché un sito morto può apparire in entrambi i luoghi, in modo diverso. La parte Wayback ha le pagine. La parte degli elementi può contenere una raccolta di salvataggio dell'Archive Team dell'intero servizio su cui si trovava il tuo sito, GeoCities, FortuneCity, MobileMe, confezionata come file WARC scaricabili. Se usi solo una porta, perdi l'altra.
- Testi: libri scansionati, manuali, riviste, ricercabili nel testo completo
- Software: tutto, dai CD di shareware ai vecchi browser e proiettori Flash
- Audio e video: concerti dal vivo, archivi radio, cinegiornali, pubblicità
- Elementi web: collezioni di crawl e acquisizioni dell'Archive Team, memorizzate come file WARC
- Immagini e dati: set fotografici, scansioni di mappe, set di dati di ricerca
Ricerca Avanzata sul Sito Web Archive.org
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
La casella della pagina iniziale va bene per i bootleg dei Beatles. Per qualsiasi cosa precisa, vai alla pagina di ricerca avanzata, archive.org/advancedsearch.php, o scrivi tu stesso la query. La sintassi è simile a Lucene e rigorosa: i nomi dei campi sono in minuscolo, gli intervalli usano parentesi quadre e gli operatori booleani devono essere in maiuscolo. Se ne sbagli uno, ottieni silenziosamente risultati inutili.
Una query che trova software correlato a Joomla aggiunto tra il 2005 e il 2010 è così: title:(joomla) AND mediatype:software AND date:[2005-01-01 TO 2010-12-31]. Incollala nella casella di ricerca e funziona semplicemente. Non serve alcun modulo.
- identifier:, lo slug URL esatto dell'elemento; la ricerca più veloce che esista
- collection:, restringi a una collezione, es. collection:archiveteam
- creator: e title:, imprecisi ma utili con le virgolette attorno alle frasi
- date:[YYYY-MM-DD TO YYYY-MM-DD], intervallo di data di aggiunta, non di pubblicazione originale
- mediatype:, texts, software, audio, movies, image, web, data
- NOT, AND, OR e parentesi, combinale liberamente, ma in maiuscolo
Un dettaglio importante: i filtri date: si riferiscono a quando l'elemento è entrato nell'archivio, non a quando il contenuto è stato creato. Un manuale del 2003 caricato nel 2019 corrisponde al 2019.

Filtri che Fanno il Lavoro Pesante
Una volta caricati i risultati, la barra laterale sinistra è dove si risparmia tempo. Puoi filtrare per tipo di media, anno, collezione, creatore e lingua, e ordinare per rilevanza, visualizzazioni (totali o settimanali), data di aggiunta o titolo. La maggior parte delle ricerche fallisce non perché il materiale è assente, ma perché si trova alla pagina nove dietro duecento episodi di podcast. I filtri risolvono questo.
- Filtra prima per tipo di media. Cercare un CMS defunto in tutto il materiale ti sommerge di audio.
- Ordina per visualizzazioni settimanali quando vuoi materiale mantenuto, la massa è un buon indicatore di qualità.
- Accumula filtri di collezione e anno per ricostruire com'era un angolo del web, ad esempio, nel 2008.
| Filtro | Uso migliore |
|---|---|
| Tipo di media | Taglia il 90% del rumore con un solo clic |
| Anno | Ricostruire una timeline attorno alla vita di un sito |
| Collezione | Restare all'interno di un crawl o progetto di salvataggio affidabile |
| Creatore / caricatore | Seguire l'intero set di un archivista |
| Visualizzazioni settimanali | Individuare gli elementi che le persone usano ancora attivamente |
Collezioni da Conoscere per i Vecchi Siti Web
Le collezioni sono scaffali curati, e alcune di esse sono oro per chiunque insegua vecchi siti web:
- archiveteam, acquisizioni disperate e appassionate di servizi morenti: GeoCities, FortuneCity, Posterous, MobileMe. Spesso crawl WARC completi di intere piattaforme di hosting.
- geocities e i suoi mirror, il salvataggio di Yahoo! GeoCities, il più grande recupero mai effettuato di pagine web personali.
- widecrawl e altre collezioni di crawl, crawl bulk dell'Internet Archive, utili quando la vista per URL della Wayback ha lacune.
- collezioni della libreria software, vecchi browser, Flash, Shockwave, applet Java. Ne hai bisogno per eseguire effettivamente ciò che i vecchi siti servivano.
- cd-rom software library, dischi di shareware pieni di costruttori di siti, contatori e script per il libro degli ospiti dell'epoca.
Inizia dalla pagina della collezione, non dalla casella di ricerca. I manutentori di solito documentano cosa c'è dentro, come è stato raccolto e cosa significa la struttura dei file, un contesto che ti risparmia di indovinare alle 2 di notte.

Sito Web Archive.org vs. Wayback Machine: Quale Porta Usare
| Ricerca elementi Archive.org | Wayback Machine | |
|---|---|---|
| Cerchi | Elementi per metadati | URL per indirizzo |
| Ottieni | File scaricabili | Istantanee rese |
| Ideale per | Software, media, crawl bulk | Pagine di un sito specifico |
| Debolezza | Nessuna resa delle pagine | Nessun download ufficiale dell'intero sito |
Regola pratica: se puoi nominare l'URL, inizia nella Wayback Machine. Se puoi solo descrivere la cosa, quel tema phpBB che tutti usavano nel 2007, la ricerca degli elementi vince. Per un ripristino completo di solito finisci per usare entrambi: crawl e dati CDX dal lato degli elementi, istantanee di pagine dal lato Wayback.
Un Flusso di Lavoro Reale: Cacciare il Forum Morto di un Cliente
Caso concreto. Il forum phpBB del 2009 di un cliente è scomparso quando l'host ha chiuso nel 2014. Il dominio è rimasto parcheggiato per anni; volevano recuperare il contenuto. Ecco la sequenza che ha funzionato:
- Query CDX Wayback sul dominio per mappare quali URL sono stati catturati e quando, circa 1.400 catture, la maggior parte dal 2010 al 2012.
- Ricerca dell'elemento per dominio e nome del sito all'interno di collection:archiveteam, niente questa volta, ma è un controllo di trenta secondi.
- Controllo della collezione sul vecchio host, l'host stesso era stato parzialmente acquisito dall'Archive Team, che ha colmato diverse lacune di template e immagini.
- Ricerca filtrata per anno sul software del forum per recuperare un pacchetto phpBB dell'epoca come riferimento.
Tempo totale: circa quaranta minuti, la maggior parte dedicata alla lettura dell'output CDX. La ricerca è la parte facile una volta che conosci le porte. Nota cosa non è successo: nessuna ipotesi sulla cache di Google, nessuna supplica alla casella di posta del supporto del vecchio host, nessun pagamento a nessuno ancora. L'archivio ci ha detto esattamente cosa è sopravvissuto, 1.400 catture, una lacuna nota nel 2013 e un crawl di salvataggio parziale per colmarla. Quegli stessi dati CDX sono ciò che una stima di Restorix legge per contare i file e prezzare un ripristino, il punto in cui questa storia continua qui sotto.
Quando il Sito Web Archive.org Non Basta
Tutto quanto sopra trova materiale. Non ti consegna un sito web funzionante. Le istantanee della Wayback arrivano con URL riscritti, immagini mancanti, moduli morti e link assoluti che puntano a un dominio che non controlli più. Ricostruire un sito dalle catture grezze a mano è giorni di script sed e rimpianti.
Questa lacuna è esattamente per cui è stato creato questo servizio. Incolla l'URL, e la stima gratuita mostra il conteggio esatto dei file archiviati, la dimensione totale e un prezzo bloccato prima di pagare qualsiasi cosa. I ripristini possono rimuovere analytics e pubblicità, convertire i link in relativi, forzare HTTPS e distribuire direttamente sul tuo VPS, hosting FTP o S3, con un CMS a file singolo incluso così puoi modificare il contenuto rianimato.
Usa il sito web Archive.org per esplorare: verifica cosa esisteva, quando e quanto è sopravvissuto. Poi lascia che gli strumenti facciano la ricostruzione. Il tuo tempo vale più di un weekend di parsing WARC.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
Il sito web Archive.org è gratuito da usare?
Sì. Cercare, riprodurre in streaming e scaricare elementi pubblici non costa nulla, e non è necessario un account per navigare. Un account gratuito aggiunge preferiti, caricamenti e liste. Il prestito di alcuni libri moderni richiede un account, ma tutto ciò che è coperto in questa guida è aperto.
Qual è la differenza tra il sito web Archive.org e la Wayback Machine?
Archive.org è la biblioteca digitale principale: elementi come libri, software, audio e collezioni di crawl, ricercabili per metadati. La Wayback Machine è un servizio al suo interno, che contiene oltre 900 miliardi di istantanee di pagine web indicizzate per URL. I vecchi siti web possono apparire in entrambi, come istantanee Wayback e come elementi di crawl bulk.
Posso cercare nel testo completo le vecchie pagine web su Archive.org?
No. La Wayback Machine indicizza per URL, non per il testo della pagina, hai bisogno dell'indirizzo, non delle parole chiave. La ricerca nel testo completo funziona solo all'interno di elementi di testo come libri scansionati. Per le pagine, trova prima l'URL (vecchi link, motori di ricerca, wildcard CDX), poi cercalo.
Come faccio a scaricare qualcosa che trovo sul sito web Archive.org?
Ogni pagina dell'elemento ha una casella di download che elenca i singoli file, oltre a opzioni torrent e intero elemento. Per i siti web catturati dalla Wayback Machine non c'è un pulsante di download, serve l'API CDX, uno strumento di download o un servizio di ripristino come Restorix. La nostra guida a [scaricare da Archive.org](/it/download-archive-org) spiega ogni metodo.
Perché non riesco a trovare un vecchio sito specifico?
Tre ragioni comuni: il robots.txt del sito ha bloccato i crawler, il sito non è mai stato collegato da nessuna parte dove un crawler lo seguiva, o tutto si trovava dietro un login o pesante Flash e JavaScript. Controlla l'API CDX per il dominio nudo prima di arrenderti, le catture a volte si nascondono sotto sottodomini strani o una variante www che hai dimenticato.
Guide correlate

wayback machine archive org
Wayback Machine su Archive.org: una guida pratica al sito
Un tour pratico della Wayback Machine su Archive.org: dove si trova, come funzionano realmente la casella di ricerca e il calendario, e come andarsene con file reali.

archiveorg
Archiveorg: dentro la più grande libreria gratuita di Internet
Archiveorg è molto più del Wayback Machine: libri gratuiti, musica dal vivo, notizie TV, software giocabili e oltre 900 miliardi di pagine web. Tour completo, più recupero file.

download archive org
Come scaricare da Archive.org: elementi, snapshot e altro
Ogni modo pratico per scaricare contenuti da Archive.org, file di elementi, download massivi da CLI e snapshot web del Wayback Machine, e come scegliere quello giusto per il tuo lavoro.

archive org download
Formati di download di Archive.org: WARC, CDX e file singoli
Cosa contiene davvero ogni formato di download di Archive.org, acquisizioni WARC, indici CDX in JSON e singoli file originali, e cosa farne.
