Wayback Machine: la guida completa alla storia del web
A cura di la redazione di Restorix · 30 aprile 2026 · 8 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Il Wayback Machine mi ha tirato fuori dai guai più volte di quante riesca a contarne. Un negozio WooCommerce di un cliente cancellato da un aggiornamento maldestro di un plugin. La pagina prezzi di un concorrente del 2019, serviva per una disputa contrattuale. La versione originale di un articolo che qualcuno ha riscritto di nascosto dopo essere stato citato in una causa. È la memoria del web, e usarlo non costa nulla. Eppure la maggior parte delle persone tocca solo la casella di ricerca sulla homepage e si perde tutto il resto. Questa guida spiega come funziona davvero l'archivio, ogni trucco di ricerca che vale la pena conoscere, dove arranca e cosa fare quando sfogliare le istantanee non basta e ti serve il sito stesso.
Cos'è davvero il Wayback Machine
Il Wayback Machine è un archivio pubblico e gratuito di pagine web, gestito dall'Internet Archive, una biblioteca digitale no-profit con sede a San Francisco. Brewster Kahle ha fondato l'organizzazione nel 1996 e il Wayback Machine è stato aperto al pubblico nel 2001. Il nome è un omaggio alla macchina WABAC, il marchingegno per viaggiare nel tempo del cartone anni '60 Le incredibili storie di Peabody, ed è anche il motivo per cui molti lo ricordano erroneamente come 'la way back machine'.
La collezione ha superato i 900 miliardi di pagine web archiviate e continua a crescere di oltre un miliardo di pagine a settimana. Insieme alle pagine web, l'Internet Archive conserva libri scansionati, notizie TV, audio e vecchio software eseguibile nel browser. Consultarlo è gratuito e non richiede un account.
Una distinzione conta più di ogni altra: il Wayback Machine archivia pagine, non siti. Ogni istantanea è un singolo URL catturato in un singolo istante. Non esiste un oggetto 'intero sito, marzo 2015' infilato in uno scaffale, solo migliaia di singole catture di pagine che condividono un dominio. Tienilo a mente, perché spiega quasi ogni stranezza in cui incorrerai dopo.
Come funzionano le scansioni e le istantanee
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
L'archivio è costruito dai crawler. Nei primi anni l'Internet Archive si appoggiava ai dati di scansione di Alexa Internet, una società di web analytics co-fondata da Kahle; oggi gestisce una propria operazione di crawling, insieme a scansioni di partner e milioni di salvataggi manuali degli utenti. Un crawler richiede un URL, memorizza l'HTML ricevuto, poi recupera le risorse a cui quell'HTML fa riferimento, immagini, fogli di stile, script, ciascuna salvata come file a sé.
Quest'ultimo dettaglio spiega la confusione più comune. Un'istantanea non è una cartella congelata nel tempo. L'HTML della pagina potrebbe essere del 3 marzo, il suo foglio di stile del 9 marzo e l'immagine principale del 20 febbraio. Quando tutto combacia, la pagina si visualizza bene. Quando non combacia, ottieni la classica istantanea rotta: testo intatto, layout distrutto, riquadri grigi al posto delle foto.
Quanto spesso una pagina viene scansionata
Non c'è un calendario su cui poter contare. La frequenza delle scansioni segue la popolarità: la homepage di un grande giornale viene catturata migliaia di volte al giorno, mentre un forum phpBB del 2009 potrebbe apparire due volte in un decennio. Se una pagina ti interessa, non aspettare che un crawler si accorga di lei, salvala tu stesso, un trucco che vedremo tra qualche paragrafo.
Cosa può bloccare una scansione
Il crawler rispetta robots.txt, e un'esclusione può valere anche retroattivamente: un sito che applica un divieto totale al proprio dominio può togliere dall'archivio l'intera storia delle sue catture, finché il blocco non viene rimosso. I proprietari dei siti possono anche chiedere direttamente all'Internet Archive di escludere i propri contenuti. Le pagine protette da login e paywall non vengono proprio scansionate.
Leggere il calendario e la cronologia
Cerca un URL e atterri sulla vista calendario. Due strumenti fanno tutto il lavoro. Il grafico a barre in alto mostra le catture per anno, un modo rapido per capire quando un sito era attivo, quando era frequentato e quando è andato offline. Il calendario sotto segna ogni giorno catturato dell'anno selezionato.
- Cerchio blu: una cattura normale che ha restituito un 200 OK.
- Cerchio verde: la cattura era un redirect. Il crawler lo ha seguito, quindi controlla dove è arrivato.
- Segno rosso: una risposta di errore, di solito un 404 o 500. Raramente vale la pena aprirla.
- Cerchio più grande: più catture in quel giorno. Passa con il mouse su un giorno per gli orari esatti, clicca su un timestamp per aprirlo.
Apri un'istantanea e in cima alla pagina compare un banner. Riporta il timestamp UTC esatto, le frecce per la cattura precedente e successiva e un pannello 'About this capture' con i metadati della scansione. Quando stai cercando una modifica specifica, ad esempio quando un'azienda ha eliminato la sua clausola di rimborso, non cliccare giorni a caso. Cerca grappoli e buchi, poi delimita la modifica tra l'ultima cattura che la contiene e la prima che non la contiene.

Sintassi di ricerca del Wayback Machine da memorizzare
La casella di ricerca sulla homepage è la via più lenta. Il vero strumento è l'URL stesso, e una manciata di schemi copre quasi tutto ciò che ti servirà.
| Schema | Cosa fa | Esempio |
|---|---|---|
| web.archive.org/web/2020/URL | Cattura più vicina al 1° gennaio 2020 | web.archive.org/web/2020/example.com |
| web.archive.org/web/20200615143000/URL | Cattura più vicina a un secondo preciso (UTC, AAAAMMGGHHMMSS) | web.archive.org/web/20200615143000/example.com |
| web.archive.org/web/*/URL | Calendario di ogni cattura di quella singola pagina | web.archive.org/web/*/example.com/pricing |
| web.archive.org/web/*/dominio/* | Ogni URL catturato sotto un dominio, filtrabile | web.archive.org/web/*/example.com/* |
| web.archive.org/web/2020id_/URL | File originale, senza banner, senza link riscritti | web.archive.org/web/2020id_/example.com |
| web.archive.org/web/2020im_/URL | Solo l'asset immagine a quel timestamp | web.archive.org/web/2020im_/example.com/logo.png |
Due di questi meritano una menzione speciale. L'elenco URL a livello di dominio è il modo più veloce per trovare una pagina di cui ricordi a metà l'indirizzo, digita un frammento dello slug nel filtro e l'archivio restringe migliaia di percorsi fino al singolo articolo che ti serve. E il modificatore id_ è quello che usano i professionisti quando serve il file stesso invece di un'anteprima riformattata, perché restituisce i byte originali senza banner e senza riscrivere un solo link.
Save Page Now e quando rifiuta
L'archivio non è solo una sala di lettura. Save Page Now ci scrive dentro: incolla qualsiasi URL pubblico su web.archive.org/save e un crawler recupera la pagina live nel giro di secondi. Un account gratuito sblocca funzioni extra come il salvataggio delle pagine collegate e screenshot a pagina intera. Se pubblichi qualcosa di importante, salvarla lo stesso giorno è l'assicurazione più economica su internet.
Rifiuta più spesso di quanto ci si aspetti. Le pagine bloccate da robots.txt non si salvano. L'uso anonimo è soggetto a limiti di frequenza, quindi salvare cinquanta pagine di fila in batch si blocca. Le schermate di login si salvano come schermate di login. E le app pesanti in JavaScript a volte si archiviano come un guscio vuoto, l'HTML si è salvato, ma il contenuto esisteva solo dopo l'esecuzione degli script, e quegli script interrogavano un'API morta da tempo.
Dove il Wayback Machine è carente
- Tutto ciò che sta dietro un login, un paywall o un form POST non viene mai archiviato.
- Le app interattive che si renderizzano con JavaScript spesso sopravvivono come gusci vuoti.
- Video e audio in streaming raramente funzionano dalle vecchie catture.
- Buchi. La settimana che ti serve disperatamente è puntualmente la settimana in cui nessuno ha fatto scansioni.
- Nessun download dell'intero sito. Sfogli una pagina alla volta, con i link riscritti per puntare di nuovo attraverso l'archivio.
- Il codice lato server è perso per sempre. Le istantanee contengono HTML renderizzato; il PHP, il database e il pannello di amministrazione non sono mai stati pubblici, quindi non sono mai stati archiviati.
Nessuno di questi è un bug. L'archivio è stato pensato per la memoria, non per la migrazione, e questa distinzione conta nel momento in cui il tuo obiettivo passa dal leggere una vecchia pagina al ricostruire un intero sito web.
Dal Wayback Machine a un sito ripristinato
Sfogliare un'istantanea risponde a domande. Non ti consegna un sito web. I link puntano di nuovo verso archive.org, le risorse sono servite dai server dell'archivio e non c'è un pulsante Esporta. Copiare a mano funziona per una o due pagine; un negozio di 3.000 pagine copiato così è un mese di vita che non torna indietro. È il momento in cui si smette di fare ricerche e si comincia a cercare un ripristino dal Wayback Machine.
Proprio per colmare questo gap è nato questo servizio. Recupera ogni file archiviato di un dominio, ricostruisce i link interni funzionanti e mostra prima un preventivo gratuito, il numero esatto di file, la dimensione totale e un prezzo bloccato prima ancora di pagare. I ripristini si pagano a file, il primo file è gratuito e i ripristini falliti vengono rimborsati automaticamente sul tuo saldo. Le opzioni coprono le parti meno glamouriose ma decisive: rimozione di vecchi script di analytics e pubblicità, conversione dei link in relativi, forzatura di HTTPS, mantenimento dei redirect 301 attivi ed esportazione dei dati strutturati degli articoli in XML, CSV o JSON.

Quando i file sono pronti, un clic li distribuisce sul tuo VPS via SSH o SFTP, su hosting condiviso via FTP o su un bucket S3, e ogni distribuzione include un piccolo CMS monofile su /webarchive-cms.php, così il sito ripristinato è modificabile nel momento in cui atterra. Il tutorial accompagna attraverso un'esecuzione completa in circa dieci minuti.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
Usare il Wayback Machine è legale?
Sfogliare è legale e l'archivio opera come una biblioteca. Il copyright si applica comunque a ciò che fai dei contenuti, leggere una vecchia pagina va bene, ripubblicare pari pari il testo di qualcun altro no. Ripristinare il proprio sito, o contenuti di cui si detengono i diritti, è il caso comune e sicuro.
Fino a quanto indietro arriva il Wayback Machine?
I dati di scansione partono dal 1996, quindi le catture più vecchie hanno quasi trent'anni. La copertura degli anni '90 è però rada; la densità diventa affidabile dalla metà degli anni 2000 in poi.
Perché un'istantanea è priva di immagini o stile?
Ogni risorsa viene catturata separatamente e alcune non sono mai state recuperate, bloccate da robots.txt, servite da un dominio diverso o semplicemente saltate quel giorno. L'HTML è sopravvissuto; la resa grafica no. Prova una cattura di qualche giorno prima o dopo.
Posso scaricare un intero sito web dal Wayback Machine?
L'archivio di per sé non ha un pulsante per scaricare un sito. Puoi salvare le pagine una alla volta, oppure usare un servizio di ripristino come Restorix che riassembla l'intero dominio, la nostra guida per [scaricare interi siti web da archive.org](/it/download-entire-website-from-archive-org) passa in rassegna tutte le opzioni.
Come rimuovo il mio sito dal Wayback Machine?
Aggiungi un disallow per il crawler ia_archiver in robots.txt, oppure invia una richiesta di esclusione all'Internet Archive. I blocchi possono nascondere anche le catture passate, non solo quelle future.
Il Wayback Machine archivia i social media?
In parte. I post e i profili pubblici vengono catturati, ma i feed basati su login e scroll infinito si archiviano male. Considera le catture dei social come ritrovamenti fortunati, non come un archivio affidabile.
Guide correlate

wayback
Come usare Wayback ogni giorno: pagine perdute, link morti, vecchie promesse
Wayback è il modo più rapido per recuperare una pagina persa, verificare cosa diceva un sito l'anno scorso, citare un link morto o valutare un'azienda prima di pagare. Ecco come fare.

the way back machine
La Way Back Machine: cos'è e perché esiste
Stai cercando 'the Way Back Machine'? L'hai trovata, si chiama ufficialmente Wayback Machine. Ecco cos'è, chi l'ha creata e cosa può e non può fare.

wayback machine restore
Ripristino da Wayback Machine: 4 insidie e come evitarle
Un ripristino da Wayback Machine può fallire in silenzio: pagine parcheggiate, catene di redirect, immagini mancanti, timestamp incoerenti. Come riconoscere ogni insidia e evitarla.

download entire website from archive org
Scarica un intero sito web da Archive.org, non solo la homepage
Per scaricare un intero sito web da archive.org servono tutte le pagine, le immagini e i fogli di stile. Le risorse si nascondono sotto timestamp diversi, ecco perché, più una checklist completa.
