Internet Archive Way Back Machine: Guida per Webmaster
A cura di la redazione di Restorix · 5 maggio 2026 · 8 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Internet Archive Way Back Machine è la cosa più simile a una memoria pubblica del web. Digita un URL e puoi vedere l'evoluzione di una homepage: da un layout a tabella del 1998 a un mostro di slider del 2012 fino a ciò che è stato pubblicato martedì scorso. Il servizio è gratuito, si basa su donazioni e contiene oltre 900 miliardi di pagine web. Questa guida spiega chi lo gestisce, come è diventato così grande e i modi specifici in cui i webmaster lo utilizzano, incluso cosa fare quando la navigazione tra vecchi snapshot non basta più e hai bisogno dei file veri.
Cos'è realmente Internet Archive Way Back Machine
Il Wayback Machine è una biblioteca con datazione delle pagine web, gestita come una collezione all'interno della più ampia biblioteca digitale dell'Internet Archive. I suoi crawler recuperano le pagine pubbliche, l'HTML, insieme a immagini, fogli di stile e script quando possibile, e memorizzano ogni recupero come una cattura datata. Cerca un URL e ottieni un calendario di tutte le catture registrate, in alcuni casi risalenti al 1996.
Due cose che non è. Non è un servizio di backup che controlli tu: il crawler decide quando visitare, e per i siti più piccoli sono normali buchi di mesi. E non è un servizio di download, non esiste un pulsante che ti consegna un sito come file. È un visualizzatore. Questa distinzione conta molto più avanti, quando devi ripubblicare qualcosa anziché ammirarlo.
Il nome, tra l'altro, è uno scherzo. È un riferimento alla macchina WABAC dei cartoni animati Peabody's Improbable History, la memoria collettiva del web, chiamata come la macchina del tempo di un cane dei cartoni.
L'organizzazione no-profit dietro la macchina
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
L'Internet Archive è stato fondato nel 1996 da Brewster Kahle, un ingegnere che aveva co-fondato Alexa Internet, una delle prime aziende di analisi web. I crawler di Alexa hanno eseguito le prime scansioni su larga scala del giovane web, e quelle scansioni sono diventate il patrimonio iniziale dell'archivio. Il Wayback Machine stesso è stato aperto al pubblico nel 2001, quando c'era abbastanza materiale da navigare.
L'organizzazione è un ente no-profit 501(c)(3) con sede in una ex chiesa nel quartiere Richmond di San Francisco, quella con piccole statue di argilla dei dipendenti che occupano i banchi. La sua missione dichiarata è 'Accesso Universale a Tutta la Conoscenza', e si finanzia attraverso donazioni, sovvenzioni di fondazioni e lavoro di digitalizzazione a pagamento per biblioteche. Il bilancio annuale è dell'ordine delle decine di milioni di dollari: soldi veri, finché non ricordi che un singolo data center hyperscale costa più di così per essere alimentato per un anno.

Lo status no-profit non è un dettaglio. Spiega perché il servizio è gratuito, perché le tue ricerche non vengono monetizzate e perché l'archivio continua a raccogliere pagine che non hanno alcun caso d'affari. Significa anche che il posto opera in modo snello, cosa che sentirai occasionalmente quando il sito rallenta in un pomeriggio feriale intenso.
Le dimensioni di Internet Archive Way Back Machine nel 2026
Il numero principale è oltre 900 miliardi di pagine web. Questo conta le catture, non i siti, una homepage di un sito di notizie attivo può rappresentare da sola decine di migliaia di esse. La collezione web riempie decine di petabyte di storage, e l'archivio più ampio accumula milioni di libri, registrazioni, video e titoli software. Un quadro approssimativo:
| Collezione | Dimensioni approssimative | Come cresce |
|---|---|---|
| Pagine web (Wayback Machine) | Oltre 900 miliardi di catture | Scansioni più richieste pubbliche Save Page Now |
| Libri e testi | Decine di milioni di elementi | Partenariati di scansione con biblioteche |
| Audio e musica | Milioni di registrazioni | Caricamenti da etichette, radio e comunità |
| Video e notizie televisive | Milioni di elementi | Cattura di trasmissioni e donazioni |
| Software e giochi | Centinaia di migliaia di titoli | Caricamenti di conservazione, emulazione nel browser |
Il pubblico contribuisce più di quanto molti si aspettino. Save Page Now, la casella dove chiunque può inviare un URL, mette in coda milioni di catture al giorno. Se una pagina è mai stata importante per qualcuno, è probabile che il Wayback ne abbia una copia.

Come funziona realmente la scansione
Il crawler è Heritrix, un spider open-source che l'Internet Archive ha sviluppato per anni e che anche le biblioteche nazionali utilizzano. Le scansioni sono alimentate da grafi di link, sitemap, nomine dei partner e la coda di Save Page Now. Non c'è un programma fisso. La homepage di un'importante testata potrebbe essere catturata decine di volte al giorno; un blog personale toccato l'ultima volta nel 2011 potrebbe avere tre catture in tutto. Due peculiarità contano in pratica. Primo, robots.txt: l'archivio lo ha rispettato a lungo, e a volte retroattivamente, quindi un dominio che è passato di mano e improvvisamente ha disabilitato tutto potrebbe vedere le sue vecchie catture nascoste. La politica si è allentata, ma le regole dei robot modellano ancora le scansioni. Secondo, profondità: i crawler seguono i link, quindi le pagine orfane senza link in entrata spesso non vengono mai catturate.
La coda di Save Page Now
Se tieni al fatto che il tuo sito venga archiviato, non bloccare lo user agent ia_archiver, mantieni una sitemap XML pulita e invia gli URL chiave a Save Page Now dopo ogni lancio o migrazione. Ci vogliono dieci secondi per pagina e la cattura di solito arriva entro pochi minuti. Trattalo come una polizza assicurativa gratuita che puoi rinnovare quanto vuoi.
Come i webmaster utilizzano Internet Archive Way Back Machine
È qui che l'archivio smette di essere una curiosità e inizia a guadagnarsi il pane. I casi d'uso che si ripresentano continuamente:
- Ripristino di emergenza. Hosting scomparso, CMS compromesso, dominio scaduto, disco di backup del 2016 morto. Per una manciata di pagine, copiare testo e immagini dagli snapshot a mano è noioso ma fattibile.
- Analisi forense della migrazione. Il traffico è calato dopo un redesign? Confronta le catture prima e dopo. Puoi individuare la settimana in cui la pagina /pricing è scomparsa o è apparsa una catena di reindirizzamenti, molto più veloce che frugare nei log di deploy che non hai più.
- Due diligence per domini scaduti. Prima di acquistare un dominio scaduto, guarda cosa ospitava. L''agenzia di marketing' che stai considerando potrebbe aver trascorso il 2014 come negozio di pillole, e quella storia segue il dominio nel tuo progetto.
- Ricerca competitiva. Quando un concorrente ha cambiato i prezzi, si è riposizionato o ha silenziosamente eliminato una linea di prodotti? Le loro vecchie homepage sono lì.
- Prove. Gli snapshot vengono regolarmente citati in controversie su copyright, marchi e su cosa diceva effettivamente una pagina dei termini di servizio in una data specifica.
Per un approfondimento sull'audit del passato di un dominio prima di acquistarlo o ricostruirlo, consulta la guida storia del sito web.
Quando navigare tra gli snapshot non basta più
Supponiamo che il caso peggiore sia reale: un negozio WooCommerce di un cliente, 2.300 pagine prodotto, e l'host ha cancellato l'account. Il Wayback Machine ha le pagine, puoi vederle. E questo è tutto ciò che puoi fare. Non c'è esportazione in blocco. Le risorse sono state catturate in momenti diversi, quindi metà delle immagini dei prodotto danno 404 all'interno del visualizzatore. Il campo di ricerca e i moduli di checkout sono elementi finti. Salva-con-nome del browser ti dà una pagina pasticciata alla volta, con URL riscritti verso percorsi di archive.org.
La ricostruzione manuale funziona per cinque pagine. Non funziona per cinquecento. È proprio quel divario che Restorix colma: estrae la copia archiviata di un dominio dal Wayback Machine e la ricostruisce come file reali che puoi ospitare di nuovo.
Dallo snapshot a un sito web funzionante
Il flusso di lavoro di ripristino, in breve:
- Esegui un preventivo gratuito. Vedi il conteggio esatto dei file archiviati, la dimensione totale e un prezzo bloccato prima di pagare qualsiasi cosa.
- Scegli l'intervallo di date delle catture e le opzioni di pulizia: rimuovi vecchi script di analisi e pubblicità, elimina link esterni, rendi i link interni relativi, converti in HTTPS, forza www o non-www.
- Paga per file ripristinato, il primo file è gratuito e il prezzo rimane bloccato dal preventivo. I rabbocchi del saldo sono una tantum; niente è ricorrente.
- Scarica i file, esporta il contenuto strutturato come XML, CSV o JSON, o distribuisci direttamente sul tuo VPS, hosting condiviso o S3. Un CMS leggero a file singolo è incluso nelle distribuzioni in modo che tu possa continuare a modificare il sito ripristinato.
I ripristini o le distribuzioni falliti vengono rimborsati automaticamente sul tuo saldo, la risposta corretta a 'e se i dati della scansione sono un pasticcio?'. Il tutorial illustra un ripristino completo dall'inizio alla fine, e la guida al ripristino Wayback copre i casi particolari.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
Internet Archive Way Back Machine è gratuito da usare?
Sì. Navigare, cercare e Save Page Now sono gratuiti. L'Internet Archive è un'organizzazione no-profit finanziata da donazioni e partnership con biblioteche; non c'è un paywall né un livello premium che nasconde la roba buona.
Con che frequenza il Wayback Machine scansiona un sito web?
Dipende dalla rilevanza del sito e da quanto spesso cambia. Le pagine di notizie importanti possono essere catturate molte volte al giorno. Un sito di una piccola impresa potrebbe vedere una manciata di catture all'anno. Puoi forzare una cattura in qualsiasi momento con Save Page Now.
Posso scaricare l'intero mio sito da Internet Archive Way Back Machine?
Non tramite il Wayback Machine stesso, è un visualizzatore senza esportazione in blocco. Per riavere un intero sito come file, utilizza un servizio di ripristino come Restorix, che estrae le pagine archiviate, le immagini e le risorse e le reimpacchetta per l'hosting.
Perché mancano immagini o stili nei vecchi snapshot?
Le risorse vengono scansionate separatamente dall'HTML, spesso in momenti diversi, e alcune sono state bloccate da regole dei robot o servite da domini successivamente scomparsi. Il documento della pagina è sopravvissuto; il foglio di stile no. Ecco perché le vecchie catture spesso vengono visualizzate come testo nudo, non stilizzato.
Posso far rimuovere il mio sito dal Wayback Machine?
Sì. L'Internet Archive onora le richieste di esclusione dai proprietari dei siti, contattali e chiedi che il dominio venga escluso, e una politica robots.txt rigorosa influisce sulle scansioni future. Le catture di altri siti che ti citano o collegano rimarranno.
Guide correlate

wayback machine
Wayback Machine: la guida completa alla storia del web
Il Wayback Machine archivia oltre 900 miliardi di pagine web. Scopri come funzionano le scansioni, le istantanee, il calendario e la sintassi di ricerca, e come ripristinare un sito perso.

wayback machine archive org
Wayback Machine su Archive.org: una guida pratica al sito
Un tour pratico della Wayback Machine su Archive.org: dove si trova, come funzionano realmente la casella di ricerca e il calendario, e come andarsene con file reali.

restore website from wayback machine
Ripristinare un sito web dalla Wayback Machine: guida completa
Ripristina un sito web dalla Wayback Machine dall'inizio alla fine: scegli lo snapshot giusto, imposta le opzioni di ripristino e distribuisci un sito funzionante con un CMS in meno di un'ora.

website history
Cronologia di un sito web: snapshot, WHOIS, DNS e gli strumenti per ciascuno
La cronologia di un sito può significare snapshot archiviati, record WHOIS, modifiche DNS o vecchie posizioni in SERP. Scopri quale strumento risponde a quale domanda, e come ricostruire un sito perduto.
