Wayback Machine vs Google: Trovare le pagine scomparse dopo la Cache
A cura di la redazione di Restorix · 11 maggio 2026 · 8 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Per vent'anni, il modo più veloce per vedere una pagina appena andata offline era il link Cached di Google. A febbraio 2024 Google lo ha rimosso, e a settembre anche l'operatore di ricerca cache: ha smesso di funzionare. Quello stesso anno, Google ha fatto qualcosa di inaspettato: ha iniziato a linkare la Wayback Machine dell'Internet Archive dal suo pannello About this result. Il messaggio era chiaro: Google è un indice live, non un archivio, e ha smesso di fingere il contrario.
Ma i due strumenti funzionano ancora meglio insieme. Ecco come li combino quando una pagina o un intero sito scompare, inclusi i trucchi con gli operatori che sono sopravvissuti alla pulizia.
Wayback Machine vs Google: due tipi diversi di memoria
Google mantiene un indice del web live. Ricrawl costantemente, riscrive le classifiche ogni ora, e il suo scopo principale è rispondere con ciò che è vero in questo momento. Quando una pagina cambia, la vecchia versione viene scartata al crawl successivo. Quando la pagina scompare, la voce indugia brevemente e poi sparisce.
La Wayback Machine fa l'opposto. È una libreria in sola aggiunta di catture che risalgono al 1996, più di 900 miliardi di pagine. Non le importa cosa sia rilevante questa settimana; le importa cosa dicesse la pagina il 12 marzo 2014, e ti mostrerà esattamente quella versione, chrome e tutto.
Quindi gli strumenti rispondono a domande diverse. Google: cosa c'è su questa pagina adesso? Wayback: cosa diceva questa pagina un tempo? La confusione tra i due è il motivo per cui molti pensano che il web abbia una memoria che in realtà non ha.
Cosa è successo a Google Cache
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Per due decenni, ogni risultato di Google nascondeva un link Cached, un'istantanea della pagina come Googlebot l'aveva vista l'ultima volta. Era la soluzione standard quando una pagina dava 404 cinque minuti prima di una riunione. A febbraio 2024, il Search Liaison di Google Danny Sullivan ha annunciato che il link sarebbe stato ritirato, sostenendo che l'affidabilità delle pagine era migliorata e l'utilizzo era calato. A settembre 2024 l'operatore di ricerca cache: ha smesso di funzionare del tutto.
Due cose contano riguardo ai tempi. Primo, la cache non è mai stata un archivio: conteneva esattamente una versione, quella del crawl più recente, e la sovrascriveva costantemente. Perderla ci è costata il caso d'uso "eliminata stamattina", non nulla di storico. Secondo, lo stesso mese in cui la cache è morta, Google ha aggiunto link alla Wayback Machine dentro il suo pannello About this result. Clicca sui tre puntini accanto a qualsiasi risultato, scegli More about this page, e Google ti passa alle catture dell'Internet Archive. Google ha ufficialmente indirizzato i suoi utenti allo strumento che fa davvero il lavoro.

Per rimozioni molto recenti le opzioni ora sono più limitate: la Wayback crawl le pagine popolari spesso, archive.today salva le pagine on demand, e i snippet di Google stessi indugiano nei risultati per giorni dopo la morte di una pagina. Di solito basta. A malapena.
Usare Google per cercare nell'indice della Wayback Machine
La Wayback Machine ha una ricerca full-text in beta, ma è incoerente. La soluzione di cui nessuno parla: Google indicizza una porzione di web.archive.org stesso, e Google è molto bravo nella ricerca.
Il pattern è semplice: site:web.archive.org/web più un dominio, un titolo, o, meglio ancora, una frase che ricordi alla lettera. Cercare site:web.archive.org "we regret to inform you" insieme a un nome di brand fa emergere avvisi di discontinuazione archiviati che la ricerca interna della Wayback non troverà. Comunicati stampa archiviati, post di scuse eliminati, vecchia documentazione: tutto gioco lecito.
Imposta le aspettative correttamente. Google ha indicizzato solo una frazione delle catture dell'archivio, la maggior parte di quei 900 miliardi di pagine gli è invisibile. Una ricerca con zero risultati non prova nulla; significa non nella porzione di archivio di Google, non non archiviato. Tratta Google come livello di scoperta e il calendario interno della Wayback come fonte di verità.
Trucchi con l'operatore site: per Google e la Wayback Machine
Queste sono le query che eseguo davvero, più o meno in ordine:
- site:example.com, l'inventario più veloce di ciò che Google sa ancora di un sito in via di sparizione. Gli snippet indugiano per giorni o settimane dopo che le pagine stesse danno 404.
- site:example.com inurl:blog (o /products/, /docs/), divide un grande dominio in sezioni così puoi verificare la copertura per area.
- site:example.com filetype:pdf, vecchi whitepaper, manuali e schede tecniche. Ogni URL di PDF morto va dritto nella barra della Wayback.
- "frase esatta dalla pagina eliminata", le ricerche tra virgolette trovano copie di scraper, citazioni nei forum e mirror. Più la frase è distintiva, meglio è.
- before:2019-01-01, gli operatori before: e after: orientano i risultati verso l'epoca che ti interessa.
- site:web.archive.org/web "example.com", salta direttamente alle catture che Google ha indicizzato.
Una volta che hai un URL, due scorciatoie fanno risparmiare tempo reale. Incollalo nella Wayback con web.archive.org/web/2/ seguito dall'indirizzo, il 2 reindirizza alla cattura più vicina nel tempo. Oppure usa l'API di disponibilità: archive.org/wayback/available?url=example.com/old-page restituisce l'istantanea più vicina come JSON pulito, che è esattamente ciò che vuoi dentro gli script.
Quando vince Google e quando vince la Wayback Machine
Una rapida tabella decisionale:
| Attività | Strumento migliore | Perché |
|---|---|---|
| Una pagina eliminata stamattina | Snippet di Google più archive.today | La Wayback potrebbe non averla crawlate di recente |
| Una pagina del 2009 | Wayback Machine | Google ha eliminato la voce anni fa |
| Ricordi una frase ma non l'URL | La ricerca full-text batte la navigazione dei calendari | |
| Esplorare un intero sito com'era | Wayback Machine | Le catture mantengono navigazione e layout intatti |
| Elencare ogni URL che un sito abbia mai servito | Wayback CDX API | Google limita i risultati site: a poche centinaia |
| Verificare il testo esatto di una pagina dell'anno scorso | Wayback Machine | Una cattura per crawl, con timestamp |

In sintesi: Google trova gli aghi; la Wayback immagazzina i pagliai. Se ti serve l'inventario completo degli URL anziché una singola pagina, il percorso CDX è trattato passo passo nella guida a trovare tutte le pagine di un sito web.
Un esempio pratico: a caccia di una pagina prodotto morta del 2012
Scenario reale della primavera scorsa. Il negozio WooCommerce di un cliente aveva sostituito il vecchio sito Joomla anni prima; un rivenditore aveva bisogno della scheda tecnica di un componente fuori produzione, e i backup del cliente erano, a loro dire, da qualche parte su un disco.
- Eseguito site:clientdomain.com filetype:pdf e site:clientdomain.com inurl:products. Il sito live non aveva nulla, ma uno snippet residuo ha rivelato il vecchio pattern URL di Joomla, index.php con un ID articolo.
- Incollato il dominio nella Wayback Machine e saltato alle catture del 2012 usando lo sparkline del calendario.
- Sceso dalla cattura della homepage alla sezione prodotti. La prima cattura aveva immagini rotte; una cattura di quattro mesi dopo era completa, con il PDF linkato e attivo.
- Verificato su archive.today le poche pagine che la Wayback aveva perso.
Tempo totale: circa dieci minuti. Senza i trucchi con gli operatori è una serata di vicoli ciechi. Le mosse sono semplici; sapere quale strumento risponde a quale domanda è tutta la competenza necessaria.
Un dettaglio che vale la pena ricordare da quel lavoro: le immagini rotte nella prima cattura non erano perse, solo asincrone. La Wayback crawl le pagine e i loro asset in momenti diversi, quindi una pagina catturata a marzo potrebbe riferirsi a immagini catturate a giugno. Quando una cattura sembra mezzo vuota, non arrenderti, salta avanti o indietro di qualche mese e i pezzi mancanti di solito si riempiono. Gli snippet di Google soffrono della stessa sfasatura di aggiornamento, motivo per cui uno snippet può citare un paragrafo che la pagina attuale non contiene più.
Dalle pagine trovate a un sito web funzionante di nuovo
Trovare le pagine è la parte divertente. Ricostruire un sito dalle catture non lo è: tasto destro salva con nome, rinominare gli asset, riparare i percorsi, e alla pagina quaranta scopri che il stylesheet si trova in una data di cattura diversa. Ho visto gente sprecare un weekend su un sito di quindici pagine.
È il problema che Restorix automatizza. La stima gratuita legge l'indice CDX della Wayback e ti dice l'esatto numero di file archiviati, la dimensione totale e un prezzo bloccato prima di pagare qualsiasi cosa. I ripristini sono pay-per-file con il primo file gratuito, puoi rimuovere il codice analytics e pubblicitario dell'epoca, e il sito ricostruito viene deployato sul tuo hosting con un clic, o esportato come dati strutturati se preferisci self-host. Quando Google e la Wayback Machine ti hanno mostrato cosa esisteva, questo è il modo per riaverlo indietro.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
Google ha ancora una funzione di pagina cache?
No. Google ha rimosso il link Cached dai risultati a febbraio 2024 e ha disattivato l'operatore di ricerca cache: più tardi nello stesso anno. Le alternative sono la Wayback Machine per qualsiasi cosa storica e archive.today per istantanee on demand di pagine live.
Posso cercare nella Wayback Machine tramite Google?
Sì, usa site:web.archive.org con un dominio o una frase tra virgolette. Google indicizza solo una frazione delle catture dell'archivio, quindi tratta i risultati vuoti come non indicizzati da Google, mai come prova che una cattura non esista. Controlla il calendario interno della Wayback per esserne sicuro.
Come vedo le vecchie versioni di una pagina direttamente dai risultati di Google?
Clicca sui tre puntini accanto a qualsiasi risultato e apri About this result, poi More about this page. Da settembre 2024, Google linka direttamente le catture della Wayback Machine dell'Internet Archive per quell'URL da questo pannello.
Perché l'operatore site: non mostra ogni pagina di un sito web?
L'operatore site: restituisce un campione, non un dump del database, Google in genere limita i risultati visibili a poche centinaia e mostra solo ciò che ha indicizzato. Per un inventario completo degli URL, combina la sitemap del sito con la Wayback CDX API.
Cosa ha sostituito l'operatore cache:?
Niente di ufficiale da Google. L'equivalente programmatico più vicino è la Wayback availability API (archive.org/wayback/available?url=...), che restituisce la cattura più vicina di qualsiasi URL come JSON e funziona bene dentro gli script.
Quanto spesso la Wayback Machine crawl una pagina?
Dipende dalla rilevanza della pagina e dai link in ingresso. Le homepage dei grandi quotidiani vengono catturate molte volte al giorno; una pagina oscura potrebbe essere crawlate una volta all'anno o mai. Puoi forzare una cattura in qualsiasi momento con il box Save Page Now su web.archive.org.
Guide correlate

web cache
Web Cache spiegata: come funzionano le cache e come usarle
Cos'è una web cache, come funzionano le cache di browser, CDN, motori di ricerca e archivi, e come usare una web cache per visualizzare una pagina scomparsa.

wayback machine
Wayback Machine: la guida completa alla storia del web
Il Wayback Machine archivia oltre 900 miliardi di pagine web. Scopri come funzionano le scansioni, le istantanee, il calendario e la sintassi di ricerca, e come ripristinare un sito perso.

find all pages on a website
Come trovare tutte le pagine di un sito web (anche quelle eliminate)
Hai bisogno di trovare tutte le pagine di un sito web, comprese quelle a cui nessun link punta? Confronta sitemap, crawler, l'API CDX del Wayback Machine ed export di Search Console.

search website history
Come cercare la cronologia di un sito web prima di acquistare un dominio
Cerca la cronologia di un sito web prima di acquistare un dominio: vecchie istantanee, passaggi di proprietà, problemi di spam e tranelli legati a marchi: un flusso di lavoro di due diligence in 30 minuti.
