Download da Wayback: Ogni metodo classificato per impegno
A cura di la redazione di Restorix · 3 maggio 2026 · 8 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Il sito è sparito. L'host lo ha cancellato, i backup sono tarball vuoti e l'unica copia rimasta sulla Terra si trova nella Wayback Machine. Ora hai bisogno di un download da Wayback che funzioni davvero, e ci sono quattro modi per ottenerlo. Vanno da un trucco di due minuti nel browser a un servizio che fa tutto per te, e il divario di impegno tra loro è enorme. Ecco ogni metodo, classificato in base a quanto ti costa in ore, con le modalità di fallimento che nessuno menziona nelle landing page.
Cosa ottiene davvero un download da Wayback
La Wayback Machine non archivia il tuo sito. Archivia le risposte: un URL, una scansione, un momento nel tempo. La tua homepage potrebbe avere 10.000 catture mentre la tua privacy policy ne ha due, del 2014 e 2019. Un download da Wayback significa recuperare quelle risposte archiviate un URL alla volta e assemblarle in qualcosa che assomiglia all'originale.
Ne derivano due conseguenze. Primo, tutto ciò che il crawler non ha mai visto è perso per sempre: nessun database, nessun codice PHP, nessun pannello di amministrazione, niente dietro un login. Secondo, ogni file che estrai è congelato a un momento di scansione che non hai scelto. Mescola un foglio di stile del 2016 con una homepage del 2021 e il sito sembrerà un messaggio di riscatto, perché è esattamente ciò che hai assemblato.
La vista calendario su qualsiasi pagina di snapshot rende tutto ciò visibile. I cerchi blu indicano le scansioni, e gli intervalli tra loro possono durare anni per le pagine impopolari. Quindi, prima di scegliere un metodo, scegli una data target: l'anno in cui il sito aveva l'aspetto che desideri. Ogni decisione successiva, quali catture recuperare, quali asset considerare affidabili, diventa più facile.

Metodo 1: Salvare una singola pagina nel browser
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Apri lo snapshot, premi Ctrl+S, scegli Pagina web, completa. Fatto. Per una singola pagina questo è il download da Wayback più veloce in assoluto. Per più di dieci pagine diventa una forma di auto-tortura, quindi sapere quando fermarsi. Se il browser rovina qualcosa, apri gli strumenti per sviluppatori, trova gli URL degli asset nella scheda di rete e salva quei file singolarmente.
- Usa il trucco di id_: inserisci id_ dopo il timestamp nell'URL dello snapshot per ottenere l'HTML originale esattamente come è stato catturato, senza la barra degli strumenti di Wayback e i link riscritti incorporati.
- Le pagine salvate creano hotlink dei loro asset verso web.archive.org. Apri il file offline e metà delle immagini scomparirà a meno che tu non le abbia salvate esplicitamente.
- Controlla la data di cattura nella vista calendario prima di salvare. Prendere l'anno sbagliato è l'errore da principiante più comune, e l'archivio raramente ti avvisa.
Metodo 2: Uno script wget per il download da Wayback
La mossa classica è wget in modalità mirror puntato a un URL archiviato: wget --mirror --page-requisites --convert-links https://web.archive.org/web/2019/https://example.com. wget segue i link riscritti che Wayback inserisce, il che ti mantiene dentro l'archivio, e --page-requisites recupera i CSS, JavaScript e le immagini necessari a ogni pagina.
Per un sito brochure di 40 pagine può finire in una sera. Prevedi di passare quella sera a fargli da babysitter. archive.org limita i client troppo aggressivi, quindi aggiungi --wait=2 tra le richieste e aspettati di dover rieseguire il comando alcune volte quando si blocca. Una regex --reject che mantiene wget vicino al tuo timestamp target impedisce che vaghi di lato attraverso vent'anni di catture.
Quello che ottieni è una directory di HTML che porta ancora la barra degli strumenti di Wayback, timestamp all'interno di ogni URL di asset e buchi silenziosi ovunque il crawler abbia perso un file. Trasformare quel mucchio in un sito distribuibile è un secondo progetto, ed è la parte che le persone dimenticano di pianificare.
Metodo 3: Scripting tramite l'API CDX
Quando la scansione cieca non è sufficiente, vai alla fonte. L'API CDX restituisce un elenco leggibile dalle macchine di ogni cattura per un URL o dominio: web.archive.org/cdx/search/cdx?url=example.com/*&output=json&filter=statuscode:200&collapse=urlkey. Quella singola richiesta è già più utile di un'ora di wget, perché ti dice cosa esiste prima di scaricare qualsiasi cosa.
Il ciclo è semplice in Python o Node: leggi l'elenco, recupera ogni cattura con il suffisso id_, salva su disco, fai una pausa educata tra le richieste. La potenza sta nei filtri. Limita per anno o tipo MIME, e usa collapse=digest per scartare le catture duplicate in modo da recuperare ogni file unico una sola volta invece di quaranta.
Questo è il metodo che uso per lavori forensi, come estrarre ogni PDF che un'azienda abbia mai pubblicato o ricostruire una directory a una data specifica. È anche un vero e proprio progetto di programmazione: uno script accurato per un sito di medie dimensioni richiede un fine settimana di scrittura, test e riesecuzioni dopo che la connessione cade alle 2 del mattino.

Metodo 4: Servizi di ripristino automatizzati
La quarta opzione è saltare del tutto il lavoro manuale. I servizi creati per questo compito interrogano l'archivio, scaricano ogni file catturato, rimuovono il chrome di Wayback, riparano i link interni e ti consegnano un sito funzionante invece di una cartella di frammenti.
Restorix è quello a cui indirizzo i clienti. La stima gratuita da sola vale il clic: prima di pagare qualsiasi cosa, mostra l'esatto conteggio dei file archiviati, la dimensione totale e un prezzo bloccato. I ripristini sono a pagamento per file con il primo file gratuito, e se un ripristino o un deploy fallisce, il rimborso viene accreditato automaticamente sul tuo saldo. Nessun ticket, nessuna discussione con il supporto.
Rispetto alle soluzioni fai-da-te, lo scambio è netto: una piccola tariffa fissa in cambio del tuo fine settimana, dei tuoi mal di testa per i limiti di velocità e del tuo script di pulizia. Negli ultimi tre lavori che ho valutato, la tariffa è risultata inferiore a quanto sarebbero costate due ore fatturabili al cliente.
Gli errori che rovinano un download da Wayback
- Ignorare le query string. /page.php?id=12 e /page.php?id=13 sono catture diverse di pagine diverse. Salterle e metà di un blog WordPress o di un forum phpBB scomparirà.
- Mescolare i timestamp ciecamente. Una homepage del 2018 renderizzata con CSS del 2013 sembra una fotocopia rotta. Scegli una data target e mantieniti entro pochi mesi da essa.
- Dimenticare altri host. Le immagini su cdn.example.com o assets.example.net sono catture separate con prefissi URL separati, e una query solo sul sito non le rileverà mai.
- Fidarsi della vecchia copertura. L'archivio ha rispettato le esclusioni di robots.txt per anni, quindi intere sezioni di alcuni siti non sono mai state catturate.
- Dare per scontato che la cattura più recente sia la migliore. Successivo non è sempre migliore. Un sito catturato dopo essere stato hackerato, parcheggiato o reindirizzato vale meno di uno snapshot sano di due anni prima.
- Salvare HTML riscritto. Senza il suffisso id_ incorpori la barra degli strumenti di Wayback e i link a archive.org in ogni pagina, e qualcuno dovrà rimuoverli in seguito.
Scegliere il metodo giusto per il tuo sito
| Metodo | Impegno pratico | Costo | Ideale per | Fallisce quando |
|---|---|---|---|---|
| Salvataggio dal browser | Minuti per pagina | Gratuito | 1-10 pagine | Ti servono 200 pagine |
| Script wget | Una sera | Gratuito | Siti statici piccoli | Asset mancanti, limitazioni |
| Script API CDX | Un fine settimana o più | Gratuito | Estrazioni filtrate precise | Non scrivi codice |
| Servizio automatizzato | Minuti in totale | Piccola tariffa fissa | Rimettere il sito online | Ti piace soffrire |
Uno scenario realistico: il sito marketing di 300 pagine di un cliente muore senza backup. Il metodo uno ti costa 300 salvataggi manuali, chiamiamole dieci ore. Il metodo due costa una sera più un giorno di pulizia. Il metodo tre costa un fine settimana se sai già programmare. Il metodo quattro costa una tariffa fissa che conoscevi prima di iniziare, e il sito torna pulito, con i link ripristinati e pronto per il deploy. I conti matematici orari non sono sottili.
La mia regola dopo anni di lavori di ripristino: se il sito deve tornare a vivere, vai direttamente al metodo quattro, perché è esattamente per questo che Restorix è stato creato. Se ti serve una pagina come prova o per nostalgia, metodo uno. I due intermedi sono per chi ama il viaggio, non la destinazione.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
È legale effettuare un download da Wayback?
Scaricare pagine archiviate pubblicamente per recuperare il tuo sito o per riferimento personale è una pratica comune e generalmente a basso rischio. Ripubblicare in blocco i contenuti di qualcun altro è dove iniziano i problemi di copyright. Se il sito era tuo, sei su un terreno solido.
Posso scaricare un intero sito web dalla Wayback Machine gratuitamente?
Sì, con il tuo lavoro. Gli script wget e CDX non costano nulla se non tempo, e il costo nascosto è la pulizia: riscritture dei link di Wayback, asset mancanti, navigazione interrotta. I servizi a pagamento esistono proprio perché la pulizia è dove i download gratuiti si bloccano.
Cosa significa id_ in un URL di Wayback?
Aggiungere id_ dopo il timestamp dice all'archivio di servire il file originale esattamente come è stato catturato, senza la barra degli strumenti e senza riscrivere i link per puntare a web.archive.org. Per qualsiasi download serio è obbligatorio.
Perché mancano le immagini dal mio download?
Il crawler ha catturato l'HTML ma non ogni asset. Le immagini caricate pigramente, le immagini di sfondo CSS e qualsiasi cosa dietro JavaScript sono le solite vittime. Prova timestamp adiacenti; una scansione diversa della stessa pagina a volte ha il file.
Perché il mio script continua a ricevere errori 429 da archive.org?
È un limite di velocità. L'archivio limita i client che scaricano troppo velocemente. Scendi a una o due richieste simultanee, aggiungi un ritardo di uno o due secondi tra i download e riprendi invece di riavviare. Gli script educati finiscono; quelli aggressivi vengono bloccati.
Fino a quanto indietro può andare un download da Wayback?
Le scansioni pubbliche dell'archivio iniziano nel 1996. La copertura prima del 2005 circa è scarsa per i siti più piccoli, e molti URL di quell'epoca sopravvivono solo come HTML nudo senza immagini o fogli di stile.
Guide correlate

wayback machine downloader
Strumenti per scaricare dalla Wayback Machine: cosa funziona davvero
Uno sguardo onesto agli strumenti per scaricare dalla Wayback Machine: gli script open-source, i loro reali limiti e l'opzione chiavi in mano che rimette online il tuo sito.

wayback machine download site
Scaricare un intero sito dalla Wayback Machine
Come scaricare un intero sito dalla Wayback Machine: insidie del crawling, pagine con query string, asset mancanti e quando un ripristino automatizzato batte gli script fai-da-te.

download entire website from archive org
Scarica un intero sito web da Archive.org, non solo la homepage
Per scaricare un intero sito web da archive.org servono tutte le pagine, le immagini e i fogli di stile. Le risorse si nascondono sotto timestamp diversi, ecco perché, più una checklist completa.

wayback machine restore
Ripristino da Wayback Machine: 4 insidie e come evitarle
Un ripristino da Wayback Machine può fallire in silenzio: pagine parcheggiate, catene di redirect, immagini mancanti, timestamp incoerenti. Come riconoscere ogni insidia e evitarla.
