Scarica un intero sito web da Archive.org, non solo la homepage
A cura di la redazione di Restorix · 15 luglio 2026 · 7 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Chiunque può salvare una homepage. La homepage è la parte facile, sono le 4.000 risorse che stanno dietro a separare 'ho preso una copia' da 'ho davvero il sito'.
Questo articolo riguarda la parola 'intero'. Cosa include realmente una copia completa, perché l'archivio disperde le risorse su anni di timestamp diversi e una checklist da eseguire alla fine per dimostrare di aver ottenuto tutto, invece di sperarlo.
Cosa significa 'intero' quando scarichi un intero sito web da archive.org
Una copia completa ha quattro livelli, e la maggior parte delle persone si ferma al primo. L'HTML di ogni pagina esistita. Le risorse a cui ogni pagina fa riferimento: immagini, fogli di stile, JavaScript, font, PDF, video. I link interni riscritti in modo che la copia navighi autonomamente, senza appoggiarsi ai server di archive.org. E un manifesto di ciò che è stato catturato, così le lacune sono documentate invece che scoperte in seguito da un cliente.
- Pagine: ogni URL che il crawler ha mai visto, non solo quelli nel menu principale. I vecchi siti nascondono intere sezioni dietro link dimenticati nel footer.
- Risorse: immagini, CSS, JS, font e file scaricabili, nella maggior parte dei siti superano le pagine in rapporto di cinque a uno.
- Link: riscritti con percorsi relativi, altrimenti la tua copia funziona solo finché funziona archive.org.
- Un manifesto: un elenco file per file di ciò che hai, che trasforma 'penso di aver preso tutto' in qualcosa di verificabile.
Il numero di file sorprende. Un modesto sito aziendale di 50 pagine totalizza abitualmente 400-800 file. Un forum phpBB del 2009 con avatar e allegati può arrivare a decine di migliaia. Pianifica in base al numero di file, non di pagine.
C'è anche una differenza tra una copia che si naviga e una copia che si ridistribuisce. Una copia da navigazione ha solo bisogno dei file e di link funzionanti. Una copia che intendi rimettere su hosting richiede di più: URL canonici coerenti (scegli www o non-www), riferimenti pronti per HTTPS e peso morto come script di analytics vecchi di un decennio eliminati. Decidi quale delle due stai costruendo prima di iniziare, perché adattare in seguito è noioso.
Perché le risorse vivono sotto timestamp diversi
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
La Wayback Machine non fotografa un intero sito in un pomeriggio. I suoi crawler recuperano ciò che riescono a raggiungere, quando capita che lo raggiungano. La tua homepage del 2014 potrebbe fare riferimento a un logo catturato l'ultima volta nel 2012, a un foglio di stile catturato sei volte in cinque anni e a un'immagine hero mai catturata. Quando visualizzi quella pagina, archive.org sostituisce silenziosamente la cattura più vicina che possiede per ogni risorsa. Ecco perché la pagina appare corretta nel tuo browser anche se le sue parti sono sparse in un decennio.
Ne derivano due conseguenze. Primo, non esiste un unico 'timestamp del sito' a cui puntare un downloader, un download completo preleva ogni file dalla sua migliore cattura. Secondo, il trucco della cattura più vicina nasconde le lacune: wayback servirà tranquillamente un'immagine del 2016 nella tua pagina del 2014 senza dirlo. Innocuo per la navigazione occasionale, ma da sapere se ti interessa che la pagina ripristinata sia davvero quella del 2014.
Una pagina archiviata è un collage. L'HTML, le immagini e i CSS sono stati congelati in momenti diversi, e l'archivio li incolla di nuovo insieme ogni volta che qualcuno guarda.

Qualsiasi strumento o script tu usi ha bisogno di una strategia per questo. La strategia pigra, recuperare tutto a un unico timestamp, è esattamente come si finisce con una pagina piena di icone di immagini rotte, perché metà delle risorse semplicemente non ha una cattura in quella settimana. La strategia giusta è per-file: prendi ogni risorsa dalla sua migliore cattura più vicina all'interno del tuo intervallo di date.
Come scaricare un intero sito web da archive.org: inizia con l'inventario
Prima di recuperare un singolo file, elenca ciò che l'archivio contiene realmente. L'API CDX ti fornisce il registro completo per un dominio: ogni URL catturato con i suoi timestamp, tipo MIME e stato HTTP. Filtra per statuscode 200, comprimi i digest di contenuti duplicati e avrai una lista della spesa realistica invece di un'ipotesi.
Leggi l'inventario prima di scaricare e impari presto le cose scomode. In quel lavoro sul forum phpBB, l'elenco CDX mostrava 11.000 URL catturati, e circa 3.000 di essi erano la stessa GIF avatar salvata con diverse stringhe di query. Comprimere i duplicati ha trasformato un lavoro spaventoso in uno ordinario. Lo stesso elenco espone anche le pagine che non sono mai state catturate, che nessun metodo di download al mondo può far riapparire. Meglio saperlo dal primo giorno.
Raggruppa i sopravvissuti per tipo MIME e la forma del lavoro appare: quante pagine HTML, quante immagini, quanto JavaScript, se ci sono PDF o video di cui preoccuparsi. Quel raggruppamento guida sia l'ordine di download che il controllo finale di completezza.
Checklist per scaricare un intero sito web da archive.org senza lacune
- Recupera l'inventario CDX per il dominio, filtrato per catture HTTP 200, coprendo l'intero intervallo di date.
- Comprimi i digest di contenuti duplicati in modo che i file identici vengano scaricati una volta invece di centinaia.
- Raggruppa l'elenco per tipo MIME: prima le pagine HTML, poi CSS, JS, immagini, font, documenti, media.
- Scarica ogni file dalla sua migliore cattura, usando il modificatore id_ per ottenere i byte originali senza il markup iniettato da wayback.
- Riscrivi i link interni con percorsi relativi in modo che la copia funzioni su qualsiasi host, incluso il tuo laptop.
- Servi la cartella localmente e navigala. Link rotti, immagini mancanti e 404 dei font compaiono in pochi minuti.
- Confronta il conteggio finale dei file con l'inventario e annota cosa manca e perché.

Quell'ultimo passaggio è quello che tutti saltano, ed è la differenza tra un backup e un mucchio di file. Un manifesto trasforma 'penso di aver preso tutto' in un elenco che puoi verificare. il servizio lo integra: la stima gratuita riporta il numero esatto di file archiviati e la dimensione totale prima di iniziare, e il ripristino può esportare un manifesto JSON o SQLite di ogni file recuperato, così la completezza è un numero, non una sensazione.
Le lacune che incontrerai comunque
- Pagine che il crawler non ha mai trovato. Se nulla sul web pubblico collegava a una pagina, wayback probabilmente non l'ha mai vista.
- Esclusioni da robots.txt. Le scansioni più vecchie saltavano completamente i percorsi non consentiti, e alcuni siti bloccavano l'archiviazione di proposito.
- Contenuti renderizzati con JavaScript. Storicamente i crawler memorizzavano il guscio HTML, non ciò che gli script costruivano dopo.
- Accessi, carrelli e risultati di ricerca. Qualsiasi cosa dietro una richiesta POST o una sessione è un muro che il crawler non poteva superare.
- Rumore negli URL. ID di sessione e parametri di tracciamento gonfiano l'inventario con migliaia di 'pagine' duplicate che si riducono a poche reali dopo la deduplica.
Nessuno di questi è un fallimento del tuo metodo, sono buchi nell'archivio stesso. Il valore dell'inventario è che ti mostra i buchi prima di promettere a qualcuno un ripristino completo.
Quando trovi dei buchi, documentali. Una nota di una pagina che elenca le dodici pagine mai catturate, il video che esiste solo come miniatura e la sezione del forum bloccata da robots.txt trasforma una sorpresa imbarazzante in un'aspettativa gestita. I clienti perdonano i file mancanti. Non perdonano di scoprirli da soli.
Quanto vale una copia completa
Se il sito è il negozio di un cliente o un forum di comunità con un decennio di post, un download parziale è una responsabilità travestita da backup. O metti in conto le ore per eseguire la checklist da solo, o affidi la scansione, la corrispondenza dei timestamp, la riscrittura dei link e la creazione del manifesto a uno strumento costruito appositamente per questo lavoro. La stima non costa nulla, e l'alternativa è trovare le 300 immagini mancanti dopo che il sito è andato online.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
Posso scaricare un intero sito web da archive.org con un clic?
Archive.org stesso non offre un'esportazione dell'intero sito, è costruito per navigare singole catture. I risultati con un clic provengono da strumenti che enumerano l'indice dell'archivio e recuperano ogni file: script come wayback-machine-downloader, o servizi di ripristino come Restorix che gestiscono anche risorse, riscrittura dei link e il manifesto.
Perché mancano le immagini dopo aver scaricato un intero sito web da archive.org?
Di solito per uno di due motivi. O l'immagine non è mai stata scansionata, quindi non esiste alcuna copia da nessuna parte, oppure il tuo strumento ha recuperato la pagina da un timestamp mentre l'unica cattura sopravvissuta dell'immagine si trova sotto un altro. La corrispondenza delle risorse tra timestamp risolve il secondo caso; niente risolve il primo.
La Wayback Machine archivia ogni pagina di un sito web?
No. Archivia ciò che i suoi crawler potevano raggiungere: pagine collegate da qualche parte, consentite da robots.txt, renderizzate senza accessi o JavaScript pesante. Discussioni profonde dei forum, pagine di ricerca con filtri e aree di amministrazione sono abitualmente assenti. L'inventario CDX mostra esattamente ciò che esiste prima di iniziare.
Quanti file comporta di solito il download completo di un sito web?
Più di quanto la gente si aspetti. Un modesto sito aziendale di 50 pagine totalizza spesso 400-800 file una volta contate immagini, fogli di stile, script e font. Forum e negozi arrivano a decine di migliaia. È il numero di file, non di pagine, a determinare tempi e costi di download.
PDF, video e altri download sono inclusi nell'archivio?
Spesso sì. L'archivio memorizza documenti e media che poteva raggiungere, e l'indice CDX li elenca per tipo MIME insieme alle pagine. I video di grandi dimensioni sono l'eccezione, sono stati scansionati in modo incoerente, quindi verificali nell'inventario invece di presumere che siano sopravvissuti.
Guide correlate

download a website from archive org
Come scaricare un sito web da Archive.org: 3 metodi che funzionano
Tre metodi comprovati per scaricare un sito web da archive.org: salvare le pagine a mano, usare l'API CDX con uno script o eseguire un ripristino automatico. Tempi realistici per ciascun metodo.

archive.org download website
Strumenti per scaricare siti web da Archive.org: un confronto onesto
Un confronto onesto sugli strumenti per scaricare siti web da archive.org: HTTrack, gli script wayback-machine-downloader e Restorix. Costi reali, sforzo e gestione delle risorse.

find all pages on a website
Come trovare tutte le pagine di un sito web (anche quelle eliminate)
Hai bisogno di trovare tutte le pagine di un sito web, comprese quelle a cui nessun link punta? Confronta sitemap, crawler, l'API CDX del Wayback Machine ed export di Search Console.

wayback download
Download da Wayback: Ogni metodo classificato per impegno
Ogni metodo di download da Wayback classificato per impegno: singole pagine, script wget, API CDX e servizi automatizzati che ricostruiscono l'intero sito per te.
