Come scaricare un sito web da Archive.org: 3 metodi che funzionano
A cura di la redazione di Restorix · 8 giugno 2026 · 7 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Il sito non c'è più. L'hosting è scaduto, il cliente non ha mai fatto un backup e l'unica copia rimasta si trova sulla Wayback Machine. Ho ricevuto quella telefonata più volte di quante riesca a contarne, e la prima domanda è sempre la stessa: si può scaricare un sito web da archive.org e rimetterlo online?
Sì, si può. Ci sono tre percorsi realistici: salvare le pagine a mano, scrivere uno script per l'indice CDX o affidarsi a un servizio di ripristino automatico che fa il lavoro al posto tuo. Il livello di impegno richiesto è molto diverso tra loro, e la scelta sbagliata ti costa un intero weekend. Ecco come funziona ciascun metodo, con tempi onesti derivati dall'esperienza diretta.
Cosa significa davvero scaricare dalla Wayback Machine
La Wayback Machine non è una cartella di siti web che puoi scaricare con un clic. È un immenso indice di singole catture: ogni pagina, immagine, foglio di stile e script è archiviato separatamente, ciascuno legato al momento in cui è stato acquisito. Quando visualizzi una vecchia pagina, il browser recupera l'HTML da una cattura e le immagini da diverse altre, assemblate al volo.
Scaricare un sito significa quindi enumerare centinaia o migliaia di file singoli, recuperare ciascuno e riscrivere i link interni in modo che la copia funzioni fuori da archive.org. Tieni a mente questo modello, spiega perché ogni metodo descritto sotto funziona così com'è, e perché nessuno di essi è un semplice pulsante di download.
Metodo 1: scaricare un sito web da archive.org pagina per pagina a mano
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
L'approccio più ingenuo, e a volte quello giusto. Apri lo snapshot nella Wayback Machine e salvi ogni pagina con il browser. Per un sito vetrina di cinque pagine, va benissimo. Per qualsiasi cosa più grande, è una lenta tortura.
- Apri la pagina archiviata alla data di snapshot desiderata.
- Usa Salva con nome e seleziona 'Pagina web, completa' per includere anche le risorse.
- Ripeti per ogni pagina, incluse quelle raggiungibili solo dai vecchi menu.
- Apri l'HTML salvato e rimuovi il markup della toolbar Wayback da ogni file.
- Correggi o accetta gli URL delle risorse, che puntano ancora a web.archive.org.
Ci sono due trappole. L'HTML salvato fa riferimento a web.archive.org per molte risorse, quindi la copia si rompe non appena la apri offline o l'archivio ha una giornata lenta. E il markup della toolbar incorporato in ogni pagina salvata va rimosso a mano, file per file. Uso ancora questo metodo per singole pagine, un cliente aveva bisogno solo della vecchia pagina dei prezzi per una controversia legale, e un salvataggio è durato due minuti. Il loro negozio di 300 pagine ha ricevuto un trattamento diverso.
- Impegno realistico: 5-10 minuti a pagina, pulizia delle risorse inclusa.
- Adatto a: fino a circa 10 pagine, o per recuperare una pagina specifica come riferimento.
- Inadatto per: decine di pagine, o qualsiasi lavoro in cui serve markup originale pulito.

Metodo 2: scaricare un sito web da archive.org con l'API CDX
L'API CDX è l'endpoint di indicizzazione della Wayback Machine, ed è il modo per trovare ogni file che archive.org possiede per un dominio. Una singola query restituisce il registro completo in formato JSON:
web.archive.org/cdx/search/cdx?url=example.com/*&output=json&fl=timestamp,original,mimetype,statuscode&filter=statuscode:200&collapse=digest
Questo restituisce timestamp, URL originali e tipi MIME per tutto ciò che è stato catturato. Il parametro collapse deduplica i file identici, così non scarichi lo stesso logo 400 volte. Da lì, un piccolo script scorre la lista e recupera ogni file. Aggiungi id_ a un URL con timestamp, come /web/20150312145531id_/http://example.com/style.css, e archive.org restituisce i byte originali senza il markup riscritto. Quel suffisso fa la differenza tra una copia pulita e una pagina piena di toolbar.
La parte noiosa è quella che ti ruba la serata. Archive.org limita i client troppo aggressivi, quindi lo script ha bisogno di pause educate e logica di retry, altrimenti passerai ore a fissare risposte 429. Gli URL con query string vanno deduplicati, o gli ID di sessione trasformano un sito di 200 pagine in un crawl di 9.000 file. E dopo che i file sono arrivati, i link interni puntano ancora al dominio originale, quindi serve un passaggio di riscrittura prima che la copia sia navigabile offline.
- Impegno realistico: 2-4 ore per scrivere e debuggare lo script se programmi regolarmente; un weekend se non lo fai. Il crawl in sé richiede 30-90 minuti per qualche centinaio di file.
- Adatto a: sviluppatori, archivisti, chiunque voglia il pieno controllo su ogni byte.
- Inadatto per: chi non ha mai aperto un terminale, e scadenze misurate in ore.

Qualsiasi cosa tu scripti, testa il risultato come farebbe un visitatore: servi la cartella con un qualsiasi web server locale e naviga. Percorsi immagini rotti, link che puntano al web live e font mancanti si manifestano entro cinque minuti di clic, ed è penale scoprirli dopo aver dichiarato il lavoro finito.
Metodo 3: scaricare un sito web da archive.org in modo automatico
Il terzo percorso affida a un servizio di ripristino il crawling, la corrispondenza delle risorse e la riscrittura dei link. È ciò che consiglio ai clienti quando il sito conta più dell'esperienza di apprendimento. Con la dashboard di ripristino incolli il dominio e ottieni un preventivo istantaneo gratuito: numero esatto di file archiviati, dimensione totale e prezzo bloccato prima di pagare. Scegli un intervallo di date, attivi le opzioni desiderate e la copia ripristinata arriva pronta da navigare, oppure viene distribuita direttamente sul tuo hosting via SSH, FTP o S3.
- Opzioni utili: link interni relativi, rimozione di vecchi analytics e pubblicità, minificazione di JS/CSS, conversione HTTPS, canonicalizzazione www o non-www.
- Il ripristino può esportare un manifest strutturato (JSON o SQLite) per sapere esattamente cosa è stato recuperato.
- I ripristini falliti vengono rimborsati automaticamente sul saldo, niente ticket di supporto.
Il contro è ovvio: costa denaro. Si paga per file ripristinato, il primo file è gratuito e il prezzo è bloccato al momento del preventivo. Per un blog personale magari preferisci scriptare. Per il negozio WooCommerce di un cliente che genera ricavi e deve tornare online stasera, la tariffa è in genere la voce meno costosa di tutto l'incidente. Le distribuzioni includono anche un piccolo CMS single-file, così le piccole correzioni di testo dopo il ripristino non richiedono di caricare nuovamente nulla.
Tempo e impegno, a confronto
| Metodo | Il tuo tempo | Competenza tecnica | Dimensione ideale |
|---|---|---|---|
| Salvataggio pagine a mano | 5-10 min a pagina | Nessuna | 1-10 pagine |
| Scripting API CDX | 3-6 ore totali | Pratico con il codice | 10-1.000 pagine |
| Ripristino automatico | Circa 15 minuti di clic | Nessuna | Qualsiasi dimensione, soprattutto 100+ pagine |
Nota che la tabella misura il tuo tempo, non quello della macchina. Uno script o un servizio possono elaborare un crawl lungo per ore, ma lo fanno mentre dormi. La risorsa scarsa in qualsiasi ripristino è la serata di chi lo esegue, ed è questo che valuto.
Errori che ti bruciano interi pomeriggi
- Fidarsi del salvataggio del browser per interi siti. Perderai ogni pagina che non hai aperto manualmente, e i vecchi siti nascondono pagine in posti che avevi dimenticato.
- Ignorare il modificatore id_, per poi chiedersi perché ogni file HTML ha il markup della toolbar Wayback incorporato.
- Martellare archive.org con richieste parallele. Vieni limitato, e un lavoro di un'ora diventa di quattro.
- Saltare il passaggio di riscrittura dei link. La copia sembra a posto finché non clicchi su qualcosa.
- Dare per scontato che ogni pagina sia stata archiviata. Controlla prima l'inventario CDX, così le lacune sono una quantità nota, non una sorpresa alla fine.
Quale metodo scegliere?
Meno di dieci pagine: salvale a mano e accetta le imperfezioni del markup. Scrivi codice e vuoi controllo: costruisci lo script CDX e metti in conto una serata. Ti serve il sito indietro, pulito, senza diventare un archivista part-time: scegli la via automatica, il tutorial ti guida attraverso un ripristino completo in pochi minuti, e il preventivo gratuito ti dice numero di file e prezzo prima di impegnarti.
Un'ultima cosa: qualsiasi percorso tu scelga, fallo ora. Archive.org è un dono, ma ha avuto interruzioni e pressioni legali in passato, e 'lo scarico dopo' è esattamente il modo in cui i siti si perdono due volte.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
È gratuito scaricare un sito web da archive.org?
L'archivio è gratuito da consultare, e il salvataggio manuale o lo scripting CDX costano solo il tuo tempo. I servizi di ripristino automatico applicano un costo per file ripristinato; Restorix mostra il prezzo bloccato esatto nel preventivo gratuito prima che tu paghi, e il primo file è gratuito.
È legale scaricare un sito web da archive.org?
Scaricare il proprio sito, o il sito di un cliente con permesso, è una pratica standard e costituisce la maggior parte dei ripristini. Per contenuti di terzi, una copia va bene per uso personale o ricerca, ma ripubblicare materiale coperto da copyright che non possiedi può causarti problemi. In caso di dubbio, chiedi a un avvocato, non a una sezione commenti.
Perché la mia pagina salvata carica ancora immagini da web.archive.org?
Perché la Wayback Machine riscrive gli URL delle risorse nell'HTML per farli puntare ai propri server, e il salvataggio del browser conserva quegli URL assoluti. Recuperare i file con il modificatore id_, o eseguire un passaggio di riscrittura dei link a posteriori, ti restituisce una copia autonoma.
Posso scaricare un sito web da archive.org senza scrivere codice?
Sì. Il salvataggio manuale con il browser non richiede codice, e i servizi di ripristino automatico gestiscono lo scripting al posto tuo. L'API CDX è l'unico percorso che richiede davvero programmazione.
Quanto tempo ci vuole per scaricare un sito web da archive.org?
Il salvataggio manuale richiede 5-10 minuti a pagina. Uno script CDX richiede qualche ora di configurazione, poi 30-90 minuti per il crawl di un sito di medie dimensioni. Un ripristino automatico richiede pochi minuti del tuo tempo; le macchine fanno l'attesa.
Guide correlate

download entire website from archive org
Scarica un intero sito web da Archive.org, non solo la homepage
Per scaricare un intero sito web da archive.org servono tutte le pagine, le immagini e i fogli di stile. Le risorse si nascondono sotto timestamp diversi, ecco perché, più una checklist completa.

archive.org download website
Strumenti per scaricare siti web da Archive.org: un confronto onesto
Un confronto onesto sugli strumenti per scaricare siti web da archive.org: HTTrack, gli script wayback-machine-downloader e Restorix. Costi reali, sforzo e gestione delle risorse.

wayback machine downloader
Strumenti per scaricare dalla Wayback Machine: cosa funziona davvero
Uno sguardo onesto agli strumenti per scaricare dalla Wayback Machine: gli script open-source, i loro reali limiti e l'opzione chiavi in mano che rimette online il tuo sito.

restore website from archive.org
Ripristinare un Sito Web da Archive.org: Fai-da-Te o Servizio Incluso?
Dovresti ripristinare un sito web da Archive.org da solo o pagare per un servizio incluso? Un confronto onesto su costi, tempo, competenze e rischi, più un framework decisionale.
