Strumenti per scaricare siti web da Archive.org: un confronto onesto
A cura di la redazione di Restorix · 7 luglio 2026 · 7 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Ci sono tre modi sensati per estrarre un sito dalla Wayback Machine, e li ho usati tutti su lavori reali: HTTrack, il gem Ruby wayback-machine-downloader e i suoi script correlati, e Restorix, il servizio a cui indirizzo i clienti quando il sito deve tornare funzionante, non solo come un mucchio di file.
Nessuno di essi è 'il migliore'. Risolvono problemi diversi a costi diversi, e il prezzo è pagato principalmente in ore piuttosto che in dollari. Ecco cosa fa realmente ciascuno, dove fallisce e chi dovrebbe scegliere cosa. Nessuna classifica affiliata, solo ciò che ho visto andare bene e male.
Cosa deve fare bene uno strumento per scaricare siti web da archive.org
Giudicare questi strumenti sulla velocità di download manca il punto. Le parti difficili di un lavoro di download da archive.org sono poco glamour, ed è lì che gli strumenti differiscono silenziosamente:
- Trovare ogni file. L'indice dell'archivio è l'unica fonte completa, seguire i link dalla homepage salta ogni pagina orfana.
- Abbinate le risorse tra i timestamp. La pagina del 2014 potrebbe necessitare del logo dalla sua unica cattura sopravvissuta nel 2012.
- Ottenere i byte originali. Se fatto con negligenza, salvi il markup della barra degli strumenti di Wayback incorporato in ogni file HTML.
- Riscrivere i link interni affinché la copia sia navigabile senza appoggiarsi ai server di archive.org.
- Sopravvivere al throttling. Archive.org limita i tassi dei clienti impazienti, e i tentativi devono essere cortesi e pazienti.
Tenete a mente questi cinque punti. Spiegano ogni riga nella tabella di confronto qui sotto, e la maggior parte delle recensioni negative che ricevono questi strumenti risale a uno di essi.
HTTrack: gratuito, vecchia scuola, e ancora attivo
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
HTTrack è il veterano: un browser offline gratuito e open-source che replica i siti dagli anni '90. Indicatelo a un URL della Wayback Machine e segue i link, salvando ciò che trova su disco. C'è un'interfaccia grafica per Windows, il prezzo è giusto, e per una replica rapida di un piccolo sito funziona davvero.
Usato contro archive.org, le cautele si accumulano. HTTrack non conosce l'indice dell'archivio, trova solo le pagine raggiungibili seguendo i link dal tuo URL iniziale, quindi le pagine orfane restano indietro. Prende qualunque cattura a cui reindirizza wayback, mescolando i timestamp senza avvisarti. E le sue regole di filtro richiedono una vera messa a punto: impostatele male e la vostra replica di un blog del 2013 si perde da un link sul web live, e scaricate il sito attuale. Chiedetemi come lo so.
Un benchmark realistico: replicare un blog WordPress del 2012 di 40 pagine tramite la Wayback Machine mi ha richiesto circa 40 minuti di configurazione e due ore di crawl non supervisionato, e ho comunque speso un'altra ora per pulire i riferimenti al web live dalla cartella. Questa è la forma onesta di un lavoro con HTTrack, economico, per lo più automatico, e mai del tutto finito quando il crawl termina.
- Costo: gratuito.
- Sforzo: un'ora o due per imparare la sintassi dei filtri; le repliche poi girano senza supervisione.
- Ideale per: repliche rapide di siti piccoli e ben collegati quando la fedeltà perfetta non è l'obiettivo.
- Attenzione a: perdersi sul web live, timestamp delle catture mescolati e gli URL riscritti da wayback che finiscono nei vostri file.

wayback-machine-downloader e la via degli script
wayback-machine-downloader è un gem Ruby che interroga l'indice CDX dell'archivio, poi scarica ogni file che elenca per il tuo dominio, opzionalmente entro un intervallo di date. Poiché legge l'indice invece di seguire i link, trova pagine che HTTrack non vede mai. Diversi script Python che girano su GitHub fanno lo stesso lavoro con flag diversi e livelli di cura differenti.
I compromessi sono i soliti dell'open-source. Hai bisogno di Ruby o Python installati e della sicurezza per leggere un README. I progetti in questa nicchia rimangono in silenzio per anni, quindi controlla il tracker delle issue prima di scommettere una scadenza su uno. E quando il crawl finisce, il lavoro di assemblaggio è tuo: i link interni puntano ancora al dominio originale, i timestamp delle catture necessitano di un controllo, e qualsiasi pulizia, rimuovere vecchi tag di analisi, correggere gli URL canonici, convertire in HTTPS, è il tuo pomeriggio di sabato.
- Costo: gratuito, più le tue ore.
- Sforzo: mezza giornata se sei a tuo agio in un terminale; il crawl stesso poi gira da solo.
- Ideale per: sviluppatori e archivisti che vogliono il controllo totale su ogni byte e godono ad averlo.
- Attenzione a: crawl rallentati senza logica di ripetizione, riscrittura dei link lasciata come compito a casa e lacune di manutenzione nel repository.
Due abitudini rendono la via degli script praticabile. Conserva la risposta CDX da cui sei partito, funge da manifesto quando qualcuno chiede cosa dovrebbe essere nella cartella. E servi il risultato localmente prima di considerarlo finito: cinque minuti a cliccare nella copia su localhost trova le risorse mancanti più velocemente di qualsiasi file di log.
Restorix: l'opzione fai-da-te per scaricare siti web da archive.org
Questo servizio di ripristino si trova all'estremità a pagamento e fai-da-te dello spettro, ed è costruito specificamente per i ripristini da archive.org piuttosto che per lo scraping generico. Inserisci il dominio e ottieni un preventivo gratuito istantaneo: numero esatto di file archiviati, dimensione totale e prezzo bloccato. Scegli un intervallo di date e le tue opzioni, link interni relativi, rimozione di analytics e pubblicità, conversione in HTTPS, minificazione di JS/CSS, canonizzazione www o non-www, e il servizio gestisce l'enumerazione dell'indice, l'abbinamento delle risorse tra i timestamp, il throttling e la riscrittura dei link.
Il risultato viene scaricato come una copia pulita e navigabile, o distribuita direttamente sul tuo hosting tramite SSH/SFTP, FTP/FTPS o S3, con un semplice CMS a file singolo incluso per modificare le pagine ripristinate in seguito. Paghi per file ripristinato, il primo file è gratuito, e i ripristini falliti vengono rimborsati automaticamente sul tuo saldo. Non c'è abbonamento, i ricariche sono una tantum, con carta o criptovaluta. Non è la via dell'hobbyista, e non cerca di esserlo.

Strumenti per scaricare siti web da archive.org, a confronto
| HTTrack | Script (gem / Python) | Restorix | |
|---|---|---|---|
| Prezzo | Gratuito | Gratuito | Paga per file, primo file gratuito |
| Trova pagine non collegate | No, segue solo i link | Sì, legge l'indice CDX | Sì, legge l'indice CDX |
| Abbinamento risorse tra i timestamp | No | Parziale | Sì |
| Byte originali senza markup della barra degli strumenti | No | Sì, con i flag corretti | Sì |
| Link interni riscritti | Parziale | Li riscrivi tu stesso | Sì, link relativi opzionali |
| Distribuisce sul tuo hosting | No | No | Sì, SSH, FTP, S3 |
| Sforzo tipico da parte tua | Ore di messa a punto dei filtri | Mezza giornata più assemblaggio | Circa 15 minuti |
| Ideale per | Repliche rapide e piccole | Sviluppatori che vogliono controllo | Rimettere il sito online |
Leggi due volte la riga dello sforzo. Ogni strumento in questa lista può produrre la stessa cartella di file alla fine, ciò che stai effettivamente scegliendo è chi fa il 20% del lavoro noioso: tu, o qualcos'altro.
Un'altra riga che la tabella non può contenere: il rischio. Con gli strumenti gratuiti, un lavoro rovinato ti costa un'altra serata. Con un servizio a pagamento, cerca i termini di fallimento, rimborsi automatici al saldo, prezzo bloccato prima di iniziare e un preventivo gratuito significano che il rischio finanziario di un ripristino fallito è sostanzialmente zero.
Quale dovresti scegliere?
Guida onesta. Se hai bisogno di un piccolo sito replicato per riferimento e ti piacciono gli strumenti gratuiti, HTTrack ce l'avrà sul tuo disco stasera. Se scrivi codice, vuoi i file grezzi e hai un weekend da dedicare, la via del gem è davvero buona e davvero gratuita. Se il sito è un asset aziendale, il negozio WooCommerce di un cliente, un forum con dieci anni di posti, la tua stessa opera della vita, paga la tariffa per file e dedica la tua serata a qualcos'altro. Il tutorial mostra l'intero flusso di ripristino prima che tu spenda un centesimo, e il preventivo gratuito ti permette di vedere il prezzo esatto prima di decidere.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
Esiste una funzionalità ufficiale di archive.org per scaricare siti web?
No. La Wayback Machine è costruita per navigare singole catture, e archive.org non offre esportazione di interi siti. Ogni metodo bulk, HTTrack, script di download, servizi di ripristino, è uno strumento di terze parti che legge le stesse catture pubbliche e lo stesso indice pubblico.
HTTrack o wayback-machine-downloader è meglio per archive.org?
Lavori diversi. HTTrack crawl i link e si adatta a repliche piccole e semplici. wayback-machine-downloader legge l'indice dell'archivio, quindi trova pagine non collegate e gestisce gli intervalli di date correttamente. Per qualsiasi cosa più grande di alcune dozzine di pagine, l'approccio basato sull'indice vince.
Quanto costa ripristinare un sito con Restorix?
Paghi una piccola tariffa fissa per file ripristinato, con il primo file gratuito e il prezzo bloccato al momento del preventivo, quindi vedi il totale esatto per il tuo sito specifico prima di pagare qualsiasi cosa. Le ricariche sono una tantum, con carta o criptovaluta, e esistono codici promozionali. Nulla si rinnova.
Questi strumenti possono rimettere il sito sul mio hosting, o solo scaricare i file?
HTTrack e gli script si fermano ai file sul tuo disco; il caricamento, la correzione dei link e la configurazione dell'hosting sono a tuo carico. Restorix può distribuire la copia ripristinata direttamente su server SSH/SFTP, hosting condiviso FTP/FTPS o S3, e include un semplice CMS per modificare le pagine in seguito.
Devo conoscere tutti i vecchi URL prima di scaricare?
No. Gli strumenti basati sull'indice enumerano ogni URL catturato dall'API CDX, quindi hai bisogno solo del dominio. I crawler basati su link come HTTrack necessitano solo di un URL di partenza, ma mancheranno qualsiasi cosa non fosse collegata da qualche parte a cui il loro crawl potesse arrivare.
Guide correlate

wayback machine downloader
Strumenti per scaricare dalla Wayback Machine: cosa funziona davvero
Uno sguardo onesto agli strumenti per scaricare dalla Wayback Machine: gli script open-source, i loro reali limiti e l'opzione chiavi in mano che rimette online il tuo sito.

web downloader
Strumenti di Web Downloader a confronto: cosa salvano e cosa rompono
Come funziona un web downloader, cosa conservano realmente HTTrack, wget, SiteSucker e il salvataggio del browser, cosa rompe ciascuno e quando il ripristino è la scelta migliore.

download a website from archive org
Come scaricare un sito web da Archive.org: 3 metodi che funzionano
Tre metodi comprovati per scaricare un sito web da archive.org: salvare le pagine a mano, usare l'API CDX con uno script o eseguire un ripristino automatico. Tempi realistici per ciascun metodo.
