Strumenti per scaricare dalla Wayback Machine: cosa funziona davvero
A cura di la redazione di Restorix · 9 maggio 2026 · 7 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Cercando un downloader per la Wayback Machine si finisce sempre sugli stessi pochi strumenti che tutti usano da un decennio. Alcuni funzionano davvero. Tutti condividono gli stessi limiti. Questa è la recensione che avrei voluto leggere prima del mio primo ripristino: cosa fanno realmente gli script open-source, dove si fermano e cosa usare quando il sito deve tornare online.
Cosa fa realmente un downloader per la Wayback Machine
Ogni downloader per la Wayback Machine è lo stesso meccanismo sotto la vernice. Interroga l'API CDX per ottenere un elenco di catture, lo scorre e salva ogni file dal suo URL con timestamp. Quelli migliori aggiungono filtri per data e tipo di file e una logica di ripetizione quando archive.org inizia a limitare le richieste. Nessuno di loro accede a un backup segreto del tuo sito. Raschiano lo stesso archivio pubblico che puoi aprire subito nel browser.
Questa distinzione conta più di qualsiasi lista di funzionalità. Un downloader eredita ogni lacuna dell'archivio: le pagine mai scansionate, le immagini mai catturate, la directory bloccata da un robots.txt che qualcuno ha configurato male nel 2015. Lo strumento può solo recuperare ciò che esiste.
Anche i numeri crescono in fretta. Un sito modesto di 200 pagine, contando immagini, fogli di stile e script, diventa facilmente 2.000 file. A una richiesta al secondo, sono oltre mezz'ora di puro recupero, prima dei tentativi ripetuti, dei limiti di velocità e dei file che restituiscono 404 perché l'archivio li ha persi anni fa.
Le opzioni open-source
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Tre nomi ricorrono in ogni discussione, e a ragione:
- wayback-machine-downloader, un gem Ruby. Il più conosciuto del gruppo. Un solo comando, wayback_machine_downloader http://example.com --from 2015 --to 2019, e riempie una directory ./websites con tutte le catture corrispondenti. Include un'opzione per la concorrenza e filtri per estensione dei file.
- waybackpack, uno strumento Python. Scarica le catture organizzate per timestamp, il che lo rende adatto a estrarre una specifica istantanea di una pagina, meno indicato per mirror di interi siti.
- HTTrack puntato su un URL di snapshot. Non è affatto un vero strumento per l'archivio. Segue i link riscritti che Wayback inietta nelle pagine e trascina giù un intero albero di catture. Grezzo, occasionalmente efficace su siti piccoli, e completamente confuso dalle stringhe di query.
Tutti e tre sono gratuiti. Tutti e tre sono mantenuti a ritmo amatoriale. E tutti e tre ti consegnano un mucchio di file. Cosa succede dopo è un problema tuo, e questa frase copre circa l'ottanta per cento di ciò che segue. Prima di installarne uno, leggi le issue aperte sul repository. Dieci minuti lì ti dicono più di qualsiasi post comparativo.

Cosa aspettarsi da uno script gratuito per scaricare dalla Wayback Machine
Stabilisci le aspettative prima di eseguire qualsiasi cosa. Una tipica prima sessione con un downloader gratuito per la Wayback Machine va così: trenta minuti a combattere con l'installazione di Ruby o Python, dieci minuti di progressi promettenti, poi archive.org inizia a rispondere con errori 429 e tutto rallenta fino a fermarsi. Un sito da 5.000 file a velocità di richiesta educate è un lavoro notturno, e i lavori notturni falliscono silenziosamente alle 3 del mattino.
Una prima esecuzione realistica
- Installa il runtime e lo strumento. Risolvi i conflitti di versione che nessuno menziona nel README.
- Esegui un piccolo test su una directory del sito per confermare il formato dell'output.
- Avvia l'esecuzione completa e guarda arrivare i primi cento file.
- Raggiungi i limiti di velocità, riduci la concorrenza, riavvia e spera che la logica di ripresa funzioni.
- Apri la cartella di output e scopri la spazzatura che hai scaricato insieme all'oro.
L'output ha sempre bisogno di un triage. A meno che tu non abbia filtrato bene, ottieni ogni cattura di ogni URL: spazzatura di parametri di tracciamento, viste di stampa, pagine di errore che hanno comunque restituito uno stato 200. E a meno che lo strumento non abbia recuperato le varianti id_, i byte originali non modificati, ogni file HTML arriva con i link riscritti e la barra degli strumenti di Wayback ancora incorporati.
Un'altra sorpresa è l'organizzazione. La maggior parte degli script scarica tutto in percorsi con timestamp che rispecchiano l'archivio, non la struttura originale delle directory. Ricostruire il vero albero delle cartelle e rinominare i file come li chiamava il server è un lavoro manuale che nessuno mette in conto.
I limiti che incontrerai
- Nessuna logica di ripristino. Un downloader recupera file. Non rimuove la barra degli strumenti di Wayback, non corregge i link interni, non sceglie un host canonico e non converte nulla in HTTPS.
- Nessuna intelligenza di deduplicazione. La stessa immagine salvata sotto sei timestamp diventa sei file, a meno che tu non li comprima manualmente per digest del contenuto.
- Limiti di velocità. Se spingi troppo, archive.org ti limita o ti blocca del tutto per un po'. Le riesecuzioni sono una parte normale del flusso di lavoro, non un segno che hai sbagliato qualcosa.
- Obsolescenza delle dipendenze. Script vincolati a vecchie versioni di Ruby o Python si rompono sui sistemi moderni. Controlla la data dell'ultimo commit sul repository prima di installare qualsiasi cosa.
- Nessun supporto. Quando lo strumento si rompe, il tracciamento delle issue è il banco di supporto, e l'ultima risposta potrebbe essere di due anni fa.
- Nessun traguardo. Quando lo script termina, possiedi una cartella. Trasformare quella cartella in un sito web ospitato e funzionante è un secondo progetto di dimensioni simili.

L'alternativa chiavi in mano
L'alternativa al dover badare agli script è un servizio che considera il download come il primo passo di un ripristino, non l'intero lavoro. questo servizio inizia con una stima gratuita: conteggio esatto dei file archiviati, dimensione totale e un prezzo bloccato prima di pagare un centesimo. Da lì scarica tutto, lo pulisce e può distribuirlo direttamente sul tuo hosting via SSH, FTP o S3.
I dettagli sono pensati per questo lavoro specifico. Paghi per file ripristinato, con il primo gratuito. Se un ripristino o un deploy fallisce, il rimborso arriva automaticamente sul tuo saldo, senza bisogno di ticket di supporto. Le opzioni di ripristino rimuovono analytics e annunci, riscrivono i link in percorsi relativi e forzano HTTPS. I deploy includono un piccolo CMS a file singolo con una propria password amministrativa generata, così il sito ripristinato rimane modificabile. Nessun abbonamento: ricarichi un saldo e lo spendi.
Quando un downloader per la Wayback Machine è lo strumento sbagliato
Uno script di download è lo strumento giusto per archivi offline, dataset di ricerca e per recuperare una cartella di vecchi PDF. È lo strumento sbagliato quando:
- Il sito deve tornare online e apparire corretto
- La persona che fa il lavoro non aprirà mai un terminale
- L'archivio contiene decine di migliaia di URL, metà dei quali spazzatura di stringhe di query
- C'è una scadenza: un rilancio, una richiesta legale, un cliente che ti sta col fiato sul collo
In questi casi lo script non è più economico del servizio. Nasconde solo il conto nelle tue ore. Una stima di Restorix almeno ti dice il prezzo reale in anticipo, prima di impegnare un fine settimana per scoprirlo a tue spese. Niente di tutto ciò rende gli script cattivi. Li rende strumenti con una descrizione del lavoro, e la descrizione del lavoro finisce alla cartella.
Come scegliere
| La tua situazione | Strumento giusto | Perché |
|---|---|---|
| Ti serve una singola istantanea come riferimento | Browser più il trucco dell'URL id_ | Due minuti, nessuna installazione |
| Sito piccolo, dimestichezza con la CLI | gem wayback-machine-downloader | Gratuito, collaudato, buoni filtri |
| File specifici su larga scala | API CDX più il tuo script | Controllo completo sul filtraggio |
| Il sito deve rivivere | Restorix | Download, pulizia e deploy in un unico lavoro |
Scegli in base alla destinazione, non al download. Se l'obiettivo è una cartella di file, gli strumenti gratuiti fanno il loro dovere e lo faranno sempre. Se l'obiettivo è il sito web stesso, salta del tutto la fase della cartella e vai dritto a ciò che lo ricostruisce.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
Esiste un downloader ufficiale per la Wayback Machine?
No. Internet Archive gestisce la Wayback Machine e fornisce l'API CDX, ma non distribuisce alcun downloader di massa ufficiale. Ogni strumento in questo ambito è di terze parti e costruito sugli stessi endpoint pubblici che puoi interrogare tu stesso.
Il gem Ruby wayback-machine-downloader è sicuro?
È un progetto open-source di lunga data e sicuro nel senso comune: leggi il codice, installa dal repository canonico e diffida dei pacchetti simili con nomi somiglianti. Il rischio pratico maggiore è un fork obsoleto che fallisce silenziosamente a metà di un sito di grandi dimensioni.
Perché il mio download si è bloccato a metà?
Quasi sempre per limiti di velocità. archive.org risponde ai client aggressivi con errori 429. Riduci la concorrenza, aggiungi ritardi tra le richieste e riprendi. La maggior parte degli strumenti può ripartire da dove si è fermata, quindi un blocco costa tempo piuttosto che progressi.
Un downloader può recuperare pagine protette da password o cancellate?
No per le password: il crawler non ha mai superato il login, quindi non esiste nulla da scaricare. Sì per le pagine cancellate: la cancellazione dal web live è esattamente ciò da cui l'archivio protegge, a patto che una scansione sia avvenuta prima della cancellazione.
Le app di download a pagamento sono migliori degli script gratuiti?
A volte sono gli script gratuiti con un'interfaccia applicata sopra. Giudica dall'output, non dal prezzo: ottieni file id_ originali, deduplicazione sensata e link puliti, o una cartella di HTML riscritto? Un servizio di ripristino salta del tutto la domanda consegnandoti un sito finito invece di file.
Come trasformo i file scaricati in un sito web funzionante?
Rimuovi le riscritture di Wayback, rendi i link interni relativi, scegli un host canonico, quindi distribuisci e testa. Oppure lascia che un servizio di ripristino faccia tutto e quattro per te, che è l'intera ragione per cui questi servizi esistono.
Guide correlate

wayback download
Download da Wayback: Ogni metodo classificato per impegno
Ogni metodo di download da Wayback classificato per impegno: singole pagine, script wget, API CDX e servizi automatizzati che ricostruiscono l'intero sito per te.

wayback machine download site
Scaricare un intero sito dalla Wayback Machine
Come scaricare un intero sito dalla Wayback Machine: insidie del crawling, pagine con query string, asset mancanti e quando un ripristino automatizzato batte gli script fai-da-te.

restore website from wayback machine
Ripristinare un sito web dalla Wayback Machine: guida completa
Ripristina un sito web dalla Wayback Machine dall'inizio alla fine: scegli lo snapshot giusto, imposta le opzioni di ripristino e distribuisci un sito funzionante con un CMS in meno di un'ora.
