Come scaricare da Archive.org: elementi, snapshot e altro
A cura di la redazione di Restorix · 28 aprile 2026 · 7 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
L'espressione 'scaricare da Archive.org' copre due lavori completamente diversi, e confonderli è il modo in cui si perdono interi pomeriggi. Lavoro uno: recuperare i file da un elemento, un libro, un driver, una registrazione di un concerto. Lavoro due: estrarre un sito web dal Wayback Machine. Il primo ha un pulsante per il download. Il secondo decisamente no.
Li faccio entrambi ogni settimana, per ripristini di clienti e per ricerca. Ecco ogni metodo che funziona ancora, con i compromessi reali: cosa si fa con un clic, cosa con la riga di comando, e cosa è una trappola vestita da pulsante di download.
Due modi per scaricare da Archive.org
Archive.org memorizza i contenuti come elementi, pacchetti autonomi di file con metadati, come una cartella etichettata su uno scaffale. Il Wayback Machine memorizza catture, copie con timestamp di singoli URL, servite renderizzate con link riscritti. Gli elementi sono fatti per essere scaricati. Le catture sono fatte per essere visualizzate nel browser.
Tutto ciò che puoi fare deriva da questa divisione. I download degli elementi sono supportati ufficialmente: pulsanti, torrent, una CLI, un'API per i metadati. I 'download' degli snapshot sono in realtà ricostruzioni, chiedi all'API CDX cosa esiste, recuperi i byte originali di ogni URL, poi sistemi i link. Strumenti diversi, modalità di errore diverse, budget di tempo diversi.
Non sei sicuro in quale mondo ti trovi? Guarda l'URL. archive.org/details/something è un elemento, scaricabile. web.archive.org/web/2012/http://example.com è uno snapshot, visualizzabile. Lo stesso archivio, due schemi di indirizzi, due set di regole.
Scarica gli elementi di Archive.org nel modo semplice
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Apri qualsiasi pagina di un elemento e guarda la casella di download sulla destra. Ottieni i singoli file, di solito un link torrent, e a volte una scorciatoia ZIP o full-text. Per un PDF o una ISO, clicca sul file. Fatto. Questa è l'unica parte del download da Archive.org che funziona come la gente si aspetta.
- Clicca 'SHOW ALL' per vedere tutti i file nell'elemento, inclusi log e formati derivati che la casella nasconde.
- Gli URL diretti sono prevedibili: archive.org/download/{identifier}/{filename}, perfetti per script e wget.
- L'opzione torrent spesso batte l'HTTP per elementi da molti gigabyte, e riprende pulito dopo una connessione caduta.
- I derivati sono versioni generate, testo OCR, MP4 più piccoli. L'upload originale è segnalato come tale; prendi quello quando la fedeltà conta.
Un trucco in più per chi scrive script: aggiungi /metadata/{identifier} a archive.org e ottieni un elenco JSON di tutti i file, con dimensione, checksum e formato. Quel JSON è esattamente ciò che lo strumento a riga di comando consuma sotto il cofano.

Download massivi con la CLI di Internet Archive
Per più di qualche elemento, installa lo strumento ufficiale a riga di comando, il pacchetto Python internetarchive, che fornisce il comando ia. Gestisce autenticazione, ripresa e tentativi, ed è la differenza tra uno script e un weekend di clic.
- Installa: pip install internetarchive, poi esegui ia configure una volta con il tuo account.
- Un elemento: ia download {identifier} rispecchia l'intero elemento in una cartella locale.
- Scegli selettivamente: ia download {identifier} --glob='*.pdf', niente più sorprese da 40 GB.
- Intere ricerche: ia search 'collection:archiveteam AND year:2013' --itemlist > list.txt, poi esegui un ciclo di ia download su quel file.
Esistono limiti di velocità. La CLI riprova educatamente da sola; il tuo ciclo wget grezzo contro archive.org no, e martellare ti fa limitare o bloccare. Sii educato, l'archivio è una nonprofit, non una CDN.
Come scaricare gli snapshot web di Archive.org
Ora la parte difficile. Una cattura del Wayback non è un elemento, quindi non c'è una casella di download. Hai quattro strade realistiche, in ordine di impegno:
- Singola pagina, adesso: apri lo snapshot e usa la funzione di salvataggio del browser. Va bene per una pagina; la copia salvata punta ancora i suoi asset a web.archive.org.
- Byte originali di un singolo file: inserisci id_ dopo il timestamp nell'URL dello snapshot, web.archive.org/web/20120501000000id_/http://example.com/style.css, e ottieni il payload non modificato. Ideale per singole immagini, CSS e PDF.
- Pull tramite script: interroga l'API CDX per ogni URL catturato sotto un percorso, poi richiedi ciascuno con il modificatore id_. Funziona, ma ora stai mantenendo uno scraper, deduplicando i digest e riscrivendo i link da solo.
- Strumenti di download e servizi di ripristino: strumenti della community come la gem wayback-machine-downloader automatizzano il ciclo CDX-più-fetch; un servizio di ripristino come Restorix fa quello più la pulizia e il ridistribuzione.
Nota lo schema: nel momento in cui vuoi più di una pagina o due, stai scrivendo o eseguendo strumenti. Non c'è vergogna in questo, prevedilo onestamente.
Un avvertimento sul trucco id_, perché promette troppo: ti dà i byte originali di quella singola risposta, ma non sistema nulla. Una pagina scaricata con id_ contiene ancora tutti gli URL assoluti che il sito usava nel 2012, fa ancora riferimento ad asset che il crawler non ha mai preso, e presume ancora un dominio che potresti non possedere più. I byte originali sono il materiale di partenza, non il sito finito.

Elementi vs. snapshot web: quando si applica ciascuno
| Vuoi | Usa | Metodo |
|---|---|---|
| Un libro, una canzone, un driver, una ISO | Elemento | Pulsante di download, torrent o ia download |
| Una vecchia versione di una pagina | Snapshot | Salvataggio del browser o URL id_ |
| Un'immagine o un file CSS mancante | Snapshot | URL id_ direttamente in wget |
| Un intero sito morto | Set di snapshot | API CDX più strumenti, o un servizio di ripristino |
| Un servizio che è morto (era GeoCities) | Elemento più snapshot | WARC di Archive Team, incrociati con CDX |
Quell'ultima riga sorprende le persone: quando Archive Team salva un host morente, il risultato finisce nell'archivio degli elementi come file WARC giganti. Lo stesso sito web può essere sia un download di elemento sia un set di snapshot. Controlla prima il lato elementi, un crawl pre-confezionato batte mille fetch individuali, e la nostra guida ai formati spiega cosa fare con quei WARC.
Errori di download che fanno perdere ore
- wget ricorsivo contro web.archive.org. Ogni link è riscritto per restare sul suo dominio, quindi il tuo crawler scarica felicemente l'interfaccia stessa del Wayback Machine fino alla morte termica dell'universo.
- Scaricare l'intero elemento per un solo file. Un clic su 'SHOW ALL' richiede dieci secondi; uno ZIP da 40 GB si prende la tua serata.
- Fidarsi di uno snapshot come fosse l'intero sito. Le catture sono per-URL e opportunistiche, le immagini servite da un sottodominio CDN spesso mancano del tutto.
- Ignorare i codici di stato nell'output CDX. Redirect e 404 sono archiviati anche loro; filtra per statuscode:200 e collassa i digest, o ripristinerai stub di redirect come pagine.
- Saltare i checksum. Gli elementi spediscono file md5 e sha1, verifica i download grandi prima di costruirci sopra.
- Assumere che una data di snapshot basti. La homepage del 2011 con immagini del 2009 è normale; i siti venivano crawlati a pezzi, quindi aspettati di mescolare date di cattura per ottenere un quadro completo.
Hai i file. E ora?
I download degli elementi si inseriscono direttamente nella tua libreria media o nella tua toolchain, quella parte è risolta. I pull degli snapshot sono dove inizia il vero lavoro: URL riscritti, asset mancanti, form di contatto morti, HTTP e HTTPS mescolati. Trasformare una cartella di catture del 2011 in un sito che si carica davvero è un lavoro di ricostruzione, non un lavoro di download.
Questo è il punto in cui ho smesso di scrivere script a mano e ho iniziato a indirizzare le persone verso questo servizio. Il preventivo gratuito legge l'archivio per te, conteggio esatto dei file, dimensione totale, prezzo bloccato, prima di spendere un centesimo. Primo file ripristinato gratis, paghi per file dopo, integrazioni una tantum, nessun abbonamento. Se un ripristino o un deploy fallisce, il rimborso arriva automaticamente sul tuo saldo, senza bisogno di un ticket di assistenza.
Le opzioni di ripristino coprono le parti complicate che altrimenti dovresti scriptare: rimuovi analytics e annunci, rendi i link relativi, forza HTTPS, canonicalizza www, mantieni i redirect. Il deploy con un clic spinge il risultato su SSH/SFTP, FTP o S3, e il CMS monofile incluso in /webarchive-cms.php ti permette di correggere i contenuti sul posto, il tutorial ti guida attraverso un lavoro completo. I download mettono fine alla ricerca; non mettono fine al lavoro.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
Posso scaricare un intero sito web da Archive.org?
Non con un pulsante. I siti web vivono sul lato Wayback come catture per-URL, quindi scaricare un sito significa enumerare gli URL tramite l'API CDX e recuperarli uno per uno, poi riparare i link. Per qualcosa oltre poche pagine, usa uno strumento di download o un servizio di ripristino, confrontiamo le opzioni in [scaricare un intero sito web da Archive.org](/it/download-entire-website-from-archive-org).
È legale scaricare da Archive.org?
Gli elementi di pubblico dominio e Creative Commons sono esplicitamente ok. Gli elementi protetti da copyright restano una decisione del titolare dei diritti, scaricare per ricerca personale è generalmente tollerato, ripubblicare no. Ricostruire il tuo vecchio sito dalle sue catture è il classico caso legittimo.
Qual è la differenza tra ia download e i torrent?
Stessi byte, trasporto diverso. I torrent brillano per elementi enormi e connessioni instabili; la CLI brilla per lo scripting, il filtraggio con --glob, e i lavori in batch su molti identificatori. Per un singolo elemento da 200 MB, il semplice pulsante di download batte entrambi.
Perché i miei download di snapshot contengono URL di web.archive.org ovunque?
Il Wayback Machine riscrive i link così le pagine si renderizzano dentro il suo player. Recupera con il modificatore id_ per ottenere i byte originali, o esegui un ripristino che riscrive i link al contrario, l'opzione link relativi di Restorix esiste proprio per questa pulizia.
Come faccio a scaricare un'intera collezione invece di un solo elemento?
Costruisci la lista di elementi con ia search 'collection:name' --itemlist, poi esegui ia download per identificatore, con i filtri --glob per mantenere solo i tipi di file che vuoi. Aspettati che richieda un po' di tempo, le collezioni grandi arrivano a terabyte, quindi controlla le statistiche di dimensione della collezione prima di iniziare.
Guide correlate

archive org download
Formati di download di Archive.org: WARC, CDX e file singoli
Cosa contiene davvero ogni formato di download di Archive.org, acquisizioni WARC, indici CDX in JSON e singoli file originali, e cosa farne.

download a website from archive org
Come scaricare un sito web da Archive.org: 3 metodi che funzionano
Tre metodi comprovati per scaricare un sito web da archive.org: salvare le pagine a mano, usare l'API CDX con uno script o eseguire un ripristino automatico. Tempi realistici per ciascun metodo.

download entire website from archive org
Scarica un intero sito web da Archive.org, non solo la homepage
Per scaricare un intero sito web da archive.org servono tutte le pagine, le immagini e i fogli di stile. Le risorse si nascondono sotto timestamp diversi, ecco perché, più una checklist completa.

wayback machine downloader
Strumenti per scaricare dalla Wayback Machine: cosa funziona davvero
Uno sguardo onesto agli strumenti per scaricare dalla Wayback Machine: gli script open-source, i loro reali limiti e l'opzione chiavi in mano che rimette online il tuo sito.
