Formati di download di Archive.org: WARC, CDX e file singoli
A cura di la redazione di Restorix · 28 giugno 2026 · 8 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Hai trovato la scansione, hai cliccato download e ora stai fissando un file da 900 MB che termina in.warc.gz che nulla sul tuo computer apre. Benvenuto nella parte meno documentata di Archive.org: i formati. La libreria distribuisce dati grezzi di acquisizione, e i dati grezzi di acquisizione richiedono che tu porti i tuoi strumenti.
Tre formati coprono quasi tutto ciò che scaricherai: file WARC, output CDX in JSON e semplici file singoli. Ecco cosa sia davvero ciascuno, quando ti serve e come trasformarlo in qualcosa di utile, inclusa la scorciatoia per quando vuoi semplicemente riavere il tuo vecchio sito.
Cosa contiene davvero un download da Archive.org
Ancora due mondi di archiviazione. I download degli item ti danno file finiti, un PDF è un PDF, un ISO è un ISO. I download lato Wayback ti danno dati di acquisizione web: risposte HTTP congelate al momento della scansione, più gli indici che le descrivono. I formati confusi arrivano tutti da quel secondo mondo, e c'è anche una via di fuga con un singolo file che collega entrambi.
Le dimensioni contano per la pianificazione. Un singolo segmento WARC di una raccolta di scansioni è circa 1 GB compresso. L'elenco CDX di un sito di medie dimensioni può essere 50.000 righe di JSON. Un singolo file è, beh, un file. Abbina il formato al lavoro prima di iniziare il trasferimento, non dopo, riscaricare un gigabyte perché hai preso quello sbagliato è un rito di passaggio che è meglio evitare.
WARC: il formato di acquisizione grezzo
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
WARC, Web ARChive, standard ISO 28500, è un contenitore che concatena record. Ogni record è uno scambio HTTP acquisito: le intestazioni della risposta seguite dai byte esatti del payload, più metadati come l'ora di acquisizione e l'URL di destinazione. I record sono di vari tipi, response, resource, metadata, warcinfo, e i file arrivano quasi sempre compressi in gzip, un record per membro gzip, così che gli strumenti possano cercare senza decomprimere l'intero archivio.
- Nulla viene renderizzato o ripulito. Ottieni byte per byte ciò che lo scanner ha visto, incluse le pagine 404 e le catene di reindirizzamento.
- Un singolo WARC contiene migliaia di URL spesso non correlati provenienti da una scansione, il tuo sito può essere il 2% del file.
- Servono strumenti per leggerlo: la libreria Python warcio per l'estrazione, oppure ReplayWeb.page e pywb per riprodurlo come pagine navigabili.
Estrarre con warcio è un ciclo di filtraggio: apri l'archivio, salti i record il cui URL di destinazione è fuori dal tuo dominio, scrivi i payload su disco rispecchiando i percorsi originali, deduplica i digest identici. Cinquanta righe di Python, o una lunga serata per capire perché la gente paga per farlo.
Dove si trovano davvero i WARC? In due posti. Le scansioni di salvataggio di Archive Team e le raccolte di scansioni di Internet Archive li distribuiscono come normali file di item, cerca.warc.gz nella casella di download dell'item. E se commissioni o esporti una tua scansione, WARC è ciò che torna indietro. È il container standard del mondo dell'archiviazione web: brutto, standardizzato e onnipresente.

JSON CDX: l'indice, non il contenuto
CDX è il catalogo a schede della Wayback Machine. Interroga web.archive.org/cdx/search/cdx?url=example.com&output=json e ottieni un array JSON in cui ogni riga descrive un'acquisizione: urlkey, timestamp, URL originale, mimetype, statuscode, digest e lunghezza in byte. Nessun contenuto di pagina, solo un menu preciso di ciò che esiste, acquisizione per acquisizione.
Due flag si guadagnano il loro posto in ogni query: filter=statuscode:200 elimina i reindirizzamenti e le pagine di errore, e collapse=digest rimuove le acquisizioni duplicate di contenuto identico. Sul negozio WooCommerce di un cliente, quei due flag hanno ridotto 38.000 righe grezze a 4.100 pagine reali e uniche. Quella lista è diventata il piano di ripristino, e la stima del prezzo.
Trucchi per le query che vale la pena conoscere: aggiungi matchType=prefix per coprire ogni URL sotto un percorso, e usa from=2008&to=2012 per delimitare gli anni. Un wildcard come url=example.com/* implica già una corrispondenza prefisso sull'intero dominio. Inizia in modo mirato, una query di dominio non filtrata su un sito grande restituisce megabyte di JSON e una scheda del browser bloccata.
- Definizione del perimetro: quanto del sito è mai stato acquisito, e in quali anni.
- Analisi delle lacune: trovare le directory di immagini e gli host CDN che non sono mai stati scansionati.
- Elenchi di recupero in batch: alimenta le coppie timestamp+URL al tuo downloader, una richiesta id_ per ciascuna.
- Stime: Restorix legge gli stessi dati CDX per prezzare un ripristino, numero di file, dimensione totale, prezzo bloccato, in anticipo.

File singoli: il download facile da Archive.org
Il terzo formato è a malapena un formato: un file originale, recuperato direttamente. Per gli item, è il collegamento al file nella casella di download. Per le istantanee, è il trucco id_, inserisci id_ dopo il timestamp, come in web.archive.org/web/20130501000000id_/http://example.com/logo.png, e la Wayback Machine restituisce il payload intatto senza barra degli strumenti e senza markup riscritto.
Ricorri ai file singoli quando sai già esattamente cosa manca: il foglio di stile che non è stato scansionato, il listino prezzi in PDF, l'immagine hero che un cliente continua a chiedere. Tengo una cartella temporanea di questi per ogni progetto. Quello che non dovresti fare è costruire un intero sito in questo modo, 4.000 recuperi manuali con id_ sono uno script che aspetta solo di essere scritto.
Due modalità di errore da aspettarsi. Sul lato istantanee, id_ funziona solo se quell'esatto URL è stato acquisito, controlla prima l'indice CDX invece di indovinare gli URL. Sul lato item, il modello di URL diretto archive.org/download/{identifier}/{filename} è stabile e programmabile, ma i nomi di file con spazi richiedono una corretta codifica URL o wget darà errore 404 su un file che esiste chiaramente.
Quale formato di download di Archive.org ti serve?
| Formato | Contiene | Ideale per | Strumenti |
|---|---|---|---|
| WARC (.warc.gz) | Risposte HTTP grezze in massa | Scansioni complete, archivi offline | warcio, pywb, ReplayWeb.page |
| JSON CDX | Solo metadati di acquisizione | Definizione del perimetro, analisi delle lacune, elenchi di recupero | Qualsiasi client HTTP più uno script |
| File singolo / id_ | Un payload originale | Asset mancanti specifici | Browser o wget |
| Download item | File finiti (PDF, ISO, MP3) | Libri, software, media | Nessuno, clicca e vai |
La vera catena di dipendenze per un ripristino di sito web è: prima CDX, poi recuperi WARC o id_, e per ultimi i file singoli per tappare i buchi. Saltare il passaggio CDX è il modo per scaricare un gigabyte di dati di scansione e perdere comunque metà del sito. I download degli item stanno del tutto fuori da questa catena, sono prodotti finiti, e se ti serve un libro o un driver, smetti di leggere e vai a cliccare.
Lavorare con ciò che hai scaricato
Insidie che mordono tutti almeno una volta. I WARC compressi con gzip sono multi-member, un gunzip ingenuo funziona, ma i lettori in streaming non devono fermarsi al primo membro. I digest si ripetono tra le acquisizioni, quindi deduplica prima di contare i file o i tuoi totali saranno sbagliati. Le codifiche di caratteri del 2004 non sono UTF-8; mantieni i byte come byte finché non devi decodificare. E ogni URL riscritto dalla Wayback dentro l'HTML acquisito punta ancora a web.archive.org finché non lo riscrivi.
Pianifica la struttura di output prima di estrarre: rispecchia i percorsi URL originali, conserva un manifest di quale payload proveniva da quale record, e non sovrascrivere mai una variante che potrebbe servirti in seguito. Restorix può esportare esattamente questo tipo di manifest (JSON o SQLite) con ogni ripristino, facendolo a mano, capirai perché quella funzionalità esiste.
Oppure salta del tutto la lotta con i formati
Tutto quanto sopra si può imparare, e nulla di ciò è un buon uso del fine settimana di un imprenditore. questo servizio di ripristino esiste esattamente per questo livello: legge i dati CDX, recupera le acquisizioni, deduplica, riscrive i link e ti consegna un sito funzionante. La stima gratuita mostra il numero di file archiviati, la dimensione totale e un prezzo bloccato prima di pagare, il primo file ripristinato è gratis, poi paghi per file, rimborso automatico del saldo se qualcosa fallisce.
Le opzioni di ripristino corrispondono una a una ai punti dolenti sopra: link interni relativi invece di URL di archive.org, conversione in HTTPS, rimozione di vecchi analytics e annunci, mantenimento intatto dei reindirizzamenti 301. Il deploy è un clic verso SSH/SFTP, FTP/FTPS o S3 dalla dashboard di ripristino, e il CMS integrato in /webarchive-cms.php, password generata casualmente, modalità sicura attiva per impostazione predefinita, significa che puoi modificare il sito riportato in vita senza toccare una riga di strumenti WARC. I formati sono per gli archivisti. Tu vuoi solo riavere il tuo sito.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
Cos'è un file WARC e come si apre?
Un WARC è un contenitore standard ISO di risposte HTTP acquisite, intestazioni più i byte esatti del payload, di solito compressi in gzip. Aprilo con la libreria Python warcio per estrarre i file, oppure riproducilo come pagine navigabili con ReplayWeb.page o pywb. Il doppio clic non fa nulla; non esiste un visualizzatore desktop nativo.
Cosa significano i campi nell'output CDX in JSON?
Ogni riga è un'acquisizione: urlkey (URL canonizzato), timestamp (ora di acquisizione, yyyyMMddhhmmss), original (l'URL come scansionato), mimetype, statuscode, digest (hash del contenuto, digest identici significano byte identici) e length (dimensione del record compresso). Descrive le acquisizioni; non contiene contenuto di pagine.
Come ottengo il file originale senza l'HTML riscritto dalla Wayback?
Usa il modificatore id_: inseriscilo subito dopo il timestamp in qualsiasi URL di istantanea e l'archivio restituisce il payload non modificato, niente barra degli strumenti, niente link riscritti. Funziona per pagine, immagini, CSS, qualsiasi cosa acquisita.
Posso convertire un download di Archive.org in un sito web funzionante?
Sì, con un po' di impegno: enumera le acquisizioni tramite CDX, estrai i payload da recuperi WARC o id_, riscrivi i link, integra gli asset mancanti, poi distribuisci. Per una manciata di pagine è una serata divertente. Per un sito vero, un servizio di ripristino come Restorix automatizza l'intera catena e ti mostra il prezzo prima di qualsiasi addebito.
Quanto è grande il download di Archive.org di un sito tipico?
Più piccolo di quanto temi, di solito. Un sito vetrina di 200 pagine di cinque anni fa spesso totalizza 200-800 MB tra tutte le acquisizioni; deduplicato, il contenuto unico può essere 60 MB. L'elenco CDX ti dice i numeri reali prima di scaricare qualsiasi cosa, definisci sempre prima il perimetro.
Guide correlate

download archive org
Come scaricare da Archive.org: elementi, snapshot e altro
Ogni modo pratico per scaricare contenuti da Archive.org, file di elementi, download massivi da CLI e snapshot web del Wayback Machine, e come scegliere quello giusto per il tuo lavoro.

archive.org download website
Strumenti per scaricare siti web da Archive.org: un confronto onesto
Un confronto onesto sugli strumenti per scaricare siti web da archive.org: HTTrack, gli script wayback-machine-downloader e Restorix. Costi reali, sforzo e gestione delle risorse.

wayback download
Download da Wayback: Ogni metodo classificato per impegno
Ogni metodo di download da Wayback classificato per impegno: singole pagine, script wget, API CDX e servizi automatizzati che ricostruiscono l'intero sito per te.

restore website from archive.org
Ripristinare un Sito Web da Archive.org: Fai-da-Te o Servizio Incluso?
Dovresti ripristinare un sito web da Archive.org da solo o pagare per un servizio incluso? Un confronto onesto su costi, tempo, competenze e rischi, più un framework decisionale.
