Formatos de Download do Archive.org: WARC, CDX e Arquivos Únicos
Por a equipe editorial da Restorix · 28 de junho de 2026 · 8 min de leitura

Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
Você encontrou o crawl, clicou em download e agora está olhando para um arquivo de 900 MB terminado em.warc.gz que nada na sua máquina abre. Bem-vindo à parte menos documentada do Archive.org: os formatos. A biblioteca fornece dados brutos de captura, e dados brutos de captura esperam que você traga suas próprias ferramentas.
Três formatos cobrem quase tudo que você vai baixar: arquivos WARC, saída JSON CDX e arquivos únicos simples. Aqui está o que cada um realmente é, quando usá-lo e como transformá-lo em algo útil, incluindo o atalho para quando você só quer seu site antigo de volta.
O que um Download do Archive.org Realmente Contém
Dois mundos de armazenamento novamente. Downloads de itens fornecem arquivos prontos, um PDF é um PDF, um ISO é um ISO. Downloads do lado do Wayback fornecem dados de captura web: respostas HTTP congeladas no momento do crawl, mais índices que as descrevem. Os formatos confusos vêm todos desse segundo mundo, além de uma válvula de escape de arquivo único que faz a ponte entre ambos.
Os tamanhos importam para o planejamento. Um único segmento WARC de uma coleção de crawl tem cerca de 1 GB compactado. A listagem CDX de um site de médio porte pode ter 50.000 linhas de JSON. Um arquivo único é, bem, um arquivo. Combine o formato com o trabalho antes de iniciar a transferência, não depois, baixar novamente um gigabyte porque você pegou a coisa errada é um rito de passagem que é melhor pular.
WARC: O Formato Bruto de Captura
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
WARC, Web ARChive, padrão ISO 28500, é um contêiner que concatena registros. Cada registro é uma troca HTTP capturada: os cabeçalhos de resposta seguidos pelos bytes exatos do payload, mais metadados como hora da captura e URL de destino. Os registros vêm em tipos, response, resource, metadata, warcinfo, e os arquivos quase sempre chegam gzipados, um registro por membro gzip, para que as ferramentas possam buscar sem descompactar todo o arquivo.
- Nada é renderizado ou limpo. Você recebe byte por byte o que o crawler viu, incluindo páginas 404 e cadeias de redirecionamento.
- Um WARC contém milhares de URLs frequentemente não relacionadas de um crawl, seu site pode ser 2% do arquivo.
- Você precisa de ferramentas para lê-lo: a biblioteca Python warcio para extração, ou ReplayWeb.page e pywb para reproduzi-lo como páginas navegáveis.
Extrair com warcio é um loop de filtro: abrir o arquivo, pular registros cuja URL alvo está fora do seu domínio, escrever payloads no disco espelhando os caminhos originais, deduplicar digests idênticos. Cinquenta linhas de Python, ou uma longa noite aprendendo por que as pessoas pagam por isso.
Onde você realmente obtém WARCs? Dois lugares. Crawls de resgate do Archive Team e coleções de crawl do Internet Archive os fornecem como arquivos de item comuns, procure por.warc.gz na caixa de download do item. E se você encomendar ou exportar um crawl próprio, WARC é o que retorna. É o contêiner de transporte do mundo do arquivamento web: feio, padronizado e em toda parte.

JSON CDX: O Índice, Não o Conteúdo
CDX é o catálogo de fichas da Wayback Machine. Consulte web.archive.org/cdx/search/cdx?url=example.com&output=json e você obtém um array JSON onde cada linha descreve uma captura: urlkey, timestamp, original, mimetype, statuscode, digest e tamanho em bytes. Nenhum conteúdo de página, apenas um menu preciso do que existe, captura por captura.
Duas opções valem a pena em toda consulta: filter=statuscode:200 elimina os redirecionamentos e páginas de erro, e collapse=digest remove capturas duplicadas de conteúdo idêntico. Em uma loja WooCommerce de um cliente, essas duas opções reduziram 38.000 linhas brutas para 4.100 páginas reais e únicas. Essa lista se tornou o plano de restauração, e a estimativa de preço.
Truques de consulta que valem a pena saber: adicione matchType=prefix para cobrir cada URL em um caminho, e use from=2008&to=2012 para limitar os anos. Um curinga como url=example.com/* já implica uma correspondência de prefixo em todo o domínio. Comece estreito, uma consulta de domínio sem filtro em um site grande retorna megabytes de JSON e uma aba do navegador congelada.
- Escopo: quanto do site foi capturado e em quais anos.
- Análise de lacunas: encontrar os diretórios de imagens e hosts CDN que nunca foram rastreados.
- Listas de busca em lote: alimente os pares timestamp-plus-URL ao seu downloader, uma solicitação id_ cada.
- Estimativas: a Restorix lê esses mesmos dados CDX para precificar uma restauração, contagem de arquivos, tamanho total, preço fixo, antecipado.

Arquivos Únicos: O Download Fácil do Archive.org
O terceiro formato é apenas um formato: um arquivo original, obtido diretamente. Para itens, é o link do arquivo na caixa de download. Para snapshots, é o truque id_, insira id_ após o timestamp, como em web.archive.org/web/20130501000000id_/http://example.com/logo.png, e a Wayback Machine retorna o payload intocado, sem barra de ferramentas e sem marcação reescrita.
Recorra a arquivos únicos quando você já sabe exatamente o que está faltando: a folha de estilo que não foi rastreada, a lista de preços em PDF, a imagem principal que um cliente fica perguntando. Eu mantenho uma pasta de rascunho desses por projeto. O que você não deve fazer é construir um site inteiro dessa forma, 4.000 buscas manuais id_ é um pedido para escrever um script.
Dois modos de falha a esperar. No lado do snapshot, id_ só funciona se aquela URL exata foi capturada, verifique o índice CDX primeiro em vez de adivinhar URLs. No lado do item, o padrão de URL direto archive.org/download/{identifier}/{filename} é estável e scriptável, mas nomes de arquivos com espaços precisam de codificação URL adequada ou o wget dará 404 em um arquivo que claramente existe.
Qual Formato de Download do Archive.org Você Precisa?
| Formato | Contém | Melhor para | Ferramentas |
|---|---|---|---|
| WARC (.warc.gz) | Respostas HTTP brutas em lote | Crawls completos, arquivos offline | warcio, pywb, ReplayWeb.page |
| JSON CDX | Apenas metadados de captura | Escopo, análise de lacunas, listas de busca | Qualquer cliente HTTP mais um script |
| Arquivo único / id_ | Um payload original | Ativos ausentes específicos | Browser ou wget |
| Download de item | Arquivos prontos (PDF, ISO, MP3) | Livros, software, mídia | Nenhum, clique e vá |
A cadeia de dependência honesta para restaurar um site é CDX primeiro, buscas WARC ou id_ em segundo, arquivos únicos para tapar buracos por último. Pular a etapa CDX é como você baixa um gigabyte de dados de crawl e ainda assim perde metade do site. Os downloads de itens ficam totalmente fora dessa cadeia, são produtos acabados, e se o que você precisa é de um livro ou driver, pare de ler e vá clicar.
Trabalhando com o Que Você Baixou
Pegadinhas que pegam todo mundo uma vez. WARCs Gzipados são multi-membro, um gunzip ingênuo funciona, mas leitores de streaming não devem parar no primeiro membro. Digests se repetem entre capturas, então deduplique antes de contar arquivos ou seus totais vão mentir. Codificações de caracteres de 2004 não são UTF-8; mantenha bytes como bytes até precisar decodificar. E cada URL reescrita pela Wayback dentro do HTML capturado ainda aponta para web.archive.org até você reescrevê-la de volta.
Planeje a estrutura de saída antes de extrair: espelhe os caminhos de URL originais, mantenha um manifesto de qual payload veio de qual registro e nunca sobrescreva uma variante que você possa precisar depois. A Restorix pode exportar exatamente esse tipo de manifesto (JSON ou SQLite) em cada restauração, fazendo manualmente, você entenderá por que esse recurso existe.
Ou Pule a Luta com Formatos Completamente
Tudo acima é aprendível, e nada disso é um bom uso do fim de semana de um empresário. A ferramenta de restauração existe exatamente para essa camada: ela lê os dados CDX, puxa as capturas, deduplica, reescreve links e entrega um site funcional. A estimativa gratuita mostra a contagem de arquivos arquivados, tamanho total e um preço fixo antes de pagar, primeiro arquivo restaurado grátis, pague por arquivo depois, reembolso automático para saldo se algo falhar.
As opções de restauração mapeiam um a um para os pontos problemáticos acima: links internos relativos em vez de URLs do archive.org, conversão HTTPS, remoção de análises e anúncios antigos, mantendo redirecionamentos 301 intactos. A implantação é um clique para SSH/SFTP, FTP/FTPS ou S3 a partir do painel de restauração, e o CMS incluído em /webarchive-cms.php, senha gerada aleatoriamente, modo seguro ativado por padrão, significa que você pode editar o site revivido sem tocar em uma linha de ferramentas WARC. Formatos são para arquivistas. Você quer seu site de volta.
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
FAQ
O que é um arquivo WARC e como abri-lo?
Um WARC é um contêiner padrão ISO de respostas HTTP capturadas, cabeçalhos mais bytes exatos do payload, geralmente gzipado. Abra-o com a biblioteca Python warcio para extrair arquivos, ou reproduza-o como páginas navegáveis com ReplayWeb.page ou pywb. Clicar duas vezes não faz nada; não há visualizador nativo de desktop.
O que significam os campos na saída JSON CDX?
Cada linha é uma captura: urlkey (URL canonizada), timestamp (hora da captura, yyyyMMddhhmmss), original (a URL como rastreada), mimetype, statuscode, digest (hash de conteúdo, digests idênticos significam bytes idênticos) e length (tamanho do registro compactado). Descreve capturas; não contém conteúdo de página em si.
Como obter o arquivo original sem o HTML reescrito da Wayback?
Use o modificador id_: insira-o logo após o timestamp em qualquer URL de snapshot e o arquivo retorna o payload não modificado, sem barra de ferramentas, sem links reescritos. Funciona para páginas, imagens, CSS, qualquer coisa capturada.
Posso converter um download do Archive.org de volta em um site funcional?
Sim, com esforço: enumere capturas via CDX, extraia payloads de buscas WARC ou id_, reescreva links, corrija ativos ausentes e depois implante. Para algumas páginas, é uma noite divertida. Para um site real, um serviço de restauração como a Restorix automatiza toda a cadeia e mostra o preço antes de cobrar qualquer coisa.
Qual é o tamanho típico do download do Archive.org de um site?
Menor do que você teme, geralmente. Um site de brochura de cinco anos e 200 páginas geralmente totaliza 200-800 MB em todas as capturas; deduplicado, o conteúdo único pode ser 60 MB. A listagem CDX mostra os números reais antes de você baixar qualquer coisa, sempre faça o escopo primeiro.
Guias relacionados

download archive org
Como Baixar do Archive.org: Itens, Snapshots e Mais
Todas as formas práticas de baixar conteúdo do Archive.org, arquivos de itens, downloads em massa via CLI e snapshots da Wayback Machine, e como escolher a certa para o seu trabalho.

archive.org download website
Ferramentas para baixar sites do Archive.org: uma comparação honesta
Uma comparação honesta de ferramentas para baixar sites do Archive.org: HTTrack, scripts wayback-machine-downloader e Restorix. Custos reais, esforço e tratamento de arquivos.

wayback download
Wayback Download: Todos os Métodos Classificados por Esforço
Todos os métodos de download do Wayback classificados por esforço: páginas únicas, scripts wget, a API CDX e serviços automatizados que reconstroem o site inteiro para você.

restore website from archive.org
Restaurar um site do Archive.org: faça você mesmo ou pronto para usar?
Devo restaurar um site do Archive.org sozinho ou pagar por um serviço pronto? Uma comparação honesta de custo, tempo, habilidade e risco, com um framework de decisão.
