Como baixar um site do Archive.org: 3 formas que funcionam
Por a equipe editorial da Restorix · 8 de junho de 2026 · 8 min de leitura

Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
O site sumiu. A hospedagem venceu, o cliente nunca fez backup, e a única cópia que sobrou está no Wayback Machine. Já recebi esse telefonema exato mais vezes do que consigo contar, e a primeira pergunta é sempre a mesma: dá para baixar um site do archive.org e recuperá-lo?
Sim, dá. Existem três caminhos realistas: salvar as páginas manualmente, criar scripts usando o índice CDX, ou deixar um serviço automatizado de restauração fazer o crawling para você. Eles diferem enormemente em esforço, e a escolha errada custa um fim de semana. Veja como cada um realmente funciona, com estimativas honestas de tempo de quem faz isso profissionalmente.
O que baixar do Wayback Machine realmente significa
O Wayback Machine não é uma pasta de sites que você pega com um clique. Ele é um índice enorme de capturas individuais: cada página, imagem, folha de estilo e script armazenado separadamente, cada um vinculado ao momento em que foi rastreado. Quando você visualiza uma página antiga, o navegador puxa o HTML de uma captura e as imagens de várias outras, montadas na hora.
Então baixar um site significa enumerar centenas ou milhares de arquivos individuais, buscar cada um e reescrever os links internos para que a cópia funcione fora do archive.org. Mantenha esse modelo em mente, ele explica por que cada método abaixo funciona do jeito que funciona, e por que nenhum deles é um simples botão de download.
Método 1: baixar um site do archive.org página por página, manualmente
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
A abordagem ingênua, e às vezes a certa. Você abre o snapshot no Wayback Machine e salva cada página pelo navegador. Para um site institucional de cinco páginas, isso é honestamente aceitável. Para qualquer coisa maior, é uma forma lenta de punição.
- Abra a página arquivada na data de snapshot que você quer.
- Use Salvar Como e escolha 'Página da Web, Completa' para que os assets venham junto.
- Repita para cada página, incluindo as que só são acessíveis por menus antigos.
- Abra o HTML salvo e remova a marcação da barra de ferramentas do Wayback de cada arquivo.
- Corrija ou aceite as URLs dos assets, que ainda apontam para o web.archive.org.
Duas armadilhas esperam aqui. O HTML salvo faz referência ao web.archive.org em muitos assets, então sua cópia quebra no momento em que você abre offline ou quando o archive está lento. E a marcação da barra de ferramentas embutida em cada página salva precisa ser retirada manualmente, arquivo por arquivo. Ainda uso esse método para páginas únicas, um cliente uma vez precisou só da página antiga de preços para uma disputa jurídica, e um save levou dois minutos. A loja dele com 300 páginas recebeu um tratamento diferente.
- Esforço realista: 5-10 minutos por página, já incluindo a limpeza dos assets.
- Bom para: até cerca de 10 páginas, ou pegar uma página específica para referência.
- Para de funcionar em: dezenas de páginas, ou qualquer trabalho em que você precise da marcação original limpa.

Método 2: baixar um site do archive.org com a API CDX
A API CDX é o endpoint de índice do Wayback Machine, e é como você encontra todos os arquivos que o archive.org guarda para um domínio. Uma consulta retorna o livro-razão completo em JSON:
web.archive.org/cdx/search/cdx?url=example.com/*&output=json&fl=timestamp,original,mimetype,statuscode&filter=statuscode:200&collapse=digest
Isso te dá timestamps, URLs originais e tipos MIME de tudo que foi capturado. O parâmetro collapse deduplica arquivos idênticos, então você não baixa a mesma logo 400 vezes. A partir daí, um script pequeno percorre a lista e busca cada arquivo. Acrescente id_ a uma URL de timestamp, como /web/20150312145531id_/http://example.com/style.css, e o archive.org retorna os bytes originais sem a marcação reescrita. Esse sufixo é a diferença entre uma cópia limpa e uma página cheia de barra de ferramentas.
As partes menos glamorosas são o que devoram sua noite. O archive.org limita clientes agressivos, então o script precisa de delays educados e lógica de retry, ou você vai passar horas encarando respostas 429. URLs com query string precisam ser deduplicadas, senão IDs de sessão transformam um site de 200 páginas em um crawling de 9.000 arquivos. E depois que os arquivos chegam, os links internos ainda apontam para o domínio original, então você precisa de uma passada de reescrita antes da cópia navegar direito offline.
- Esforço realista: 2-4 horas para escrever e depurar o script se você programa com regularidade; um fim de semana se não programa. O crawling em si leva 30-90 minutos para algumas centenas de arquivos.
- Bom para: desenvolvedores, arquivistas, qualquer pessoa que queira controle total sobre cada byte.
- Para de funcionar em: pessoas que nunca abriram um terminal, e prazos medidos em horas.

Seja lá o que você scriptar, teste o resultado como um visitante faria: sirva a pasta com qualquer servidor web local e clique por aí. Caminhos de imagem quebrados, links escapando para a web ao vivo e fontes faltando se anunciam em cinco minutos clicando, e são miseráveis de descobrir depois que você já declarou o trabalho pronto.
Método 3: baixar um site do archive.org do jeito automatizado
A terceira rota deixa um serviço de restauração fazer o crawling, o pareamento de assets e a reescrita de links. É para isso que eu encaminho clientes quando o site importa mais do que a experiência de aprendizado. Com a plataforma Restorix você cola o domínio e recebe um orçamento instantâneo grátis: contagem exata de arquivos arquivados, tamanho total e preço fixo antes de você pagar qualquer coisa. Você escolhe um intervalo de datas, ajusta as opções que quer, e a cópia restaurada chega pronta para navegar, ou vai direto para sua hospedagem via SSH, FTP ou S3.
- Opções que vale conhecer: links internos relativos, remoção de analytics e ads antigos, minificação de JS/CSS, conversão para HTTPS, canonização com ou sem www.
- A restauração pode exportar um manifesto estruturado (JSON ou SQLite) para você saber exatamente o que voltou.
- Restaurações que falham são reembolsadas automaticamente para seu saldo, sem abrir ticket de suporte.
A contrapartida é óbvia: custa dinheiro. Você paga por arquivo restaurado, o primeiro arquivo é grátis, e o preço é travado no momento do orçamento. Para um blog pessoal, talvez você prefira scriptar. Para uma loja WooCommerce de um cliente que gera receita e precisa voltar hoje à noite, o custo costuma ser o item mais barato de todo o incidente. Os deploys também incluem um CMS pequeno em arquivo único, então ajustes pontuais de texto depois da restauração não exigem reupload de nada.
Tempo e esforço, lado a lado
| Método | Seu tempo | Habilidade técnica | Tamanho ideal |
|---|---|---|---|
| Salvando páginas manualmente | 5-10 min por página | Nenhuma | 1-10 páginas |
| Script com a API CDX | 3-6 horas no total | Confortável com código | 10-1.000 páginas |
| Restauração automatizada | Cerca de 15 minutos clicando | Nenhuma | Qualquer tamanho, especialmente 100+ páginas |
Repare que a tabela mede o seu tempo, não o tempo da máquina. Um script ou serviço pode mastigar um crawling grande por horas, mas mastiga enquanto você dorme. O recurso escasso em qualquer restauração é a noite da pessoa que está fazendo, então é isso que eu precifico.
Erros que queimam tardes inteiras
- Confiar nos saves do navegador para sites inteiros. Você vai perder toda página que não abriu manualmente, e sites antigos escondem páginas em lugares que você já esqueceu que existiam.
- Ignorar o modificador id_, e depois se perguntar por que todo arquivo HTML tem a barra de ferramentas do Wayback embutida.
- Saturar o archive.org com requisições paralelas. Você leva limitação, e um trabalho de uma hora vira quatro.
- Pular a passada de reescrita de links. A cópia parece ok até você clicar em qualquer coisa.
- Assumir que toda página foi arquivada. Confira o inventário do CDX primeiro, para que as lacunas sejam uma quantidade conhecida, e não uma surpresa no final.
Qual método você deve escolher?
Menos de dez páginas: salve manualmente e aceite as marcas da marcação. Você programa e quer controle: monte o script do CDX e separe uma noite. Você precisa do site de volta, limpo, sem virar um arquivista nas horas vagas: vá pela rota automatizada, o tutorial mostra uma restauração completa em poucos minutos, e o orçamento grátis te diz a contagem de arquivos e o preço antes de qualquer compromisso.
Última coisa: seja qual for a rota, faça agora. O archive.org é um presente, mas já teve quedas e pressões jurídicas antes, e 'depois eu baixo' é exatamente assim que sites se perdem duas vezes.
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
FAQ
É grátis baixar um site do archive.org?
O próprio archive é grátis para navegar, e o salvamento manual ou scripts com o CDX não custam nada além do seu tempo. Serviços automatizados de restauração cobram por arquivo restaurado; a Restorix mostra o preço exato e travado no orçamento grátis antes de você pagar, e o primeiro arquivo é de graça.
É legal baixar um site do archive.org?
Baixar o seu próprio site, ou o site de um cliente com permissão, é prática padrão e o que a maioria das restaurações é. Para conteúdo de terceiros, uma cópia serve para referência pessoal ou pesquisa, mas republicar material protegido por direitos autorais que você não possui pode te trazer problemas. Na dúvida, pergunte a um advogado, não a uma seção de comentários.
Por que minha página salva ainda carrega imagens do web.archive.org?
Porque o Wayback Machine reescreve as URLs dos assets no HTML para apontar para os próprios servidores dele, e um save do navegador mantém essas URLs absolutas. Buscar os arquivos com o modificador id_, ou rodar uma passada de reescrita de links depois, te dá uma cópia autossuficiente.
Consigo baixar um site do archive.org sem programar?
Sim. Saves manuais pelo navegador não precisam de código nenhum, e serviços automatizados de restauração fazem o trabalho de scripting para você. A rota da API CDX é a única que realmente exige programação.
Quanto tempo leva para baixar um site do archive.org?
O salvamento manual leva 5-10 minutos por página. Um script CDX leva algumas horas para configurar, e depois 30-90 minutos para rastrear um site de médio porte. Uma restauração automatizada leva minutos do seu tempo; quem espera são as máquinas.
Guias relacionados

download entire website from archive org
Baixe um site inteiro do Archive.org, não apenas a página inicial
Para baixar um site inteiro do archive.org você precisa de cada página, imagem e folha de estilo. Os assets se escondem sob timestamps diferentes, veja por que, além de um checklist completo.

archive.org download website
Ferramentas para baixar sites do Archive.org: uma comparação honesta
Uma comparação honesta de ferramentas para baixar sites do Archive.org: HTTrack, scripts wayback-machine-downloader e Restorix. Custos reais, esforço e tratamento de arquivos.

wayback machine downloader
Ferramentas de download do Wayback Machine: o que realmente funciona
Uma análise honesta das ferramentas de download do Wayback Machine: os scripts de código aberto, seus limites reais e a opção pronta para colocar seu site de volta no ar.

restore website from archive.org
Restaurar um site do Archive.org: faça você mesmo ou pronto para usar?
Devo restaurar um site do Archive.org sozinho ou pagar por um serviço pronto? Uma comparação honesta de custo, tempo, habilidade e risco, com um framework de decisão.
