Ferramentas para baixar sites do Archive.org: uma comparação honesta
Por a equipe editorial da Restorix · 7 de julho de 2026 · 7 min de leitura

Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
Existem três maneiras sensatas de extrair um site do Wayback Machine, e já usei todas em trabalhos reais: HTTrack, o gem Ruby wayback-machine-downloader e seus scripts derivados, e o Restorix, o serviço que recomendo aos clientes quando o site precisa voltar funcionando, não apenas como um monte de arquivos.
Nenhum deles é 'o melhor'. Resolvem problemas diferentes a preços diferentes, e o preço é pago principalmente em horas, não em dinheiro. Veja o que cada um realmente faz, onde tropeça e quem deve escolher qual. Sem ranqueamento com sabor de afiliado, apenas o que vi dar certo e errado.
O que uma ferramenta para baixar sites do Archive.org precisa acertar
Julgar essas ferramentas pela velocidade de download é perder o foco. As partes difíceis de baixar um site do Archive.org são pouco glamorosas e é nelas que as ferramentas se diferenciam discretamente:
- Encontrar todos os arquivos. O índice do Archive é a única fonte completa, seguir links a partir da página inicial deixa para trás todas as páginas órfãs.
- Combinar recursos de diferentes timestamps. A página de 2014 pode precisar do logo cuja única captura sobrevivente é de 2012.
- Obter os bytes originais. Sem cuidado, você salva a marcação da barra de ferramentas do Wayback embutida em cada arquivo HTML.
- Reescrever links internos para que a cópia navegue sem depender dos servidores do Archive.org.
- Sobreviver ao controle de tráfego. O Archive.org limita a taxa de requisições de clientes impacientes, e as novas tentativas precisam ser educadas e pacientes.
Tenha esses cinco pontos em mente. Eles explicam cada linha da tabela comparativa abaixo, e a maioria das críticas negativas que essas ferramentas recebem remonta a um deles.
HTTrack: gratuito, à moda antiga e ainda na ativa
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
HTTrack é o veterano: um navegador offline gratuito e de código aberto que espelha sites desde os anos 1990. Aponte-o para uma URL do Wayback Machine e ele segue os links, salvando o que encontra no disco. Tem interface gráfica para Windows, o preço é justo e, para um espelho rápido de um site pequeno, realmente funciona.
Usado contra o Archive.org, as ressalvas se acumulam. O HTTrack não sabe nada sobre o índice do Archive, ele só encontra páginas acessíveis seguindo links a partir da URL inicial, então páginas órfãs ficam para trás. Ele pega qualquer captura para a qual o Wayback redireciona, misturando timestamps sem avisar. E suas regras de filtro exigem ajuste real: configure errado e seu espelho de um blog de 2013 sai por um link para a web ao vivo, e você baixa o site atual em vez disso. Pergunte como eu sei.
Um benchmark realista: espelhar um blog WordPress de 2012 com 40 páginas pelo Wayback Machine me tomou cerca de 40 minutos de configuração e duas horas de rastreamento desacompanhado, e ainda gastei mais uma hora limpando intrusos da web ao vivo da pasta. Esse é o formato honesto de um trabalho com HTTrack, barato, quase todo automático, e nunca totalmente concluído quando o rastreamento termina.
- Custo: gratuito.
- Esforço: uma ou duas horas para aprender a sintaxe dos filtros; os espelhos depois rodam sozinhos.
- Ideal para: espelhos rápidos de sites pequenos e bem interligados quando a fidelidade perfeita não é o objetivo.
- Cuidado com: desviar para a web ao vivo, timestamps de captura misturados e URLs reescritas pelo Wayback parando nos seus arquivos.

wayback-machine-downloader e a rota dos scripts
wayback-machine-downloader é um gem Ruby que consulta o índice CDX do Archive e baixa todos os arquivos listados para o seu domínio, opcionalmente dentro de um intervalo de datas. Como ele lê o índice em vez de seguir links, encontra páginas que o HTTrack nunca vê. Vários scripts Python que circulam pelo GitHub fazem o mesmo trabalho com flags diferentes e níveis variados de polimento.
As contrapartidas são as de sempre no código aberto. Você precisa ter Ruby ou Python instalado e confiança para ler um README. Projetos nesse nicho ficam parados por anos a fio, então verifique o rastreador de issues antes de apostar um prazo em um deles. E quando o rastreamento termina, o trabalho de montagem é seu: links internos ainda apontam para o domínio original, os timestamps das capturas precisam de verificação de sanidade, e qualquer limpeza, remover tags antigas de analytics, corrigir URLs canônicas, converter para HTTPS, é sua tarde de sábado.
- Custo: gratuito, mais suas horas.
- Esforço: meio dia se você se sente à vontade no terminal; o rastreamento em si roda sozinho depois.
- Ideal para: desenvolvedores e arquivistas que querem controle total sobre cada byte e gostam de tê-lo.
- Cuidado com: rastreamentos limitados sem lógica de retentativa, reescrita de links deixada como lição de casa e lacunas de manutenção no repositório.
Dois hábitos tornam a rota dos scripts suportável. Guarde a resposta CDX com a qual você começou, ela serve de manifesto quando alguém perguntar o que deveria estar na pasta. E sirva o resultado localmente antes de dar por encerrado: cinco minutos clicando pela cópia no localhost encontram recursos faltantes mais rápido que qualquer arquivo de log.
Restorix: a opção pronta para baixar sites do Archive.org
Restorix fica na ponta paga e pronta para uso do espectro, e foi construído especificamente para restaurações do Archive.org, não para raspagem genérica. Você insere o domínio e recebe uma estimativa instantânea gratuita: contagem exata de arquivos arquivados, tamanho total e preço travado. Escolhe um intervalo de datas e suas opções, links internos relativos, remoção de analytics e anúncios, conversão para HTTPS, minificação de JS/CSS, canonicalização www ou sem www, e o serviço cuida da enumeração do índice, combinação de recursos entre timestamps, controle de tráfego e reescrita de links.
O resultado é baixado como uma cópia limpa e navegável, ou implantado diretamente na sua hospedagem via SSH/SFTP, FTP/FTPS ou S3, com um pequeno CMS de arquivo único incluído para editar as páginas restauradas depois. Você paga por arquivo restaurado, o primeiro arquivo é gratuito e restaurações malsucedidas são reembolsadas automaticamente para o seu saldo. Não há assinatura, as recargas são avulsas, por cartão ou criptomoeda. Não é a rota do hobbysta, e nem tenta ser.

Ferramentas para baixar sites do Archive.org, lado a lado
| HTTrack | Scripts (gem / Python) | Restorix | |
|---|---|---|---|
| Preço | Gratuito | Gratuito | Pague por arquivo, primeiro arquivo grátis |
| Encontra páginas não vinculadas | Não, segue apenas links | Sim, lê o índice CDX | Sim, lê o índice CDX |
| Combinação de recursos entre timestamps | Não | Parcial | Sim |
| Bytes originais sem marcação da barra de ferramentas | Não | Sim, com as flags certas | Sim |
| Links internos reescritos | Parcial | Você mesmo os reescreve | Sim, links relativos opcionais |
| Implanta na sua hospedagem | Não | Não | Sim, SSH, FTP, S3 |
| Esforço típico seu | Horas de ajuste de filtros | Meio dia mais montagem | Cerca de 15 minutos |
| Ideal para | Espelhos rápidos de sites pequenos | Desenvolvedores que querem controle | Colocar o site de volta no ar |
Leia a linha do esforço duas vezes. Todas as ferramentas desta lista podem produzir a mesma pasta de arquivos no final, o que você realmente está escolhendo é quem faz os 20% mais chatos do trabalho: você ou outra coisa.
Mais uma linha que a tabela não comporta: risco. Com as ferramentas gratuitas, um trabalho malfeito custa outra noite. Com um serviço pago, procure os termos de falha, reembolsos automáticos para o saldo, preço travado antes de começar e estimativa gratuita significam que o risco financeiro de uma restauração malsucedida fica praticamente em zero.
Qual você deve escolher?
Orientação honesta. Se você precisa espelhar um site pequeno para referência e gosta de ferramentas gratuitas, o HTTrack o terá no seu disco ainda hoje. Se você escreve código, quer os arquivos brutos e tem um fim de semana para gastar, a rota do gem é genuinamente boa e genuinamente gratuita. Se o site é um ativo de negócio, a loja WooCommerce de um cliente, um fórum com dez anos de postagens, o trabalho da sua vida, pague a taxa por arquivo e passe sua noite com outra coisa. O tutorial mostra o fluxo completo de restauração antes de você gastar um centavo, e a estimativa gratuita permite ver o preço exato antes de decidir qualquer coisa.
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
FAQ
Existe um recurso oficial para baixar sites do Archive.org?
Não. O Wayback Machine foi feito para navegar em capturas individuais, e o Archive.org não oferece exportação do site inteiro. Todo método em massa, HTTrack, scripts de download, serviços de restauração, é uma ferramenta de terceiros que lê as mesmas capturas públicas e o mesmo índice público.
HTTrack ou wayback-machine-downloader é melhor para o Archive.org?
Trabalhos diferentes. O HTTrack rastreia links e serve para espelhos pequenos e simples. O wayback-machine-downloader lê o índice do Archive, então encontra páginas não vinculadas e lida corretamente com intervalos de datas. Para qualquer coisa maior que algumas dezenas de páginas, a abordagem baseada em índice ganha.
Quanto custa restaurar um site com o Restorix?
Você paga uma pequena taxa fixa por arquivo restaurado, com o primeiro arquivo grátis e o preço travado no momento da estimativa, assim você vê o total exato para o seu site específico antes de pagar nada. As recargas são avulsas, por cartão ou criptomoeda, e existem códigos promocionais. Nada é recorrente.
Essas ferramentas podem colocar o site de volta na minha hospedagem ou apenas baixar arquivos?
O HTTrack e os scripts param nos arquivos no seu disco; fazer upload, corrigir links e configurar a hospedagem é com você. O Restorix pode implantar a cópia restaurada diretamente em servidores SSH/SFTP, hospedagem compartilhada FTP/FTPS ou S3, e inclui um CMS simples para editar as páginas depois.
Preciso saber todas as URLs antigas antes de baixar?
Não. Ferramentas baseadas em índice enumeram todas as URLs capturadas a partir da API CDX, então você só precisa do domínio. Rastreadores de links como o HTTrack precisam apenas de uma URL inicial, mas perderão qualquer coisa que não estivesse linkada de algum lugar que o rastreamento pudesse alcançar.
Guias relacionados

wayback machine downloader
Ferramentas de download do Wayback Machine: o que realmente funciona
Uma análise honesta das ferramentas de download do Wayback Machine: os scripts de código aberto, seus limites reais e a opção pronta para colocar seu site de volta no ar.

web downloader
Ferramentas de Web Downloader Comparadas: O Que Salvam e Quebram
Como um web downloader funciona, o que HTTrack, wget, SiteSucker e o salvamento do navegador realmente preservam, o que cada um quebra e quando a restauração é a melhor escolha.

download a website from archive org
Como baixar um site do Archive.org: 3 formas que funcionam
Três formas comprovadas de baixar um site do archive.org: salvar páginas manualmente, usar scripts na API CDX ou rodar uma restauração automatizada. Estimativas realistas de tempo para cada uma.
