Ferramentas de download do Wayback Machine: o que realmente funciona
Por a equipe editorial da Restorix · 9 de maio de 2026 · 8 min de leitura

Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
Pesquise por um downloader do Wayback Machine e você vai cair nos mesmos nomes de sempre, usados há uma década, além de um cemitério de repositórios abandonados no GitHub. Algumas dessas ferramentas realmente funcionam. Todas esbarram no mesmo teto. Esta é a análise que eu gostaria de ter lido antes do meu primeiro trabalho de restauração: o que os scripts de código aberto fazem, onde eles param e o que usar quando a pasta de arquivos não é o suficiente.
O que um downloader do Wayback Machine realmente faz
Todo downloader do Wayback Machine funciona da mesma forma. Ele consulta a API CDX para obter uma lista de capturas, percorre essa lista e salva cada arquivo a partir da URL com timestamp. As versões mais caprichadas adicionam filtros por data e tipo de arquivo, além de lógica de repetição para quando o archive.org começa a limitar as requisições. Nenhuma delas acessa um backup secreto do seu site. Elas raspam o mesmo arquivo público que você pode abrir no navegador agora.
Essa distinção importa mais do que qualquer lista de recursos. Um downloader herda todas as lacunas do arquivo: as páginas que nunca foram rastreadas, as imagens que nunca foram capturadas, o diretório bloqueado por um robots.txt que alguém configurou errado em 2015. A ferramenta só pode buscar o que existe.
Os números também crescem rápido. Um site modesto de 200 páginas, quando você conta imagens, folhas de estilo e scripts, facilmente vira 2.000 arquivos. Com uma requisição por segundo, isso dá mais de meia hora só de download, sem contar as repetições, os bloqueios e os arquivos que retornam 404 porque o arquivo perdeu a cópia anos atrás.
As opções de código aberto
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
Três nomes aparecem em todo fórum, e por bons motivos:
- wayback-machine-downloader, uma gem Ruby. A mais conhecida. Com um comando, wayback_machine_downloader http://example.com --from 2015 --to 2019, ela preenche uma pasta./websites com todas as capturas correspondentes. Tem flag de concorrência e filtros por extensão de arquivo.
- waybackpack, uma ferramenta em Python. Baixa capturas organizadas por timestamp, o que a torna boa para puxar um snapshot específico de uma página, mas não tão voltada para espelhar sites inteiros.
- HTTrack apontado para a URL de um snapshot. Nem é uma ferramenta de arquivo propriamente dita. Ele segue os links reescritos que o Wayback Machine injeta nas páginas e arrasta uma árvore inteira de capturas. É tosco, às vezes funciona em sites pequenos e se perde completamente com query strings.
As três são gratuitas. As três são mantidas em ritmo de hobby. E as três entregam uma pasta cheia de arquivos. O que acontece depois é problema seu, e essa frase resume uns oitenta por cento do que vem a seguir. Antes de instalar qualquer uma, leia as issues abertas no repositório. Dez minutos ali ensinam mais do que qualquer post comparativo.

O que esperar de um script gratuito de download do Wayback Machine
Acerte as expectativas antes de rodar qualquer coisa. Uma primeira tentativa típica com um downloader gratuito é assim: trinta minutos brigando com a instalação do Ruby ou Python, alguns minutos de progresso promissor, e então o archive.org começa a responder com erros 429 e tudo fica arrastado. Um site com 5.000 arquivos, em um ritmo educado, é trabalho para a madrugada, e trabalhos de madrugada falham silenciosamente às 3 da manhã.
Um primeiro teste realista
- Instale o runtime e a ferramenta. Depure os conflitos de versão que ninguém menciona no README.
- Faça um teste pequeno em um diretório do site para confirmar o formato de saída.
- Lance o download completo e veja os primeiros cem arquivos chegarem.
- Atinge o limite de requisições, reduza a concorrência, reinicie e torça para que a lógica de retomada funcione.
- Abra a pasta de saída e descubra o lixo que veio junto com o ouro.
A saída sempre precisa de triagem. A menos que você tenha filtrado bem, recebe todas as capturas de cada URL: lixo de parâmetros de rastreamento, versões de impressão, páginas de erro que retornaram status 200. E, a não ser que a ferramenta tenha buscado as variantes id_ (os bytes originais, sem modificação), todo arquivo HTML vem com os links reescritos e a barra de ferramentas do Wayback ainda incrustados.
Outra surpresa é a organização. A maioria dos scripts joga tudo em caminhos com timestamp que espelham o arquivo, não a estrutura original de diretórios. Reconstruir a árvore de pastas real e renomear os arquivos de volta ao que o servidor chamava é trabalho manual que ninguém coloca no orçamento.
Os limites que você vai encontrar
- Sem lógica de restauração. Um downloader busca arquivos. Ele não remove a barra do Wayback, não conserta links internos, não escolhe um host canônico nem converte nada para HTTPS.
- Sem inteligência de deduplicação. A mesma imagem salva sob seis timestamps vira seis arquivos, a menos que você mesmo colapse por hash de conteúdo.
- Limites de requisição. Force demais e o archive.org limita ou bloqueia você por um tempo. Reexecuções são parte normal do fluxo, não sinal de que você fez algo errado.
- Apodrecimento de dependências. Scripts presos a versões antigas de Ruby ou Python quebram em sistemas modernos. Verifique a data do último commit no repositório antes de instalar qualquer coisa.
- Sem suporte. Quando a ferramenta quebra, o rastreador de issues é o suporte, e a última resposta pode ser de dois anos atrás.
- Sem linha de chegada. Quando o script termina, você tem uma pasta. Transformar essa pasta em um site hospedado e funcional é um segundo projeto de tamanho semelhante.

A alternativa pronta para usar
A alternativa a ficar de babá de scripts é um serviço que trata o download como o primeiro passo de uma restauração, não como o trabalho inteiro. O serviço de restauração de sites começa com uma estimativa gratuita: contagem exata de arquivos arquivados, tamanho total e um preço fixo antes de você pagar um centavo. A partir daí, ele baixa tudo, limpa e pode implantar diretamente na sua hospedagem via SSH, FTP ou S3.
Os detalhes são pensados para esse trabalho específico. Você paga por arquivo restaurado, com o primeiro grátis. Se uma restauração ou implantação falhar, o reembolso cai automaticamente no seu saldo, sem precisar abrir chamado. As opções de restauração removem analytics e anúncios, reescrevem links para caminhos relativos e forçam HTTPS. As implantações incluem um pequeno CMS de arquivo único com senha de admin gerada, para que o site restaurado continue editável. Nada de assinatura: você recarrega um saldo e gasta.
Quando um downloader do Wayback Machine é a ferramenta errada
Um script de download é a ferramenta certa para arquivos offline, conjuntos de dados de pesquisa e para resgatar uma pasta de PDFs antigos. É a ferramenta errada quando:
- O site precisa voltar ao ar e parecer correto ao fazer isso
- A pessoa que fará o trabalho nunca vai abrir um terminal
- O arquivo contém dezenas de milhares de URLs, metade delas lixo de query string
- Há um prazo: um relançamento, uma solicitação legal, um cliente respirando no seu pescoço
Nesses casos, o script não é mais barato que o serviço. Ele só esconde a conta nas suas horas. Uma estimativa do Restorix pelo menos informa o preço real antecipadamente, antes de você comprometer um fim de semana para descobrir da pior forma. Nada disso torna os scripts ruins. Apenas os torna ferramentas com uma descrição de cargo, e a descrição de cargo termina na pasta.
Como escolher
| Sua situação | Ferramenta certa | Por quê |
|---|---|---|
| Precisa de um snapshot para referência | Navegador + o truque da URL id_ | Dois minutos, sem instalação |
| Site pequeno, confortável com linha de comando | Gem wayback-machine-downloader | Grátis, testada, bons filtros |
| Arquivos específicos em grande volume | API CDX + seu próprio script | Controle total sobre a filtragem |
| O site precisa reviver | Restorix | Download, limpeza e implantação em um único trabalho |
Escolha pelo destino, não pelo download. Se uma pasta de arquivos é o objetivo, as ferramentas gratuitas cumprem seu papel e sempre cumprirão. Se o site em si é o objetivo, pule a etapa da pasta e vá direto para o que o reconstrói.
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
FAQ
Existe um downloader oficial do Wayback Machine?
Não. O Internet Archive mantém o Wayback Machine e fornece a API CDX, mas não oferece nenhum downloader em massa oficial. Toda ferramenta nesse espaço é de terceiros e construída sobre os mesmos endpoints públicos que você mesmo pode consultar.
A gem Ruby wayback-machine-downloader é segura?
É um projeto de código aberto de longa data e seguro no sentido comum: leia o código, instale a partir do repositório canônico e desconfie de pacotes parecidos com nomes semelhantes. O risco prático maior é um fork desatualizado que falha silenciosamente no meio de um site grande.
Por que meu download travou no meio?
Quase sempre é limite de requisições. O archive.org responde a clientes agressivos com erros 429. Reduza a concorrência, adicione atrasos entre as requisições e retome. A maioria das ferramentas consegue continuar de onde parou, então uma travada custa tempo, não progresso.
Um downloader consegue pegar páginas protegidas por senha ou excluídas?
Não para senhas: o rastreador nunca passou do login, então não há nada para baixar. Sim para páginas excluídas: a exclusão da web ativa é exatamente o que o arquivo protege, desde que um rastreamento tenha ocorrido antes da exclusão.
Aplicativos pagos de download são melhores que os scripts gratuitos?
Às vezes, são os scripts gratuitos com uma interface acoplada. Julgue pela saída, não pelo preço: você recebe arquivos id_ originais, deduplicação sensata e links limpos, ou uma pasta de HTML reescrito? Um serviço de restauração pula a pergunta completamente ao entregar um site pronto em vez de arquivos.
Como transformar os arquivos baixados de volta em um site funcional?
Remova as reescritas do Wayback, torne os links internos relativos, escolha um host canônico, depois implante e teste. Ou deixe um serviço de restauração fazer as quatro etapas para você, que é exatamente o motivo de esses serviços existirem.
Guias relacionados

wayback download
Wayback Download: Todos os Métodos Classificados por Esforço
Todos os métodos de download do Wayback classificados por esforço: páginas únicas, scripts wget, a API CDX e serviços automatizados que reconstroem o site inteiro para você.

wayback machine download site
Baixe um site inteiro do Wayback Machine
Como baixar um site inteiro do Wayback Machine: armadilhas do crawler, páginas com query string, ativos ausentes e quando uma restauração automatizada supera scripts caseiros.

restore website from wayback machine
Restaurar um Site a partir do Wayback Machine: Guia Completo
Restaure um site a partir do Wayback Machine de ponta a ponta: escolha o snapshot certo, defina as opções de restauração e implante um site funcional com CMS em menos de uma hora.
