Baixe um site inteiro do Archive.org, não apenas a página inicial
Por a equipe editorial da Restorix · 15 de julho de 2026 · 8 min de leitura

Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
Qualquer um pode salvar uma página inicial. A página inicial é a parte fácil, são os 4.000 arquivos por trás dela que separam 'peguei uma cópia' de 'realmente tenho o site'. Quando alguém me pede para baixar um site inteiro do archive.org, a página inicial geralmente já está na área de trabalho, mas a folha de estilo não.
Este artigo é sobre a palavra 'inteiro'. O que uma cópia completa realmente inclui, por que o arquivo espalha seus assets por anos de timestamps diferentes e um checklist que você pode executar no final para provar que conseguiu tudo, em vez de esperar que sim.
O que 'inteiro' significa ao baixar um site inteiro do archive.org
Uma cópia completa tem quatro camadas, e a maioria das pessoas para depois da primeira. O HTML de cada página que existiu. Os assets que cada página referencia: imagens, folhas de estilo, JavaScript, fontes, PDFs, vídeos. Links internos reescritos para que a cópia navegue por conta própria, sem depender dos servidores do archive.org. E um manifesto do que foi capturado, para que as lacunas sejam documentadas em vez de descobertas depois por um cliente.
- Páginas: cada URL que o crawler já viu, não apenas as do menu principal. Sites antigos escondem seções inteiras atrás de links de rodapé esquecidos.
- Assets: imagens, CSS, JS, fontes e arquivos para download, na maioria dos sites, eles superam as páginas em cinco para um.
- Links: reescritos para caminhos relativos, ou sua cópia só funciona enquanto o archive.org funcionar.
- Um manifesto: uma lista arquivo por arquivo do que você tem, transformando 'acho que peguei tudo' em algo verificável.
A contagem de arquivos surpreende as pessoas. Um site empresarial modesto de 50 páginas normalmente totaliza 400 a 800 arquivos. Um fórum phpBB de 2009 com avatares de usuários e anexos pode chegar a dezenas de milhares. Planeje pela contagem de arquivos, não pela de páginas.
Também há diferença entre uma cópia que navega e uma cópia que reimplanta. Uma cópia de navegação só precisa dos arquivos e links funcionando. Uma cópia que você pretende colocar de volta em uma hospedagem exige mais: URLs canônicas consistentes (escolha www ou sem www), referências prontas para HTTPS e peso morto como scripts de analytics de uma década removidos. Decida qual das duas você está construindo antes de começar, porque adaptar qualquer uma depois é tedioso.
Por que os assets ficam sob timestamps diferentes
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
A Wayback Machine não fotografa um site inteiro em uma tarde. Seus crawlers buscam o que conseguem alcançar, quando conseguem alcançar. Sua página inicial de 2014 pode referenciar um logotipo capturado pela última vez em 2012, uma folha de estilo capturada seis vezes ao longo de cinco anos e uma imagem principal nunca capturada. Quando você visualiza essa página, o archive.org substitui silenciosamente a captura mais próxima que possui para cada asset. É por isso que a página parece boa no seu navegador, mesmo que suas partes estejam espalhadas por uma década.
Duas consequências decorrem disso. Primeiro, não existe um único 'timestamp do site' para o qual você possa apontar um downloader, um download completo puxa cada arquivo de sua própria melhor captura. Segundo, o truque da captura mais próxima esconde lacunas: o Wayback servirá alegremente uma imagem de 2016 na sua página de 2014 sem mencionar. Inofensivo para navegação casual, mas vale saber quando você se importa se a página restaurada é realmente a de 2014.
Uma página arquivada é uma colagem. O HTML, as imagens e o CSS foram congelados em momentos diferentes, e o arquivo os cola novamente toda vez que alguém olha.

Qualquer ferramenta ou script que você usar precisa de uma estratégia para isso. A estratégia preguiçosa, buscar tudo em um único timestamp, é exatamente como você acaba com uma página cheia de ícones de imagem quebrada, porque metade dos assets simplesmente não tem captura naquela semana. A estratégia certa é por arquivo: pegue cada asset de sua própria captura boa mais próxima dentro do seu intervalo de datas.
Como baixar um site inteiro do archive.org: comece pelo inventário
Antes de buscar um único arquivo, liste o que o arquivo realmente contém. A API CDX fornece o livro-razão completo de um domínio: cada URL capturada com seus timestamps, tipo MIME e status HTTP. Filtre por statuscode 200, colapse resumos de conteúdo duplicados e você terá uma lista de compras realista em vez de um palpite.
Leia o inventário antes de baixar e você descobre as coisas desconfortáveis cedo. Naquele trabalho do fórum phpBB, a listagem CDX mostrou 11.000 URLs capturadas, e cerca de 3.000 delas eram o mesmo GIF de avatar salvo sob diferentes strings de consulta. Colapsar duplicatas transformou um trabalho assustador em algo comum. A mesma listagem também expõe as páginas que nunca foram capturadas, as quais nenhum método de download no mundo pode trazer de volta. Melhor saber disso no primeiro dia.
Agrupe os sobreviventes por tipo MIME e o formato do trabalho aparece: quantas páginas HTML, quantas imagens, quanto JavaScript, se há PDFs ou vídeos para se preocupar. Esse agrupamento orienta tanto sua ordem de download quanto sua verificação final de completude.
Checklist para baixar um site inteiro do archive.org sem lacunas
- Puxe o inventário CDX para o domínio, filtrado para capturas HTTP 200, cobrindo todo o seu intervalo de datas.
- Colapse resumos de conteúdo duplicados para que arquivos idênticos sejam baixados uma vez em vez de centenas de vezes.
- Agrupe a lista por tipo MIME: páginas HTML primeiro, depois CSS, JS, imagens, fontes, documentos, mídia.
- Baixe cada arquivo de sua própria melhor captura, usando o modificador id_ para obter os bytes originais sem a marcação injetada pelo Wayback.
- Reescreva links internos para caminhos relativos para que a cópia funcione em qualquer host, incluindo seu laptop.
- Sirva a pasta localmente e navegue por ela. Links quebrados, imagens faltando e erros 404 de fontes aparecem em minutos.
- Compare a contagem final de arquivos com o inventário e anote o que está faltando e por quê.

Esse último passo é o que todo mundo pula, e é a diferença entre um backup e uma pilha de arquivos. Um manifesto transforma 'acho que peguei tudo' em uma lista que você pode auditar. O software de restauração incorpora isso: a estimativa gratuita informa a contagem exata de arquivos arquivados e o tamanho total antes de você começar, e a restauração pode exportar um manifesto JSON ou SQLite de cada arquivo que trouxe de volta, para que a completude seja um número, não uma sensação.
As lacunas que você encontrará de qualquer forma
- Páginas que o crawler nunca encontrou. Se nada na web pública linkava para uma página, o Wayback provavelmente nunca a viu.
- Exclusões do robots.txt. Crawls mais antigos pulavam completamente caminhos não permitidos, e alguns sites bloqueavam o arquivamento de propósito.
- Conteúdo renderizado por JavaScript. Os crawlers historicamente armazenavam o esqueleto HTML, não o que os scripts construíam depois.
- Logins, carrinhos e resultados de busca. Qualquer coisa por trás de uma requisição POST ou de uma sessão é uma parede que o crawler não conseguia atravessar.
- Ruído de URL. IDs de sessão e parâmetros de rastreamento inflam o inventário com milhares de 'páginas' duplicadas que se reduzem a algumas reais após a deduplicação.
Nenhum desses é falha do seu método, são buracos no próprio arquivo. O valor do inventário é que ele mostra os buracos antes de você prometer a alguém uma restauração completa.
Quando você encontrar buracos, documente-os. Uma nota de uma página listando as doze páginas que nunca foram capturadas, o vídeo que só existe como miniatura e a seção do fórum bloqueada pelo robots.txt transforma uma surpresa desagradável em uma expectativa gerenciada. Clientes perdoam arquivos faltantes. Eles não perdoam descobri-los por conta própria.
O que vale uma cópia completa
Se o site é a loja de um cliente ou um fórum comunitário com uma década de postagens, um download pela metade é uma responsabilidade disfarçada de backup. Ou reserve horas para executar o checklist você mesmo, ou entregue o rastreamento, a correspondência de timestamps, a reescrita de links e a geração de manifesto para uma ferramenta feita exatamente para esse trabalho. A estimativa não custa nada, e a alternativa é encontrar as 300 imagens faltando depois que o site entrar no ar.
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
FAQ
Posso baixar um site inteiro do archive.org com um clique?
O próprio Archive.org não oferece exportação do site inteiro, ele é feito para navegar por capturas únicas. Resultados com um clique vêm de ferramentas que enumeram o índice do arquivo e buscam cada arquivo: scripts como wayback-machine-downloader, ou serviços de restauração como o Restorix, que também lidam com assets, reescrita de links e o manifesto.
Por que as imagens estão faltando depois que baixo um site inteiro do archive.org?
Geralmente por um de dois motivos. Ou a imagem nunca foi rastreada, então não existe cópia em lugar nenhum, ou sua ferramenta buscou a página de um timestamp enquanto a única captura sobrevivente da imagem está em outro. A correspondência de assets entre timestamps resolve o segundo caso; nada resolve o primeiro.
A Wayback Machine arquiva todas as páginas de um site?
Não. Ela arquiva o que seus crawlers conseguiram alcançar: páginas linkadas de algum lugar, permitidas pelo robots.txt, renderizadas sem logins ou JavaScript pesado. Tópicos profundos de fóruns, páginas de busca facetada e áreas administrativas estão rotineiramente ausentes. O inventário CDX mostra exatamente o que existe antes de você começar.
Quantos arquivos um download completo de site geralmente envolve?
Mais do que as pessoas esperam. Um site empresarial modesto de 50 páginas geralmente totaliza de 400 a 800 arquivos quando você conta imagens, folhas de estilo, scripts e fontes. Fóruns e lojas chegam a dezenas de milhares. A contagem de arquivos, não a de páginas, é o que determina o tempo e o custo do download.
PDFs, vídeos e outros downloads estão incluídos no arquivo?
Frequentemente, sim. O arquivo armazena documentos e mídia que conseguiu alcançar, e o índice CDX os lista por tipo MIME junto com as páginas. Vídeos grandes são a exceção, eles foram rastreados de forma inconsistente, então verifique-os no inventário em vez de presumir que sobreviveram.
Guias relacionados

download a website from archive org
Como baixar um site do Archive.org: 3 formas que funcionam
Três formas comprovadas de baixar um site do archive.org: salvar páginas manualmente, usar scripts na API CDX ou rodar uma restauração automatizada. Estimativas realistas de tempo para cada uma.

archive.org download website
Ferramentas para baixar sites do Archive.org: uma comparação honesta
Uma comparação honesta de ferramentas para baixar sites do Archive.org: HTTrack, scripts wayback-machine-downloader e Restorix. Custos reais, esforço e tratamento de arquivos.

find all pages on a website
Como encontrar todas as páginas de um site (mesmo as excluídas)
Precisa encontrar todas as páginas de um site, incluindo aquelas para as quais ninguém aponta links? Compare sitemaps, crawlers, a API do Wayback CDX e exportações do Search Console.

wayback download
Wayback Download: Todos os Métodos Classificados por Esforço
Todos os métodos de download do Wayback classificados por esforço: páginas únicas, scripts wget, a API CDX e serviços automatizados que reconstroem o site inteiro para você.
