Site do Archive.org: Busca Avançada, Filtros e Coleções
Por a equipe editorial da Restorix · 26 de abril de 2026 · 8 min de leitura

Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
A maioria das pessoas acessa o site do Archive.org apenas uma vez. Colam uma URL morta na Wayback Machine, pegam um print e vão embora. Isso é desperdício de uma ferramenta séria. Por trás do mesmo login existe uma biblioteca digital completa, dezenas de milhões de itens, com seu próprio motor de busca, sintaxe de consulta e filtros que quase ninguém usa.
Há anos eu recupero sites de clientes, softwares descontinuados e manuais digitalizados do Archive.org. A diferença entre encontrar algo em dois minutos e desistir após vinte raramente é sorte. É saber qual caixa de busca usar e qual filtro clicar. Este é o fluxo de trabalho que eu realmente sigo.
O que o site do Archive.org realmente indexa
A confusão começa aqui. O Archive.org roda dois sistemas diferentes que compartilham o mesmo logotipo. O arquivo de itens, o que você busca pela página inicial, contém objetos enviados e rastreados: livros, shows, softwares, vídeos, programas de rádio. Cada item tem metadados, uma lista de arquivos e resenhas. A Wayback Machine, em web.archive.org, armazena snapshots de páginas da web indexados por URL. Mais de 900 bilhões deles.
Por que isso importa para sites antigos? Porque um site morto pode aparecer em ambos os lugares, de formas diferentes. O lado da Wayback tem as páginas. O lado de itens pode conter um crawl de resgate do Archive Team de todo o serviço em que seu site existia, GeoCities, FortuneCity, MobileMe, empacotado como arquivos WARC para download. Se você só usa uma porta, perde a outra.
- Textos: livros digitalizados, manuais, revistas, com busca em texto completo
- Software: de CDs de shareware a navegadores antigos e projetores Flash
- Áudio e vídeo: shows ao vivo, arquivos de rádio, cinejornais, comerciais
- Itens web: coleções de crawl e capturas do Archive Team, armazenadas como arquivos WARC
- Imagens e dados: conjuntos de fotos, digitalizações de mapas, conjuntos de dados de pesquisa
Busca avançada no site do Archive.org
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
A caixa da página inicial serve para bootlegs dos Beatles. Para qualquer coisa mais precisa, vá à página de busca avançada, archive.org/advancedsearch.php, ou escreva a consulta você mesmo. A sintaxe é do tipo Lucene e rígida: nomes de campos em minúsculas, intervalos usam colchetes e operadores booleanos devem estar em maiúsculas. Erre um deles e você silenciosamente recebe lixo como resultado.
Uma consulta que encontra softwares relacionados ao Joomla adicionados entre 2005 e 2010 fica assim: title:(joomla) AND mediatype:software AND date:[2005-01-01 TO 2010-12-31]. Cole na caixa de busca e funciona. Sem formulário necessário.
- identifier:, o slug exato da URL do item; a busca mais rápida que existe
- collection:, restringe a uma coleção, ex.: collection:archiveteam
- creator: e title:, imprecisos, mas úteis com aspas em frases
- date:[YYYY-MM-DD TO YYYY-MM-DD], intervalo de data de adição, não de publicação original
- mediatype:, texts, software, audio, movies, image, web, data
- NOT, AND, OR e parênteses, combine livremente, mas em maiúsculas
Uma pegadinha: date: filtra quando o item entrou no arquivo, não quando o conteúdo foi criado. Um manual de 2003 enviado em 2019 aparece como 2019.

Filtros que fazem o trabalho pesado
Quando os resultados carregam, a barra lateral esquerda é onde o tempo é economizado. Você pode filtrar por mediatype, ano, coleção, criador e idioma, e ordenar por relevância, visualizações (total ou semanais), data de adição ou título. A maioria das buscas falha não porque o material está ausente, mas porque está na página nove, atrás de duzentos episódios de podcast. Filtros resolvem isso.
- Filtre por mediatype primeiro. Buscar um CMS extinto em tudo te enterra em áudio.
- Ordene por visualizações semanais quando quiser material mantido, a multidão é um sinal de qualidade razoável.
- Combine filtros de coleção e ano para reconstruir como um canto da web era em, digamos, 2008.
| Filtro | Melhor uso |
|---|---|
| Mediatype | Corta 90% do ruído com um clique |
| Ano | Reconstrói uma linha do tempo em torno do tempo de vida de um site |
| Coleção | Mantém você dentro de um crawl confiável ou projeto de resgate |
| Criador / uploader | Segue o conjunto completo de um arquivista |
| Visualizações semanais | Destaca itens que as pessoas ainda usam ativamente |
Coleções que valem conhecer para sites antigos
Coleções são prateleiras curadas, e algumas delas são ouro para quem busca sites antigos:
- archiveteam, capturas apressadas e amorosas de serviços moribundos: GeoCities, FortuneCity, Posterous, MobileMe. Frequentemente crawls WARC completos de plataformas inteiras de hospedagem.
- geocities e seus espelhos, o resgate do Yahoo! GeoCities, a maior recuperação individual de páginas pessoais da web já feita.
- widecrawl e outras coleções de crawl, crawls em massa do Internet Archive, úteis quando a visualização por URL da Wayback tem lacunas.
- coleções da software library, navegadores antigos, Flash, Shockwave, applets Java. Você precisa deles para realmente rodar o que os sites antigos serviam.
- cd-rom software library, discos de shareware cheios de construtores de sites da época, contadores e scripts de livro de visitas.
Comece pela página da coleção, não pela caixa de busca. Mantenedores costumam documentar o que há dentro, como foi feito o crawl e o que significa o layout dos arquivos, contexto que te poupa de adivinhar às 2 da manhã.

Site do Archive.org vs. Wayback Machine: qual porta usar
| Busca de itens no Archive.org | Wayback Machine | |
|---|---|---|
| Você busca | Itens por metadados | URLs por endereço |
| Você obtém | Arquivos para download | Snapshots renderizados |
| Melhor para | Software, mídia, crawls em massa | Páginas de um site específico |
| Fraqueza | Sem renderização de páginas | Sem download oficial do site completo |
Regra geral: se você sabe a URL, comece pela Wayback Machine. Se você só consegue descrever a coisa, aquele tema de phpBB que todo mundo usava em 2007, a busca de itens vence. Para uma restauração completa, você acaba usando as duas: crawls e dados CDX do lado de itens, snapshots de páginas do lado da Wayback.
Um fluxo real: caçando o fórum morto de um cliente
Caso concreto. Um fórum phpBB de 2009 de um cliente desapareceu quando a hospedagem fechou em 2014. O domínio ficou estacionado por anos; eles queriam o conteúdo de volta. Aqui está a sequência que funcionou:
- Consulta CDX da Wayback no domínio para mapear quais URLs foram capturadas e quando, cerca de 1.400 capturas, a maioria de 2010 a 2012.
- Busca de itens pelo domínio e nome do site dentro de collection:archiveteam, nada desta vez, mas é uma verificação de trinta segundos.
- Verificação de coleção na hospedagem antiga, a própria hospedagem tinha sido parcialmente capturada pelo Archive Team, o que preencheu várias lacunas de templates e imagens.
- Busca filtrada por ano no software do fórum para obter um pacote phpBB da época como referência.
Tempo total: cerca de quarenta minutos, a maior parte lendo a saída do CDX. A busca é a parte fácil quando você conhece as portas. Note o que não aconteceu: sem adivinhar no cache do Google, sem implorar à caixa de suporte da hospedagem antiga, sem pagar ninguém ainda. O arquivo nos disse exatamente o que sobreviveu, 1.400 capturas, uma lacuna conhecida em 2013 e um crawl de resgate parcial para remendá-la. Esses mesmos dados CDX são o que uma estimativa do Restorix lê para contar arquivos e precificar uma restauração, que é onde esta história continua abaixo.
Quando o site do Archive.org não é suficiente
Tudo acima encontra material. Não te entrega um site funcionando. Snapshots da Wayback vêm com URLs reescritas, imagens faltando, formulários mortos e links absolutos apontando para um domínio que você não controla mais. Reconstruir um site a partir de capturas brutas à mão são dias de scripts sed e arrependimento.
Essa lacuna é exatamente para o que o Restorix foi criado. Cole a URL, e a estimativa gratuita mostra a contagem exata de arquivos arquivados, tamanho total e um preço travado antes de você pagar qualquer coisa. Restaurações podem remover analytics e anúncios, converter links para relativos, forçar HTTPS e publicar direto no seu VPS, hospedagem FTP ou S3, com um CMS de arquivo único incluído para você editar o conteúdo revivido.
Use o site do Archive.org para explorar: verifique o que existia, quando e quanto sobreviveu. Depois deixe a ferramenta fazer a reconstrução. Seu tempo vale mais que um fim de semana parseando WARC.
Restaure seu site a partir da Wayback Machine
Estimativa gratuita em segundos — você só paga ao confirmar. Falhas são reembolsadas automaticamente.
FAQ
O site do Archive.org é gratuito?
Sim. Buscar, transmitir e baixar itens públicos não custa nada, e não é necessária conta para navegar. Uma conta gratuita adiciona favoritos, uploads e listas. O empréstimo de certos livros modernos exige conta, mas tudo coberto neste guia é aberto.
Qual a diferença entre o site do Archive.org e a Wayback Machine?
Archive.org é a biblioteca digital matriz: itens como livros, software, áudio e coleções de crawl, pesquisáveis por metadados. A Wayback Machine é um serviço dentro dela, com mais de 900 bilhões de snapshots de páginas da web indexados por URL. Sites antigos podem aparecer em ambos, como snapshots da Wayback e como itens de crawl em massa.
Posso fazer busca de texto completo em páginas web antigas no Archive.org?
Não. A Wayback Machine indexa por URL, não por texto da página, você precisa do endereço, não de palavras-chave. A busca de texto completo só funciona dentro de itens de texto, como livros digitalizados. Para páginas, encontre a URL primeiro (links antigos, motores de busca, curingas CDX), depois procure.
Como faço para baixar algo que encontro no site do Archive.org?
Toda página de item tem uma caixa de download listando arquivos individuais, além de opções de torrent e item completo. Para sites capturados pela Wayback Machine não há botão de download, isso exige a API CDX, uma ferramenta de download ou um serviço de restauração como o Restorix. Nosso guia sobre [baixar do Archive.org](/pt/download-archive-org) explica cada método.
Por que não consigo encontrar um site antigo específico de jeito nenhum?
Três razões comuns: o robots.txt do site bloqueou crawlers, o site nunca foi linkado em lugar algum que um crawler seguisse, ou tudo ficava atrás de login ou muito Flash e JavaScript. Verifique a API CDX pelo domínio puro antes de desistir, capturas às vezes se escondem sob subdomínios estranhos ou uma variante www que você esqueceu.
Guias relacionados

wayback machine archive org
Wayback Machine no Archive.org: Um Guia Prático do Site
Um tour prático pela Wayback Machine no Archive.org: onde ela fica, como funcionam a busca e o calendário, e como sair com arquivos reais.

archiveorg
Archiveorg: Dentro da Maior Biblioteca Gratuita da Internet
Archiveorg é mais que a Wayback Machine: livros gratuitos, shows ao vivo, telejornais, software jogável e mais de 900 bilhões de páginas web. Tour completo, além de recuperação de arquivos.

download archive org
Como Baixar do Archive.org: Itens, Snapshots e Mais
Todas as formas práticas de baixar conteúdo do Archive.org, arquivos de itens, downloads em massa via CLI e snapshots da Wayback Machine, e como escolher a certa para o seu trabalho.

archive org download
Formatos de Download do Archive.org: WARC, CDX e Arquivos Únicos
O que cada formato de download do Archive.org realmente contém, capturas WARC, índices JSON CDX e arquivos originais individuais, e o que fazer com cada um.
