Sitio web de Archive.org: búsqueda avanzada, filtros y colecciones
Por el equipo editorial de Restorix · 26 de abril de 2026 · 8 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
La mayoría de las personas visita el sitio web de Archive.org una sola vez. Pegan una URL muerta en la Wayback Machine, toman una captura de pantalla y se van. Eso es desperdiciar una herramienta seria. Detrás del mismo inicio de sesión hay una biblioteca digital completa, decenas de millones de artículos, con su propio motor de búsqueda, sintaxis de consulta y filtros que casi nadie usa.
Durante años he extraído sitios de clientes, software muerto y manuales escaneados de Archive.org. La diferencia entre encontrar algo en dos minutos y rendirse después de veinte rara vez es suerte. Es saber qué cuadro de búsqueda usar y qué filtro marcar. Este es el flujo de trabajo que realmente sigo.
Qué indexa realmente el sitio web de Archive.org
La confusión empieza aquí. Archive.org ejecuta dos sistemas diferentes que comparten un logotipo. El archivo de artículos, lo que buscas desde la página principal, contiene objetos subidos y rastreados: libros, conciertos, software, videos, programas de radio. Cada artículo tiene metadatos, una lista de archivos y reseñas. La Wayback Machine, en web.archive.org, almacena instantáneas de páginas web indexadas por URL. Más de 900 mil millones de ellas.
¿Por qué importa esto para sitios web antiguos? Porque un sitio muerto puede aparecer en ambos lugares, de manera diferente. El lado de Wayback tiene las páginas. El lado de artículos puede contener un rastreo de rescate de Archive Team de todo el servicio donde vivía tu sitio, GeoCities, FortuneCity, MobileMe, empaquetado como archivos WARC descargables. Si solo usas una puerta, te pierdes la otra.
- Textos: libros escaneados, manuales, revistas, con búsqueda de texto completo
- Software: desde CD de shareware hasta navegadores antiguos y proyectores Flash
- Audio y video: conciertos en vivo, archivos de radio, noticieros, comerciales
- Elementos web: colecciones de rastreo y capturas de Archive Team, almacenados como archivos WARC
- Imágenes y datos: conjuntos de fotos, mapas escaneados, conjuntos de datos de investigación
Búsqueda avanzada en el sitio web de Archive.org
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
El cuadro de la página principal sirve para bootlegs de los Beatles. Para algo preciso, ve a la página de búsqueda avanzada, archive.org/advancedsearch.php, o escribe la consulta tú mismo. La sintaxis es similar a Lucene y estricta: los nombres de campos están en minúsculas, los rangos usan corchetes y los operadores booleanos deben ir en mayúsculas. Si fallas en uno de estos, obtendrás resultados basura en silencio.
Una consulta que encuentra software relacionado con Joomla añadido entre 2005 y 2010 se ve así: title:(joomla) AND mediatype:software AND date:[2005-01-01 TO 2010-12-31]. Pégalo en el cuadro de búsqueda y funciona. No se necesita formulario.
- identifier:, el slug exacto de la URL del artículo; la búsqueda más rápida que existe
- collection:, restringe a una colección, ej. collection:archiveteam
- creator: y title:, difusos pero útiles con comillas alrededor de frases
- date:[YYYY-MM-DD TO YYYY-MM-DD], rango de fecha de adición, no de publicación original
- mediatype:, texts, software, audio, movies, image, web, data
- NOT, AND, OR y paréntesis, combínalos libremente, pero en mayúsculas
Un detalle: date: filtra cuándo el artículo llegó al archivo, no cuándo se creó el contenido. Un manual de 2003 subido en 2019 coincide con 2019.

Filtros que hacen el trabajo pesado
Una vez que se cargan los resultados, la barra lateral izquierda es donde se ahorra tiempo. Puedes filtrar por tipo de medio, año, colección, creador e idioma, y ordenar por relevancia, vistas (totales o semanales), fecha de adición o título. La mayoría de las búsquedas fallan no porque el material falte, sino porque está en la página nueve detrás de doscientos episodios de podcast. Los filtros solucionan eso.
- Filtra primero por tipo de medio. Buscar un CMS desaparecido en todo te sepulta en audio.
- Ordena por vistas semanales cuando quieras material mantenido, la multitud es una señal de calidad decente.
- Apila los filtros de colección y año para reconstruir cómo se veía un rincón de la web en, digamos, 2008.
| Filtro | Mejor uso |
|---|---|
| Tipo de medio | Eliminar el 90% del ruido con un clic |
| Año | Reconstruir una línea de tiempo alrededor de la vida útil de un sitio |
| Colección | Mantenerse dentro de un rastreo o proyecto de rescate de confianza |
| Creador / subidor | Seguir el conjunto completo de un archivista |
| Vistas semanales | Detectar artículos que la gente sigue usando activamente |
Colecciones que vale la pena conocer para sitios web antiguos
Las colecciones son estantes curados, y algunas de ellas son oro para cualquiera que busque sitios web antiguos:
- archiveteam, capturas apresuradas y amorosas de servicios moribundos: GeoCities, FortuneCity, Posterous, MobileMe. A menudo rastreos WARC completos de plataformas de alojamiento enteras.
- geocities y sus mirrors, el rescate de Yahoo! GeoCities, la recuperación individual más grande de páginas web personales jamás realizada.
- widecrawl y otras colecciones de rastreo, rastreos masivos de Internet Archive, útiles cuando la vista por URL de Wayback tiene lagunas.
- colecciones de bibliotecas de software, navegadores antiguos, Flash, Shockwave, applets de Java. Los necesitas para ejecutar realmente lo que servían los sitios antiguos.
- biblioteca de software en CD-ROM, discos de shareware llenos de creadores de sitios, contadores y scripts de libro de visitas precisos de la época.
Comienza desde la página de la colección, no desde el cuadro de búsqueda. Los mantenedores suelen documentar qué hay dentro, cómo se rastreó y qué significa la estructura de archivos; contexto que te ahorra adivinar a las 2 a.m.

Sitio web de Archive.org vs. Wayback Machine: qué puerta usar
| Búsqueda de artículos en Archive.org | Wayback Machine | |
|---|---|---|
| Buscas | Artículos por metadatos | URLs por dirección |
| Obtienes | Archivos descargables | Instantáneas renderizadas |
| Mejor para | Software, medios, rastreos masivos | Páginas de un sitio específico |
| Debilidad | Sin renderizado de página | Sin descarga oficial del sitio completo |
Regla general: si puedes nombrar la URL, comienza en la Wayback Machine. Si solo puedes describir la cosa, ese tema de phpBB que todos usaban en 2007, la búsqueda de artículos gana. Para una restauración completa, generalmente terminas usando ambas: rastreos y datos CDX del lado de artículos, instantáneas de páginas del lado de Wayback.
Un flujo de trabajo real: cazar el foro muerto de un cliente
Caso concreto. El foro phpBB de 2009 de un cliente desapareció cuando el anfitrión quebró en 2014. El dominio estuvo estacionado durante años; querían recuperar el contenido. Aquí está la secuencia que funcionó:
- Consulta CDX de Wayback en el dominio para mapear qué URLs fueron capturadas y cuándo, alrededor de 1,400 capturas, la mayoría de 2010 a 2012.
- Búsqueda de artículos para el dominio y nombre del sitio dentro de collection:archiveteam, nada esta vez, pero es una verificación de treinta segundos.
- Verificación de colección en el antiguo anfitrión, el anfitrión mismo había sido parcialmente capturado por Archive Team, lo que llenó varias lagunas de plantillas e imágenes.
- Búsqueda filtrada por año en el software del foro para obtener un paquete phpBB correcto de la época como referencia.
Tiempo total: unos cuarenta minutos, la mayoría leyendo la salida CDX. La búsqueda es la parte fácil una vez que conoces las puertas. Observa lo que no sucedió: no adivinar en el caché de Google, no suplicar al soporte del antiguo anfitrión, no pagarle a nadie todavía. El archivo nos dijo exactamente qué sobrevivió, 1,400 capturas, un vacío conocido en 2013 y un rastreo de rescate parcial para parchearlo. Esos mismos datos CDX son lo que un presupuesto de Restorix lee para contar archivos y fijar el precio de una restauración, que es donde continúa esta historia a continuación.
Cuando el sitio web de Archive.org no es suficiente
Todo lo anterior encuentra material. No te entrega un sitio web funcional. Las instantáneas de Wayback vienen con URLs reescritas, imágenes faltantes, formularios muertos y enlaces absolutos que apuntan a un dominio que ya no controlas. Reconstruir un sitio a partir de capturas sin procesar a mano son días de scripts sed y arrepentimiento.
Esa brecha es exactamente para lo que se construyó esta plataforma de recuperación web. Pega la URL, y el presupuesto gratuito muestra el recuento exacto de archivos archivados, el tamaño total y un precio fijo antes de que pagues algo. Las restauraciones pueden eliminar análisis y anuncios, convertir enlaces a relativos, forzar HTTPS e implementar directamente en tu VPS, alojamiento FTP o S3, con un CMS de un solo archivo incluido para que puedas editar el contenido revivido.
Usa el sitio web de Archive.org para explorar: verifica qué existió, cuándo y cuánto sobrevivió. Luego deja que las herramientas hagan la reconstrucción. Tu tiempo vale más que un fin de semana de análisis WARC.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Es gratuito el sitio web de Archive.org?
Sí. Buscar, transmitir y descargar artículos públicos no cuesta nada, y no se necesita cuenta para navegar. Una cuenta gratuita agrega favoritos, subidas y listas. El préstamo de ciertos libros modernos requiere una cuenta, pero todo lo cubierto en esta guía es abierto.
¿Cuál es la diferencia entre el sitio web de Archive.org y la Wayback Machine?
Archive.org es la biblioteca digital principal: artículos como libros, software, audio y colecciones de rastreo, buscables por metadatos. La Wayback Machine es un servicio dentro de ella, que almacena más de 900 mil millones de instantáneas de páginas web indexadas por URL. Los sitios web antiguos pueden aparecer en ambos, como instantáneas de Wayback y como artículos de rastreo masivo.
¿Puedo buscar texto completo en páginas web antiguas en Archive.org?
No. La Wayback Machine indexa por URL, no por texto de página, necesitas la dirección, no palabras clave. La búsqueda de texto completo solo funciona dentro de artículos de texto como libros escaneados. Para páginas, encuentra primero la URL (enlaces antiguos, motores de búsqueda, comodines CDX), luego búscala.
¿Cómo descargo algo que encuentro en el sitio web de Archive.org?
Cada página de artículo tiene un cuadro de descarga que lista archivos individuales, además de opciones de torrent y artículo completo. Para sitios web capturados por la Wayback Machine no hay botón de descarga, eso necesita la API CDX, una herramienta de descarga o un servicio de restauración como Restorix. Nuestra guía para [descargar de Archive.org](/es/download-archive-org) recorre cada método.
¿Por qué no puedo encontrar un sitio antiguo específico?
Tres razones habituales: el robots.txt del sitio bloqueó los rastreadores, el sitio nunca fue enlazado desde ningún lugar al que un rastreador siguiera, o todo estaba detrás de un inicio de sesión o mucho Flash y JavaScript. Verifica la API CDX para el dominio desnudo antes de rendirte; a veces las capturas se esconden en subdominios extraños o una variante www que olvidaste.
Guías relacionadas

wayback machine archive org
Wayback Machine en Archive.org: una guía práctica
Un recorrido práctico por la Wayback Machine en Archive.org: dónde se encuentra, cómo funcionan realmente el buscador y el calendario, y cómo salir con archivos reales.

archiveorg
Archiveorg: Dentro de la biblioteca gratuita más grande de Internet
Archiveorg es mucho más que la Wayback Machine: libros gratis, música en vivo, noticieros de TV, software jugable y más de 900 mil millones de páginas web. Recorrido completo, además de recuperación de archivos.

download archive org
Cómo descargar de Archive.org: items, capturas y más
Todas las formas prácticas de descargar contenido de Archive.org: archivos de items, descargas masivas por CLI y capturas web de la Wayback Machine, y cómo elegir la opción adecuada para tu caso.

archive org download
Formatos de descarga de Archive.org: WARC, CDX y archivos individuales
Lo que realmente contiene cada formato de descarga de Archive.org, capturas WARC, índices JSON CDX y archivos originales individuales, y qué hacer con cada uno.
