Wayback Machine: La guía completa para navegar por el historial web
Por el equipo editorial de Restorix · 30 de abril de 2026 · 9 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Wayback Machine me ha salvado más veces de las que puedo contar. La tienda WooCommerce de un cliente borrada por una actualización de plugin fallida. La página de precios de un competidor de 2019, necesaria para una disputa contractual. La versión original de un artículo que alguien reescribió discretamente después de que fuera citado en un juicio. Es la memoria de la web, y no cuesta nada usar. Sin embargo, la mayoría de la gente solo toca la barra de búsqueda en la página de inicio y se pierde todo lo demás. Esta guía explica cómo funciona realmente el archivo, todos los trucos de búsqueda que vale la pena conocer, dónde se queda corto, y qué hacer cuando navegar por las capturas no es suficiente y necesitas recuperar el sitio en sí.
Qué es realmente la Wayback Machine
La Wayback Machine es un archivo público gratuito de páginas web, administrado por Internet Archive, una biblioteca digital sin fines de lucro con sede en San Francisco. Brewster Kahle fundó la organización en 1996, y la Wayback Machine se abrió al público en 2001. El nombre es un guiño a la máquina WABAC, el dispositivo de viaje en el tiempo del dibujo animado de los años 60 Historia Improbable de Peabody, lo cual también explica por qué tanta gente lo recuerda incorrectamente como 'the way back machine'.
La colección superó los 900 mil millones de páginas web archivadas y sigue creciendo en más de mil millones de páginas por semana. Además de páginas web, Internet Archive almacena libros escaneados, noticias de TV, audio y software antiguo que puedes ejecutar en el navegador. Navegar no cuesta nada y no requiere cuenta.
Una distinción importa antes que nada: la Wayback Machine archiva páginas, no sitios. Cada captura es una sola URL capturada en un solo momento. No hay ningún objeto de 'sitio completo, marzo de 2015' sentado en un estante, solo miles de capturas de páginas individuales que resultan compartir un dominio. Ten esto en cuenta, porque explica casi cada peculiaridad con la que te encontrarás más adelante.
Cómo funcionan los rastreos y las capturas
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
El archivo se construye mediante rastreadores. En sus primeros años, Internet Archive dependía de datos de rastreo de Alexa Internet, una empresa de análisis web que Kahle co-fundó; hoy ejecuta su propia operación de rastreo, además de rastreos de socios y millones de guardados manuales de usuarios. Un rastreador solicita una URL, almacena el HTML que recibe, luego obtiene los activos que ese HTML referencia, imágenes, hojas de estilo, scripts, cada uno almacenado como su propio archivo.
Ese último detalle explica la confusión más común. Una captura no es una carpeta congelada en el tiempo. El HTML de la página puede ser del 3 de marzo mientras su hoja de estilo es del 9 de marzo y la imagen principal del 20 de febrero. Cuando todo coincide, la página se muestra correctamente. Cuando no lo hace, obtienes la clásica captura rota: texto intacto, diseño destruido, cajas grises donde deberían estar las fotos.
Con qué frecuencia se rastrea una página
No hay un calendario en el que puedas confiar. La frecuencia de rastreo sigue la prominencia: la página de inicio de un periódico importante se captura miles de veces al día, mientras que un foro phpBB de 2009 podría aparecer dos veces en una década. Si una página te importa, no esperes a que un rastreador se preocupe por ella, guárdala tú mismo, un truco que se cubre unas secciones más abajo.
Qué puede bloquear un rastreo
El rastreador respeta robots.txt, y una exclusión puede aplicarse de forma retroactiva: un sitio que impone una prohibición general en su dominio puede dejar todo su historial de capturas fuera de línea hasta que se levante el bloqueo. Los propietarios de sitios también pueden solicitar directamente a Internet Archive que excluya su contenido. Las páginas detrás de inicios de sesión y muros de pago nunca se rastrean en primer lugar.
Leyendo el calendario y la línea de tiempo
Busca una URL y llegas a la vista del calendario. Dos instrumentos hacen todo el trabajo. El gráfico de barras en la parte superior muestra capturas por año, una forma rápida de ver cuándo un sitio estaba activo, cuándo estaba ocupado y cuándo se apagó. El calendario debajo marca cada día capturado del año seleccionado.
- Círculo azul: una captura normal que devolvió un 200 OK.
- Círculo verde: la captura fue una redirección. El rastreador la siguió, así que verifica dónde aterrizó.
- Marca roja: una respuesta de error, usualmente un 404 o 500. Rara vez vale la pena abrir.
- Círculo más grande: más capturas ese día. Pasa el cursor sobre un día para ver horarios exactos, haz clic en una marca de tiempo para abrirla.
Abre una captura y un banner se sienta encima de la página. Muestra la marca de tiempo UTC exacta, flechas para la captura anterior y la siguiente, y un panel 'Acerca de esta captura' con metadatos del rastreo. Cuando estás buscando un cambio específico, digamos, cuando una empresa eliminó su cláusula de reembolso, no hagas clic en días aleatorios. Escanea grupos y huecos, luego enmarca el cambio entre la última captura que lo tiene y la primera que no.

Sintaxis de búsqueda de la Wayback Machine que vale la pena memorizar
La caja de búsqueda de la página de inicio es la forma más lenta de entrar. La URL en sí es la interfaz real, y un puñado de patrones cubre casi todo lo que jamás necesitarás.
| Patrón | Qué hace | Ejemplo |
|---|---|---|
| web.archive.org/web/2020/URL | Captura más cercana al 1 de enero de 2020 | web.archive.org/web/2020/example.com |
| web.archive.org/web/20200615143000/URL | Captura más cercana a un segundo exacto (UTC, AAAAMMDDhhmmss) | web.archive.org/web/20200615143000/example.com |
| web.archive.org/web/*/URL | Calendario de cada captura de esa página | web.archive.org/web/*/example.com/pricing |
| web.archive.org/web/*/domain/* | Cada URL capturada bajo un dominio, filtrable | web.archive.org/web/*/example.com/* |
| web.archive.org/web/2020id_/URL | Archivo original, sin banner, sin enlaces reescritos | web.archive.org/web/2020id_/example.com |
| web.archive.org/web/2020im_/URL | Solo el recurso de imagen en esa marca de tiempo | web.archive.org/web/2020im_/example.com/logo.png |
Dos de estos merecen mención especial. La lista de URLs de todo el dominio es la forma más rápida de encontrar una página cuya dirección recuerdas a medias, escribe un fragmento del slug en la caja de filtro y el archivo estrecha miles de rutas hasta la única publicación que necesitas. Y el modificador id_ es lo que usan los profesionales cuando necesitan el archivo en sí en lugar de una vista previa re-encuadrada, porque sirve los bytes originales sin el banner y sin reescribir un solo enlace.
Guardar página ahora y cuando se niega
El archivo no es solo una sala de lectura. Guardar página ahora escribe en él: pega cualquier URL pública en web.archive.org/save y un rastreador obtiene la página activa en segundos. Una cuenta gratuita desbloquea extras como guardar páginas con enlaces salientes y capturas de pantalla de página completa. Si publicas algo importante, guardarlo el mismo día es el seguro más barato de internet.
Se niega más a menudo de lo que la gente espera. Las páginas bloqueadas por robots.txt no se guardarán. El uso anónimo tiene límite de tasa, así que guardar en lote cincuenta páginas seguidas se atascará. Las pantallas de inicio de sesión se guardan como pantallas de inicio de sesión. Y las aplicaciones JavaScript pesadas a veces se archivan como un caparazón vacío, el HTML se guardó bien, pero el contenido solo existía después de que los scripts se ejecutaron, y los scripts consultaron una API que ya murió.
Dónde la Wayback Machine se queda corta
- Cualquier cosa detrás de un inicio de sesión, muro de pago o formulario POST nunca se archiva.
- Las aplicaciones interactivas que renderizan con JavaScript a menudo sobreviven como caparazones vacíos.
- El video y audio en streaming rara vez se reproducen desde capturas antiguas.
- Lagunas. La semana que desesperadamente necesitas es confiablemente la semana que nadie rastreó.
- Sin descarga de sitio completo. Navegas una página a la vez, con enlaces reescritos para apuntar de vuelta a través del archivo.
- El código del lado del servidor se fue para siempre. Las capturas contienen HTML renderizado; el PHP, la base de datos y el panel de administración nunca fueron públicos, así que nunca se archivaron.
Ninguno de estos son errores. El archivo fue construido para memoria, no para migración, y esa distinción importa en el momento en que tu objetivo cambia de leer una página antigua a reconstruir un sitio web completo.
Pasando de la Wayback Machine a un sitio restaurado
Navegar por una captura responde preguntas. No te entrega un sitio web. Los enlaces apuntan de vuelta a archive.org, los activos se sirven desde los servidores del archivo, y no hay botón de exportar. Copiar a mano funciona para una página o dos; una tienda de 3,000 páginas copiada así es un mes de tu vida que no recuperarás. Este es el punto donde la gente deja de investigar y empieza a buscar una restauración de Wayback Machine en su lugar.
Ese vacío es exactamente para lo que se construyó Restorix. Extrae cada archivo archivado de un dominio, reconstruye enlaces internos funcionales, y muestra primero una estimación gratuita, el conteo exacto de archivos, tamaño total y un precio cerrado antes de que pagues algo. Las restauraciones se pagan por archivo, el primer archivo es gratis, y las restauraciones fallidas se reembolsan automáticamente a tu saldo. Las opciones cubren las partes poco glamorosas que importan: eliminar scripts antiguos de análisis y anuncios, convertir enlaces a relativos, forzar HTTPS, mantener redirecciones 301 vivas, y exportar datos de artículos estructurados como XML, CSV o JSON.

Cuando los archivos estén listos, un clic los despliega a tu propio VPS sobre SSH o SFTP, a hosting compartido sobre FTP, o a un bucket S3, y cada despliegue incluye un pequeño CMS de un solo archivo en /webarchive-cms.php, para que el sitio restaurado sea editable en el momento en que aterrice. El tutorial recorre una ejecución completa en unos diez minutos.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Es legal usar la Wayback Machine?
Navegar es legal, y el archivo opera como una biblioteca. Los derechos de autor todavía aplican a lo que haces con el contenido, leer una página antigua está bien, republicar el texto de otra persona en su totalidad no lo está. Restaurar tu propio sitio, o contenido sobre el que tienes los derechos, es el caso común y seguro.
¿Qué tan atrás llega la Wayback Machine?
Los datos de rastreo comienzan en 1996, así que las capturas más antiguas tienen casi tres décadas. La cobertura de los años 1990 es escasa, sin embargo; las cosas se vuelven densamente confiables desde mediados de los 2000 en adelante.
¿Por qué a una captura le faltan sus imágenes o estilos?
Cada activo se captura por separado, y algunos nunca se obtuvieron, bloqueados por robots.txt, servidos desde un dominio diferente, o simplemente perdidos ese día. El HTML sobrevivió; la pintura no. Prueba una captura unos días antes o después.
¿Puedo descargar un sitio web completo de la Wayback Machine?
El archivo en sí no tiene botón de descarga de sitio. Puedes guardar páginas una por una, o usar un servicio de restauración como Restorix que reensambla todo el dominio, nuestra guía para descargar sitios web completos de archive.org recorre cada opción.
¿Cómo elimino mi propio sitio de la Wayback Machine?
Agrega una exclusión para el rastreador ia_archiver en robots.txt, o envía una solicitud de exclusión a Internet Archive. Los bloqueos también pueden ocultar capturas pasadas, no solo las futuras.
¿La Wayback Machine archiva redes sociales?
Parcialmente. Las publicaciones y perfiles públicos se capturan, pero los feeds basados en inicios de sesión y desplazamiento infinito se archivan mal. Trata las capturas sociales como hallazgos afortunados, no como un registro confiable.
Guías relacionadas

wayback
Cómo usar Wayback todos los días: páginas perdidas, enlaces muertos y promesas antiguas
Wayback es la forma más rápida de recuperar una página perdida, comprobar lo que decía un sitio el año pasado, citar un enlace muerto o investigar a una empresa antes de pagar. Aquí te explicamos cómo.

the way back machine
La máquina del tiempo: qué es y por qué existe
¿Buscas 'the Way Back Machine'? Llegaste al lugar correcto, oficialmente es la Wayback Machine. Te contamos qué es, quién la creó y qué puede (y no puede) hacer.

wayback machine restore
Restauración con Wayback Machine: 4 errores y cómo evitarlos
Una restauración con Wayback Machine puede fallar silenciosamente: páginas en parking, cadenas de redirecciones, imágenes faltantes y fechas mezcladas. Cómo detectar cada error y evitarlo.

download entire website from archive org
Descarga un sitio web completo desde Archive.org, no solo la página de inicio
Para descargar un sitio web completo desde archive.org necesitas todas las páginas, imágenes y hojas de estilo. Los archivos se esconden bajo diferentes fechas, aquí te explicamos por qué, además de una lista de verificación completa.
