Descarga de Wayback: Todos los métodos ordenados por esfuerzo
Por el equipo editorial de Restorix · 3 de mayo de 2026 · 8 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
El sitio desapareció. El hosting lo borró, los backups son tarballs vacíos, y la única copia que queda en la Tierra está dentro de la Wayback Machine. Ahora necesitas una descarga de Wayback que realmente funcione, y hay cuatro formas de obtenerla. Van desde un truco de dos minutos en el navegador hasta un servicio que lo hace todo por ti, y la diferencia de esfuerzo entre ellos es enorme. Aquí tienes cada método, ordenado por lo que te cuesta en horas, con los modos de fallo que nadie menciona en las páginas de aterrizaje.
Lo que realmente obtienes con una descarga de Wayback
La Wayback Machine no almacena tu sitio. Almacena respuestas: una URL, un rastreo, un momento en el tiempo. Tu página de inicio puede tener 10.000 capturas mientras tu política de privacidad tiene dos, de 2014 y 2019. Una descarga de Wayback significa obtener esas respuestas almacenadas una URL a la vez y coserlas en algo que se parece al original.
Dos consecuencias se derivan de esto. Primero, cualquier cosa que el rastreador nunca vio se pierde para siempre: sin base de datos, sin código PHP fuente, sin panel de administración, nada detrás de un inicio de sesión. Segundo, cada archivo que extraes está congelado en un momento de rastreo que no elegiste. Mezcla una hoja de estilos de 2016 con una página de inicio de 2021 y el sitio parece una nota de rescate, porque eso es exactamente lo que ensamblaste.
La vista de calendario en cualquier página de instantánea hace esto visible. Los círculos azules marcan los rastreos, y los espacios entre ellos pueden extenderse por años en páginas impopulares. Así que antes de elegir un método, elige una fecha objetivo: el año en que el sitio se veía como tú quieres. Cada decisión después de eso, qué capturas obtener, qué activos confiar, se vuelve más fácil.

Método 1: Guardar una sola página en tu navegador
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Abre la instantánea, presiona Ctrl+S, elige Página web, completa. Hecho. Para una página esto es la descarga de Wayback más rápida que existe. Para cualquier cosa más allá de unas diez páginas se convierte en una forma de autocastigo, así que sabe cuándo parar. Si el navegador estropea algo, abre las herramientas de desarrollo, encuentra las URLs de los activos en la pestaña de red, y guarda esos archivos individualmente.
- Usa el truco id_: inserta id_ después de la marca de tiempo en la URL de la instantánea para obtener el HTML original exactamente como fue capturado, sin la barra de herramientas de Wayback y los enlaces reescritos incluidos.
- Las páginas guardadas hacen hotlink de sus activos de vuelta a web.archive.org. Abre el archivo sin conexión y la mitad de las imágenes desaparecen a menos que también las hayas guardado explícitamente.
- Revisa la fecha de captura en la vista de calendario antes de guardar. Tomar el año equivocado es el error de novato más común, y el archivo rara vez te advierte.
Método 2: Un script wget de descarga de Wayback
El movimiento clásico es wget en modo espejo apuntando a una URL archivada: wget --mirror --page-requisites --convert-links https://web.archive.org/web/2019/https://example.com. wget sigue los enlaces reescritos que Wayback inyecta, lo que te mantiene dentro del archivo, y --page-requisites extrae el CSS, JavaScript y las imágenes que cada página necesita.
Para un sitio de folleto de 40 páginas esto puede terminar en una tarde. Presupuesto esa tarde para babysitting. archive.org limita clientes agresivos, así que añade --wait=2 entre solicitudes y espera rerunear el comando unas pocas veces cuando se atasque. Un --reject regex que mantiene wget cerca de tu marca de tiempo objetivo evita que se desvíe lateralmente a través de veinte años de capturas.
Lo que terminas obteniendo es un directorio de HTML que todavía lleva la barra de herramientas de Wayback, marcas de tiempo dentro de cada URL de activo, y agujeros silenciosos donde sea que el rastreador perdió un archivo. Convertir ese pile en un sitio desplegable es un segundo proyecto, y es la parte que la gente olvida programar.
Método 3: Programación contra la API CDX
Cuando el rastreo a ciegas no es suficiente, ve a la fuente. La API CDX devuelve una lista legible por máquina de cada captura para una URL o dominio: web.archive.org/cdx/search/cdx?url=example.com/*&output=json&filter=statuscode:200&collapse=urlkey. Esa única solicitud ya es más útil que una hora de wget, porque te dice qué existe antes de descargar nada.
El bucle es simple en Python o Node: lee la lista, obtiene cada captura con el sufijo id_, guarda en disco, duerme cortésmente entre solicitudes. El poder está en los filtros. Restringe por año o tipo MIME, y usa collapse=digest para eliminar capturas duplicadas así obtienes cada archivo único una vez en lugar de cuarenta.
Este es el método que uso en trabajo forense, como extraer cada PDF que una empresa publicó o reconstruir un directorio a partir de una fecha específica. También es un genuino proyecto de programación: un script cuidadoso para un sitio de tamaño mediano es un fin de semana de escritura, pruebas y rerunear después de que la conexión cae a las 2 a.m.

Método 4: Servicios de restauración automatizados
La cuarta opción es saltarse el trabajo manual completamente. Los servicios construidos para este trabajo consultan el archivo, descargan cada archivo capturado, eliminan el chrome de Wayback, reparan los enlaces internos, y te entregan un sitio funcional en lugar de una carpeta de fragmentos.
Restorix es el que recomiendo a los clientes. La estimación gratuita por sí sola vale el clic: antes de pagar nada, muestra el conteo exacto de archivos archivados, tamaño total y un precio cerrado. Las restauraciones son por archivo con el primer archivo gratis, y si una restauración o despliegue falla, el reembolso llega a tu saldo automáticamente. Sin ticket, sin discutir con soporte.
Comparado con las rutas háztelo tú mismo, el intercambio es directo: una pequeña tarifa fija a cambio de tu fin de semana, tus dolores de cabeza de límite de tasa y tu script de limpieza. En los últimos tres trabajos que evalué, la tarifa quedó por debajo de lo que habrían costado dos horas facturables al cliente.
Los errores que arruinan una descarga de Wayback
- Ignorar las query strings. /page.php?id=12 y /page.php?id=13 son capturas diferentes de páginas diferentes. Omitirlas y desaparece la mitad de un blog WordPress o foro phpBB.
- Mezclar marcas de tiempo sin criterio. Una página de inicio de 2018 renderizada con CSS de 2013 parece una fotocopia rota. Elige una fecha objetivo y mantente dentro de unos pocos meses de ella.
- Olvidar otros hosts. Las imágenes en cdn.example.com o assets.example.net son capturas separadas bajo prefijos de URL separados, y una consulta solo del sitio nunca las ve.
- Confiar en cobertura antigua. El archivo respetó las exclusiones de robots.txt durante años, así que secciones enteras de algunos sitios nunca fueron capturadas en absoluto.
- Asumir que la captura más nueva es la mejor. Más reciente no siempre es mejor. Un sitio capturado después de ser hackeado, estacionado o redireccionado vale menos que una instantánea saludable de dos años antes.
- Guardar HTML reescrito. Sin el sufijo id_ horneas la barra de herramientas de Wayback y los enlaces de archive.org en cada página, y alguien tiene que eliminarlos después.
Elegir el método correcto para tu sitio
| Método | Esfuerzo manual | Costo | Mejor para | Falla cuando |
|---|---|---|---|---|
| Guardar del navegador | Minutos por página | Gratis | 1-10 páginas | Necesitas 200 páginas |
| Script wget | Una tarde | Gratis | Sitios pequeños estáticos | Activos faltantes, limitación de tasa |
| Script API CDX | Un fin de semana o más | Gratis | Extracciones filtradas precisas | No sabes programar |
| Servicio automatizado | Minutos en total | Pequeña tarifa fija | Poner el sitio de vuelta en línea | Disfrutas el sufrimiento |
Un escenario realista: el sitio de marketing de 300 páginas de un cliente muere sin backup. El método uno te cuesta 300 guardados manuales, digamos diez horas. El método dos cuesta una tarde más un día de limpieza. El método tres cuesta un fin de semana si ya sabes programar. El método cuatro cuesta una tarifa fija que conocías antes de empezar, y el sitio vuelve limpio, con los enlaces reparados y listo para desplegar. Las matemáticas por hora no son sutiles.
Mi regla después de años de trabajos de restauración: si el sitio necesita vivir de nuevo, ve directo al método cuatro, porque eso es literalmente para lo que está construido Restorix. Si necesitas una página para evidencia o nostalgia, método uno. Los dos del medio son para personas que quieren el viaje, no el destino.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Es legal una descarga de Wayback?
Descargar páginas archivadas públicamente para recuperar tu propio sitio o para referencia personal es práctica común y generalmente de bajo riesgo. Republicar el contenido de otra persona íntegramente es donde empiezan los problemas de derechos de autor. Si el sitio era tuyo, estás en terreno sólido.
¿Puedo descargar un sitio web completo de la Wayback Machine gratis?
Sí, con tu propio trabajo. Los scripts wget y CDX no cuestan nada más que tiempo, y el costo oculto es la limpieza: reescrituras de enlaces de Wayback, activos faltantes, navegación rota. Los servicios pagos existen precisamente porque la limpieza es donde se atascan las descargas gratis.
¿Qué significa id_ en una URL de Wayback?
Añadir id_ después de la marca de tiempo le dice al archivo que sirva el archivo original exactamente como fue capturado, sin la barra de herramientas y sin reescribir los enlaces para que apunten de vuelta a web.archive.org. Para cualquier descarga seria es obligatorio.
¿Por qué faltan imágenes en mi descarga?
El rastreador capturó el HTML pero no cada activo. Las imágenes cargadas lazy, las imágenes de fondo CSS y cualquier cosa detrás de JavaScript son las bajas usuales. Prueba marcas de tiempo adyacentes; un rastreo diferente de la misma página a veces tiene el archivo.
¿Por qué mi script sigue dando errores 429 de archive.org?
Eso es limitación de tasa. El archivo limita clientes que hacen demasiadas solicitudes demasiado rápido. Baja a una o dos solicitudes concurrentes, añade un retraso de uno a dos segundos entre recuperaciones, y reanuda en lugar de reiniciar. Los scripts educados terminan; los agresivos son bloqueados.
¿Qué tan atrás puede llegar una descarga de Wayback?
Los rastreos públicos del archivo comienzan en 1996. La cobertura antes de aproximadamente 2005 es escasa para sitios pequeños, y muchas URLs de esa era sobreviven solo como HTML sin imágenes ni hojas de estilo.
Guías relacionadas

wayback machine downloader
Herramientas de descarga del Wayback Machine: lo que realmente funciona
Un análisis honesto de las herramientas de descarga del Wayback Machine: los scripts de código abierto, sus límites reales y la opción llave en mano que vuelve a poner tu sitio en línea.

wayback machine download site
Descargar un sitio completo desde Wayback Machine
Cómo descargar un sitio entero desde Wayback Machine: tropiezos del rastreo, páginas con parámetros, recursos faltantes y cuándo una restauración automatizada supera a los scripts caseros.

download entire website from archive org
Descarga un sitio web completo desde Archive.org, no solo la página de inicio
Para descargar un sitio web completo desde archive.org necesitas todas las páginas, imágenes y hojas de estilo. Los archivos se esconden bajo diferentes fechas, aquí te explicamos por qué, además de una lista de verificación completa.

wayback machine restore
Restauración con Wayback Machine: 4 errores y cómo evitarlos
Una restauración con Wayback Machine puede fallar silenciosamente: páginas en parking, cadenas de redirecciones, imágenes faltantes y fechas mezcladas. Cómo detectar cada error y evitarlo.
