Cómo descargar un sitio web de Archive.org: 3 métodos que funcionan
Por el equipo editorial de Restorix · 8 de junio de 2026 · 8 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
El sitio ya no existe. El hosting venció, el cliente nunca hizo una copia de seguridad y la única copia que queda está en el Wayback Machine. He recibido esa llamada más veces de las que puedo contar, y la primera pregunta siempre es la misma: ¿se puede descargar un sitio web de archive.org y recuperarlo?
Sí, se puede. Hay tres rutas realistas: guardar páginas manualmente, programar consultas contra el índice CDX o dejar que un servicio de restauración automática haga el rastreo por ti. Difieren enormemente en esfuerzo, y una mala elección te cuesta un fin de semana. Así es como funciona cada una realmente, con estimaciones honestas de tiempo basadas en hacer esto profesionalmente.
Qué significa realmente descargar del Wayback Machine
El Wayback Machine no es una carpeta de sitios web que puedas descargar con un clic. Es un enorme índice de capturas individuales: cada página, imagen, hoja de estilo y script almacenados por separado, cada uno vinculado al momento en que fue rastreado. Cuando ves una página antigua, tu navegador obtiene el HTML de una captura y las imágenes de varias otras, unidas al vuelo.
Así que descargar un sitio significa enumerar cientos o miles de archivos individuales, obtener cada uno y reescribir los enlaces internos para que la copia funcione fuera de archive.org. Ten presente este modelo, explica por qué cada método funciona como lo hace y por qué ninguno es un simple botón de descarga.
Método 1: descargar un sitio web de archive.org página por página
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
El enfoque ingenuo, y a veces el correcto. Abres la instantánea en el Wayback Machine y guardas cada página con tu navegador. Para un sitio de folleto de cinco páginas, esto está perfectamente bien. Para algo más grande, es una forma lenta de castigo.
- Abre la página archivada en la fecha de instantánea que desees.
- Usa Guardar como y elige 'Página web, completa' para que los recursos se incluyan.
- Repite para cada página, incluidas las que solo se alcanzan desde menús antiguos.
- Abre el HTML guardado y elimina el marcado de la barra de herramientas de Wayback de cada archivo.
- Corrige o acepta las URLs de los recursos, que aún apuntan a web.archive.org.
Hay dos trampas aquí. El HTML guardado referencia web.archive.org para muchos recursos, por lo que tu copia se rompe en el momento en que la abres sin conexión o el archivo tiene un día lento. Y el marcado de la barra de herramientas integrado en cada página guardada tiene que eliminarse manualmente, archivo por archivo. Todavía uso este método para páginas individuales, una vez un cliente solo necesitaba su antigua página de precios para un asunto legal, y un guardado tomó dos minutos. Su tienda de 300 páginas recibió un tratamiento diferente.
- Esfuerzo realista: 5-10 minutos por página una vez incluyes la limpieza de recursos.
- Adecuado para: hasta unas 10 páginas, o para obtener una página específica de referencia.
- Falla con: docenas de páginas, o cualquier trabajo donde necesites el marcado original limpio.

Método 2: descargar un sitio web de archive.org con la API CDX
La API CDX es el endpoint de índice del Wayback Machine, y es como encuentras cada archivo que archive.org tiene para un dominio. Una consulta devuelve el registro completo en JSON:
web.archive.org/cdx/search/cdx?url=example.com/*&output=json&fl=timestamp,original,mimetype,statuscode&filter=statuscode:200&collapse=digest
Eso te da marcas de tiempo, URLs originales y tipos MIME para todo lo capturado. El parámetro collapse elimina archivos idénticos, para que no descargues el mismo logo 400 veces. Desde ahí, un script pequeño recorre la lista y obtiene cada archivo. Añade id_ a una URL con marca de tiempo, como /web/20150312145531id_/http://example.com/style.css, y archive.org devuelve los bytes originales sin su marcado reescrito. Ese solo sufijo es la diferencia entre una copia limpia y una página llena de la barra de herramientas.
Las partes poco glamurosas son las que te consumen la tarde. Archive.org limita a los clientes agresivos, por lo que el script necesita pausas educadas y lógica de reintentos, o pasarás horas mirando respuestas 429. Las URLs con parámetros de consulta necesitan deduplicación, o los IDs de sesión convierten un sitio de 200 páginas en un rastreo de 9.000 archivos. Y después de que los archivos llegan, los enlaces internos aún apuntan al dominio original, por lo que necesitas un paso de reescritura antes de que la copia se navegue correctamente sin conexión.
- Esfuerzo realista: 2-4 horas para escribir y depurar el script si programas regularmente; un fin de semana si no lo haces. El rastreo en sí toma 30-90 minutos para unos pocos cientos de archivos.
- Adecuado para: desarrolladores, archivistas, cualquiera que quiera control total sobre cada byte.
- Falla con: personas que nunca han abierto una terminal, y plazos medidos en horas.

Lo que sea que programe, prueba el resultado como lo haría un visitante: sirve la carpeta con cualquier servidor web local y navega. Rutas de imagen rotas, enlaces que escapan a la web en vivo y fuentes faltantes se anuncian solos dentro de cinco minutos de hacer clic, y son miserables de descubrir después de que has declarado el trabajo terminado.
Método 3: descargar un sitio web de archive.org de forma automática
La tercera ruta deja que un servicio de restauración haga el rastreo, la coincidencia de recursos y la reescritura de enlaces. Esto es a lo que dirijo a los clientes cuando el sitio importa más que la experiencia de aprendizaje. Con el servicio de restauración pegas el dominio y obtienes una estimación instantánea gratuita: conteo exacto de archivos archivados, tamaño total y un precio fijo antes de pagar nada. Eliges un rango de fechas, activas las opciones que quieras y la copia restaurada llega lista para navegar, o se despliega directamente en tu hosting por SSH, FTP o S3.
- Opciones que vale la pena conocer: enlaces internos relativos, eliminación de analíticas y anuncios antiguos, minificación de JS/CSS, conversión a HTTPS, canonicalización www o sin www.
- La restauración puede exportar un manifiesto estructurado (JSON o SQLite) para que sepas exactamente qué se recuperó.
- Las restauraciones fallidas se reembolsan automáticamente a tu saldo, sin tickets de soporte.
El inconveniente es obvio: cuesta dinero. Pagas por archivo restaurado, el primer archivo es gratis y el precio se fija en el momento de la estimación. Para un blog personal quizás prefieras programarlo. Para la tienda WooCommerce de un cliente que genera ingresos y necesita estar de vuelta esta noche, la tarifa suele ser la línea más barata del incidente completo. Los despliegues también incluyen un pequeño CMS de un solo archivo, por lo que correcciones menores de texto después de la restauración no requieren volver a subir nada.
Tiempo y esfuerzo, lado a lado
| Método | Tu tiempo | Habilidad técnica | Tamaño ideal |
|---|---|---|---|
| Guardar páginas manualmente | 5-10 min por página | Ninguna | 1-10 páginas |
| Programación con API CDX | 3-6 horas en total | Cómodo con código | 10-1.000 páginas |
| Restauración automática | Unos 15 minutos de clics | Ninguna | Cualquier tamaño, especialmente 100+ páginas |
Observa que la tabla mide tu tiempo, no el de la máquina. Un script o un servicio puede procesar un rastreo grande durante horas, pero lo hace mientras duermes. El recurso escaso en cualquier restauración es la tarde de quien la realiza, por eso es lo que valoro.
Errores que consumen tardes enteras
- Confiar en los guardados del navegador para sitios completos. Te perderás cada página que no abriste manualmente, y los sitios antiguos esconden páginas en lugares que olvidaste que existían.
- Ignorar el modificador id_ y luego preguntarse por qué cada archivo HTML tiene el marcado de la barra de herramientas de Wayback integrado.
- Golpear archive.org con solicitudes paralelas. Te limitan, y un trabajo de una hora se convierte en cuatro.
- Omitir el paso de reescritura de enlaces. La copia se ve bien hasta que haces clic en algo.
- Asumir que cada página fue archivada. Revisa el inventario CDX primero para que los vacíos sean una cantidad conocida, no una sorpresa al final.
¿Qué método deberías elegir?
Menos de diez páginas: guárdalas manualmente y acepta las imperfecciones del marcado. Programas y quieres control: construye el script CDX y presupuesta una tarde. Necesitas el sitio de vuelta, limpio, sin convertirte en archivista a tiempo parcial: toma la ruta automática, el tutorial guía una restauración completa en unos minutos, y la estimación gratuita te dice el conteo de archivos y el precio antes de comprometerte a nada.
Una última cosa: cualquiera que sea la ruta que tomes, tómala ahora. Archive.org es un regalo, pero ha tenido interrupciones y presiones legales antes, y 'lo descargaré después' es exactamente cómo los sitios se pierden dos veces.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Es gratis descargar un sitio web de archive.org?
El archivo en sí es gratis para navegar, y el guardado manual o la programación CDX no cuestan nada más que tu tiempo. Los servicios de restauración automática cobran por archivo restaurado; Restorix muestra el precio fijo exacto en su estimación gratuita antes de pagar, y tu primer archivo es gratis.
¿Es legal descargar un sitio web de archive.org?
Descargar tu propio sitio, o el de un cliente con permiso, es una práctica estándar y es lo que hacen la mayoría de las restauraciones. Para el contenido de otra persona, una copia está bien para referencia personal o investigación, pero republicar material con derechos de autor que no posees puede traerte problemas. En caso de duda, consulta a un abogado, no a una sección de comentarios.
¿Por qué mi página guardada aún carga imágenes de web.archive.org?
Porque el Wayback Machine reescribe las URLs de los recursos en el HTML para apuntar a sus propios servidores, y un guardado del navegador mantiene esas URLs absolutas. Obtener los archivos con el modificador id_, o ejecutar un paso de reescritura de enlaces después, te da una copia autónoma.
¿Puedo descargar un sitio web de archive.org sin programar?
Sí. Los guardados manuales del navegador no necesitan código en absoluto, y los servicios de restauración automática manejan la programación por ti. La ruta de la API CDX es la única que realmente requiere programación.
¿Cuánto tiempo tarda en descargar un sitio web de archive.org?
El guardado manual toma 5-10 minutos por página. Un script CDX tarda unas horas en configurarse, luego 30-90 minutos en rastrear un sitio mediano. Una restauración automática toma minutos de tu tiempo; las máquinas hacen la espera.
Guías relacionadas

download entire website from archive org
Descarga un sitio web completo desde Archive.org, no solo la página de inicio
Para descargar un sitio web completo desde archive.org necesitas todas las páginas, imágenes y hojas de estilo. Los archivos se esconden bajo diferentes fechas, aquí te explicamos por qué, además de una lista de verificación completa.

archive.org download website
Herramientas de descarga de sitios web de Archive.org: una comparación honesta
Una comparación honesta de herramientas de descarga de sitios web de archive.org: HTTrack, scripts wayback-machine-downloader y Restorix. Costos reales, esfuerzo y manejo de activos.

wayback machine downloader
Herramientas de descarga del Wayback Machine: lo que realmente funciona
Un análisis honesto de las herramientas de descarga del Wayback Machine: los scripts de código abierto, sus límites reales y la opción llave en mano que vuelve a poner tu sitio en línea.

restore website from archive.org
Restaura un sitio web desde Archive.org: ¿bricolaje o servicio completo?
¿Debes restaurar un sitio web desde Archive.org por tu cuenta o pagar un servicio completo? Una comparación honesta de costo, tiempo, habilidad y riesgo, más un marco de decisión.
