Descarga un sitio web completo desde Archive.org, no solo la página de inicio
Por el equipo editorial de Restorix · 15 de julio de 2026 · 8 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Cualquiera puede guardar una página de inicio. La página de inicio es la parte fácil: son los 4.000 archivos que hay detrás lo que separa 'guardé una copia' de 'realmente tengo el sitio'. Cuando alguien me pide descargar un sitio web completo desde archive.org, la página de inicio suele estar ya en su escritorio, y la hoja de estilo, no.
Este artículo trata sobre la palabra 'completo'. Qué incluye realmente una copia íntegra, por qué el archivo dispersa tus recursos a lo largo de años con fechas distintas, y una lista de verificación que puedes aplicar al final para demostrar que lo obtuviste todo, en lugar de simplemente esperarlo.
Qué significa 'completo' cuando descargas un sitio web completo desde archive.org
Una copia completa tiene cuatro capas, y la mayoría de la gente se detiene después de la primera. El HTML de cada página que existió. Los recursos que cada página referencia: imágenes, hojas de estilo, JavaScript, fuentes, PDFs, videos. Los enlaces internos reescritos para que la copia se pueda navegar por sí sola, sin depender de los servidores de archive.org. Y un manifiesto de lo capturado, para que los huecos queden documentados en lugar de ser descubiertos después por un cliente.
- Páginas: cada URL que el rastreador llegó a ver, no solo las que están en el menú principal. Los sitios antiguos esconden secciones enteras tras enlaces olvidados en el pie de página.
- Recursos: imágenes, CSS, JS, fuentes y archivos descargables, en la mayoría de sitios superan en número a las páginas cinco a uno.
- Enlaces: reescritos a rutas relativas, o tu copia solo funcionará mientras archive.org siga activo.
- Un manifiesto: una lista archivo por archivo de lo que tienes, que convierte 'creo que lo tengo todo' en algo verificable.
El número de archivos sorprende a la gente. Un sitio empresarial modesto de 50 páginas suma habitualmente entre 400 y 800 archivos. Un foro phpBB de 2009 con avatares y archivos adjuntos puede alcanzar las decenas de miles. Planifica según el número de archivos, no según el número de páginas.
También hay una diferencia entre una copia que se navega y una copia que se puede volver a desplegar. Una copia para navegar solo necesita los archivos y enlaces funcionales. Una copia que piensas volver a poner en un hosting necesita más: URL canónicas coherentes (elige www o no-www), referencias listas para HTTPS, y peso muerto como scripts de analytics con una década de antigüedad eliminados. Decide cuál de las dos vas a construir antes de empezar, porque adaptar cualquiera de las dos a posteriori resulta tedioso.
Por qué los recursos viven bajo fechas distintas
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
La Wayback Machine no fotografía un sitio entero en una tarde. Sus rastreadores obtienen lo que pueden alcanzar, siempre que llegan a alcanzarlo. Tu página de inicio de 2014 podría hacer referencia a un logo capturado por última vez en 2012, una hoja de estilo capturada seis veces a lo largo de cinco años, y una imagen principal que nunca fue capturada. Cuando ves esa página, archive.org sustituye silenciosamente la captura más cercana que tenga de cada recurso. Por eso la página se ve bien en tu navegador aunque sus partes estén dispersas a lo largo de una década.
Se derivan dos consecuencias. Primero, no existe una única 'fecha del sitio' a la que puedas apuntar un descargador: una descarga completa extrae cada archivo de su propia mejor captura. Segundo, el truco de la captura más cercana oculta los huecos: wayback servirá sin avisar una imagen de 2016 dentro de tu página de 2014. Inocuo para una navegación casual, pero conviene tenerlo presente cuando te importa si la página restaurada es realmente la de 2014.
Una página archivada es un collage. El HTML, las imágenes y el CSS se congelaron cada uno en momentos distintos, y el archivo los vuelve a pegar cada vez que alguien lo consulta.

Cualquier herramienta o script que utilices necesita una estrategia para esto. La estrategia vaga, obtener todo en una sola fecha, es exactamente cómo acabas con una página llena de iconos de imagen rota, porque la mitad de los recursos simplemente no tienen captura esa semana. La estrategia correcta es por archivo: tomar cada recurso de su propia mejor captura dentro de tu rango de fechas.
Cómo descargar un sitio web completo desde archive.org: empieza por el inventario
Antes de descargar un solo archivo, haz una lista de lo que el archivo realmente contiene. La API CDX te ofrece el libro mayor completo de un dominio: cada URL capturada con sus fechas, tipo MIME y estado HTTP. Filtra por statuscode 200, agrupa los duplicados por resumen de contenido, y tendrás una lista de la compra realista en lugar de una suposición.
Lee el inventario antes de descargar y descubrirás pronto las cosas incómodas. En aquel trabajo del foro phpBB, el listado CDX mostraba 11.000 URL capturadas, y unas 3.000 eran el mismo GIF de avatar guardado bajo distintas cadenas de consulta. Agrupar los duplicados convirtió un trabajo aterrador en uno normal. Ese mismo listado también expone las páginas que nunca fueron capturadas, algo que ningún método de descarga del mundo puede resucitar. Mejor saberlo desde el primer día.
Agrupa los supervivientes por tipo MIME y la forma del trabajo aparece: cuántas páginas HTML, cuántas imágenes, cuánto JavaScript, si hay PDFs o video de los que preocuparse. Esa agrupación marca tanto el orden de descarga como la verificación final de completitud.
Lista de verificación para descargar un sitio web completo desde archive.org sin huecos
- Obtén el inventario CDX del dominio, filtrado por capturas HTTP 200, cubriendo todo tu rango de fechas.
- Agrupa los duplicados por resumen de contenido para que los archivos idénticos se descarguen una vez en lugar de cientos.
- Agrupa la lista por tipo MIME: primero las páginas HTML, luego CSS, JS, imágenes, fuentes, documentos, medios.
- Descarga cada archivo de su propia mejor captura, usando el modificador id_ para obtener los bytes originales sin el marcado inyectado de wayback.
- Reescribe los enlaces internos a rutas relativas para que la copia funcione en cualquier host, incluido tu portátil.
- Sirve la carpeta localmente y navega haciendo clic. Los enlaces rotos, imágenes faltantes y errores 404 de fuentes aparecen en minutos.
- Compara el recuento final de archivos con el inventario y anota lo que falta y por qué.

Ese último paso es el que todos se saltan, y es la diferencia entre una copia de seguridad y un montón de archivos. Un manifiesto convierte 'creo que lo tengo todo' en una lista que puedes auditar. Restorix lo integra de serie: el presupuesto gratuito informa el número exacto de archivos archivados y el tamaño total antes de empezar, y la restauración puede exportar un manifiesto en JSON o SQLite de cada archivo recuperado, para que la completitud sea un número, no una sensación.
Los huecos con los que te encontrarás de todas formas
- Páginas que el rastreador nunca encontró. Si nada en la web pública enlazaba a una página, wayback probablemente nunca la vio.
- Exclusiones de robots.txt. Los rastreos antiguos omitían por completo las rutas bloqueadas, y algunos sitios bloquearon el archivado a propósito.
- Contenido renderizado por JavaScript. Históricamente, los rastreadores almacenaban el shell HTML, no lo que los scripts construían después.
- Inicios de sesión, carritos y resultados de búsqueda. Todo lo que está detrás de una solicitud POST o una sesión es un muro que el rastreador no pudo atravesar.
- Ruido de URL. Los IDs de sesión y los parámetros de seguimiento inflan el inventario con miles de 'páginas' duplicadas que al deduplicar quedan en unas pocas reales.
Ninguno de estos es un fallo de tu método: son agujeros del propio archivo. El valor del inventario es que te muestra los agujeros antes de prometer a alguien una restauración completa.
Cuando encuentres agujeros, documenta. Una nota de una página enumerando las doce páginas que nunca se capturaron, el video que solo existe como miniatura y la sección del foro bloqueada por robots.txt convierte una sorpresa incómoda en una expectativa gestionada. Los clientes perdonan los archivos que faltan. No perdonan descubrirlos por su cuenta.
Qué vale una copia completa
Si el sitio es la tienda de un cliente o un foro comunitario con una década de publicaciones, una descarga a medias es una responsabilidad disfrazada de copia de seguridad. O bien presupuestas las horas para ejecutar la lista de verificación tú mismo, o bien confías el rastreo, la coincidencia de fechas, la reescritura de enlaces y la generación de manifiestos a una herramienta diseñada exactamente para este trabajo. El presupuesto no cuesta nada, y la alternativa es descubrir las 300 imágenes que faltan después de que el sitio esté en producción.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Puedo descargar un sitio web completo desde archive.org con un solo clic?
Archive.org no ofrece exportación de un sitio completo: está pensado para navegar capturas individuales. Los resultados con un clic provienen de herramientas que enumeran el índice del archivo y obtienen cada archivo: scripts como wayback-machine-downloader, o servicios de restauración como Restorix que además gestionan los recursos, la reescritura de enlaces y el manifiesto.
¿Por qué faltan imágenes después de descargar un sitio web completo desde archive.org?
Habitualmente por una de dos razones. O bien la imagen nunca fue rastreada, así que no existe copia en ningún sitio, o bien tu herramienta obtuvo la página de una fecha mientras que la única captura de la imagen que sobrevive está en otra. La coincidencia de recursos entre fechas soluciona el segundo caso; nada soluciona el primero.
¿Archiva la Wayback Machine cada página de un sitio web?
No. Archiva lo que sus rastreadores pudieron alcanzar: páginas enlazadas desde algún sitio, permitidas por robots.txt, renderizadas sin inicios de sesión ni JavaScript pesado. Los hilos profundos de foros, las páginas de búsqueda facetada y las zonas de administración faltan habitualmente. El inventario CDX muestra exactamente qué existe antes de empezar.
¿Cuántos archivos suele implicar la descarga completa de un sitio web?
Más de lo que la gente espera. Un sitio empresarial modesto de 50 páginas suma a menudo entre 400 y 800 archivos una vez que se cuentan imágenes, hojas de estilo, scripts y fuentes. Los foros y las tiendas alcanzan las decenas de miles. El número de archivos, no el número de páginas, es lo que marca el tiempo y el coste de la descarga.
¿Se incluyen en el archivo los PDFs, videos y otras descargas?
A menudo, sí. El archivo almacena los documentos y medios que pudo alcanzar, y el índice CDX los lista por tipo MIME junto a las páginas. Los videos grandes son la excepción: se rastrearon de forma inconsistente, así que verifícalos en el inventario en lugar de asumir que sobrevivieron.
Guías relacionadas

download a website from archive org
Cómo descargar un sitio web de Archive.org: 3 métodos que funcionan
Tres formas comprobadas de descargar un sitio web de archive.org: guardar páginas manualmente, programar la API CDX o ejecutar una restauración automática. Estimaciones realistas de tiempo para cada una.

archive.org download website
Herramientas de descarga de sitios web de Archive.org: una comparación honesta
Una comparación honesta de herramientas de descarga de sitios web de archive.org: HTTrack, scripts wayback-machine-downloader y Restorix. Costos reales, esfuerzo y manejo de activos.

find all pages on a website
Cómo encontrar todas las páginas de un sitio web (incluso las eliminadas)
¿Necesitas encontrar todas las páginas de un sitio web, incluidas las que nadie enlaza? Compara sitemaps, rastreadores, la API CDX del Wayback Machine y exportaciones de Search Console.

wayback download
Descarga de Wayback: Todos los métodos ordenados por esfuerzo
Todos los métodos de descarga de Wayback ordenados por esfuerzo: páginas individuales, scripts wget, la API CDX y servicios automatizados que reconstruyen todo el sitio por ti.
