Descargar un sitio completo desde Wayback Machine
Por el equipo editorial de Restorix · 26 de mayo de 2026 · 8 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Guardar una página desde Wayback Machine lleva dos minutos. Guardar todo el sitio es un trabajo completamente distinto, de los que se comen un fin de semana si entras a ciegas. El archivo no guarda tu sitio como un paquete ordenado. Guarda miles de capturas separadas, cada una congelada en su propio momento de rastreo, y volver a unirlas en un sitio coherente es donde se atasca la mayoría. Esta guía repasa los tropiezos que realmente rompen las descargas de sitios completos y el punto en que la automatización deja de ser opcional.
Por qué descargar un sitio completo de Wayback Machine es más difícil que una sola página
Una página es una captura. Un sitio es cada URL que el rastreador llegó a encontrar, cada una archivada en su propio calendario. Tu página de inicio puede tener 9.000 capturas. Tu página de envíos y devoluciones puede tener tres, y la más nueva puede ser de 2017. Cuando descargas un sitio desde Wayback Machine, estás armando un mosaico con piezas que nunca se hicieron para encajar.
Los recursos lo empeoran. El logo es una captura. La hoja de estilos es otra, posiblemente de un año distinto. El archivo sirve cada una con URLs reescritas que solo resuelven dentro de web.archive.org, así que una copia ingenua del sitio se rompe en cuanto la abres en local. Una página perdona esas falhas. Quinientas las multiplican.
Mapea el sitio antes de descargar nada
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
No empieces con wget. Empieza con la API CDX y saca el inventario completo de lo que realmente guarda el archivo:
web.archive.org/cdx/search/cdx?url=example.com/*&matchType=prefix&output=json&collapse=urlkey&filter=statuscode:200
Esa sola petición te dice cuántas URLs únicas existen, qué secciones cubrió el rastreador y dónde están los huecos. En un trabajo reciente, un foro phpBB de 2009, el inventario mostró 22.000 URLs únicas. Quizá 1.400 eran contenido real. El resto eran IDs de sesión, duplicados de vista de impresión y páginas de calendario que nadie leyó jamás.
Lee el inventario como un contratista
- Cuenta las URLs por directorio. Una sección /images gorda significa que los recursos sobrevivieron; una fina significa dolores de cabeza después.
- Revisa el rango de fechas por sección. Si tu blog se detiene en 2016 pero la página de inicio llega hasta 2023, el blog se desenlazó o se bloqueó, no se borró.
- Detecta pronto patrones basura: parámetros de sesión, formularios de respuesta, órdenes de clasificación. Inflan el recuento y el tiempo de descarga.
- Anota los tipos MIME. Muchos text/html sin apenas imágenes significa que el archivo guardó el esqueleto y perdió la piel.
Si quieres el inventario sin escribir una sola petición, la estimación gratuita de Restorix muestra el recuento exacto de archivos archivados y el tamaño total de un dominio antes de gastar nada. Ese número cambia el plan. Trescientos archivos es una tarde DIY. Treinta mil no.

Los tropiezos que rompen una descarga de sitio en Wayback Machine
Cada punto de esta lista me ha quemado al menos una vez. Ninguno es obvio hasta que llevas tres horas descargando y el resultado no tiene sentido.
- Historial de robots.txt. Durante años el archivo se negó a rastrear o servir páginas bloqueadas por robots.txt. Si un dueño anterior lo configuró mal, directorios enteros simplemente no existen en el archivo, y ninguna herramienta puede sacarlos de la nada.
- Dispersión de hosts. www.example.com, example.com, blog.example.com y el viejo host de CDN son conjuntos de capturas distintos. Una consulta de prefijo en un solo host pasa por alto los demás en silencio, y un script rastreador también.
- http frente a https. La misma página en ambos esquemas se archiva dos veces, a veces con recursos diferentes. Elige la variante con mejor cobertura, no la que recuerdas.
- Páginas renderizadas con JavaScript. El rastreador guardó lo que pudo ejecutar en el momento. Un sitio React de 2019 puede volver como una cáscara de divs vacíos con el contenido real desaparecido.
- Deriva de fechas. Archivos capturados en 2014, 2017 y 2021 unidos en un solo sitio producen layouts rotos y navegaciones que no encajan. Fija todo a una fecha objetivo.
- El cromo de Wayback. Las instantáneas servidas de forma normal incluyen la barra de herramientas del archivo y los enlaces reescritos. Descarga con el sufijo id_ en la marca de tiempo, o prepárate para quitar el cromo de cada archivo que guardes.
Parámetros de consulta, paginación y otras trampas de URL
Los parámetros de consulta son donde las descargas de sitios enteros fallan en silencio. Para el archivo, /shop?cat=shoes y /shop?cat=hats son URLs distintas con capturas distintas. Lo mismo pasa con ?page=2 y ?page=200. Una tienda WooCommerce de un cliente con la que trabajé tenía 4.000 URLs archivadas y solo 90 productos reales. El resto eran combinaciones de filtros, órdenes de clasificación y parámetros de seguimiento.
La estrategia es mecánica. Saca la lista del CDX, agrupa las URLs por la ruta antes del signo de interrogación y decide qué parámetros aportan contenido. IDs de producto y paginación: se quedan. IDs de sesión, etiquetas UTM y permutaciones de filtros: se van. Si te equivocas en un方向 pierdes páginas reales. Si te equivocas en el otro descargas diez veces más basura y lo pagas en horas.

Cuando tu descarga de sitio en Wayback Machine vuelve con huecos
Los recursos faltantes son la norma, no la excepción. Espera huecos en:
- Imágenes con carga diferida e inyectadas por JavaScript que el rastreador nunca llegó a disparar
- Imágenes de fondo en CSS y web fonts referenciados desde dentro de las hojas de estilos
- Archivos de audio y vídeo, que el archivo captura como mucho de forma inconsistente
- Fuentes e iconos cargados desde kits de terceros que necesitaban una API key activa
- Todo lo que se servía desde un dominio de terceros, una red de anuncios o detrás de un login
Para cada hueco las opciones son limitadas: prueba marcas de tiempo cercanas, prueba las variantes www y no-www o http y https, o acepta la pérdida y regenera el recurso. Aquí es donde un manifiesto se gana su sitio. Restorix entrega un manifiesto en JSON o SQLite con cada restauración, así que descubrir qué archivos faltan se convierte en una consulta de filtro en lugar de una tarde clicando páginas.
Cuándo dejar de programar scripts y automatizar
Haz las cuentas con honestidad. Un script de descarga decente para un sitio problemático es un fin de semana de construcción y depuración, más horas de reejecuciones cuando archive.org te limita en el archivo 8.000 de 9.000. Después empieza un segundo proyecto entero: quitar las reescrituras de Wayback, arreglar los enlaces internos, elegir un host canónico, desplegar y probar.
La automatización tiene sentido en cuanto el sitio necesita volver a funcionar en vez de existir solo en tu disco. Restorix se encarga de la descarga, la limpieza y el despliegue en un solo trabajo: pagas por archivo restaurado, el primer archivo es gratis, el precio se congela en el momento de la estimación y, si algo falla, se hace un reembolso automático a tu saldo. La ruta DIY sigue teniendo sentido para sitios pequeños, trabajos de investigación y gente que disfruta el rompecabezas. He hecho las dos rutas más veces de las que puedo contar, y el punto de equilibrio llega antes de lo que la gente espera, casi siempre en la segunda reejecución.
De los archivos descargados a un sitio que funciona
- Quita la barra de herramientas de Wayback y reescribe cada URL de archive.org a una ruta relativa.
- Elige un host canónico, www o no-www, y redirige el otro.
- Convierte los enlaces internos a HTTPS antes de desplegar en cualquier sitio moderno.
- Elimina los scripts de terceros muertos: analíticas viejas, etiquetas de anuncios y widgets sociales que llaman a casa.
- Despliega y luego recorre las 50 páginas principales con la pestaña de red del navegador abierta para atrapar lo que siga devolviendo 404.
Dos cosas siempre fallan en esta fase: los formularios de contacto y la búsqueda. Ambos dependían de código del servidor que el archivo nunca capturó. Sustituye los formularios por un servicio de formularios alojado o un simple mailto, y cambia la búsqueda del sitio por un índice estático o una caja de búsqueda con alcance al motor de búsqueda.
Restorix integra todo esto en las opciones de restauración: enlaces internos relativos, conversión a HTTPS, eliminación de analíticas, despliegue con un clic a SSH, FTP o S3, y un pequeño CMS incluido para que el sitio restaurado siga siendo editable. Hazlo a mano o deja que el servicio lo haga; la lista de comprobación es la misma en ambos casos. Solo cambian las horas.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Puedo descargar un sitio entero desde Wayback Machine gratis?
Sí, con scripts de código abierto y tu propio tiempo. La descarga en sí no cuesta nada; la limpieza es lo que pagas en horas. Para un sitio estático pequeño, el trueque vale. Para una tienda de 10.000 URLs, ponle precio a tu fin de semana antes de comprometerte.
¿Por qué no aparecen algunas páginas de mi sitio en el archivo?
Las razones habituales: robots.txt bloqueó al rastreador, la página nunca se enlazó desde ningún lugar al que el rastreador llegara, requería un inicio de sesión, o solo existió brevemente entre rastreos. Un inventario con la API CDX muestra exactamente lo que hay, así que comprueba antes de suponer.
¿Cómo consigo una lista de todas las URLs archivadas de mi dominio?
Consulta web.archive.org/cdx/search/cdx?url=example.com/*&matchType=prefix&output=json. Añade collapse=urlkey para deduplicar por URL y filter=statuscode:200 para descartar capturas con error. El resultado es tu sitemap real.
¿Debo restaurar la captura más nueva o una más antigua?
La más nueva no es automáticamente la mejor. Elige la captura de cuando el sitio estaba sano: antes de ser hackeado, aparcado o desmantelado. Compara algunas fechas candidatas en la vista de calendario y comprueba qué tan completa se ve cada una antes de decidir.
¿Guarda Wayback Machine vídeos y archivos descargables?
A veces. Los archivos multimedia grandes se capturan de forma inconsistente, mientras que los PDFs y las imágenes corren mejor suerte. Filtra el inventario del CDX por tipo MIME antes de prometerle a alguien que un repositorio de medios sobrevivió.
¿Cuánto tarda en descargarse un sitio entero?
Un sitio de 500 páginas con un script educado: varias horas con rate limiting. Decenas de miles de archivos: un día o más de vigilancia y reejecuciones. Una restauración automatizada corre en la infraestructura de otro mientras tú ves el progreso en un panel.
Guías relacionadas

download entire website from archive org
Descarga un sitio web completo desde Archive.org, no solo la página de inicio
Para descargar un sitio web completo desde archive.org necesitas todas las páginas, imágenes y hojas de estilo. Los archivos se esconden bajo diferentes fechas, aquí te explicamos por qué, además de una lista de verificación completa.

wayback download
Descarga de Wayback: Todos los métodos ordenados por esfuerzo
Todos los métodos de descarga de Wayback ordenados por esfuerzo: páginas individuales, scripts wget, la API CDX y servicios automatizados que reconstruyen todo el sitio por ti.

wayback machine restore
Restauración con Wayback Machine: 4 errores y cómo evitarlos
Una restauración con Wayback Machine puede fallar silenciosamente: páginas en parking, cadenas de redirecciones, imágenes faltantes y fechas mezcladas. Cómo detectar cada error y evitarlo.

find all pages on a website
Cómo encontrar todas las páginas de un sitio web (incluso las eliminadas)
¿Necesitas encontrar todas las páginas de un sitio web, incluidas las que nadie enlaza? Compara sitemaps, rastreadores, la API CDX del Wayback Machine y exportaciones de Search Console.
