Herramientas de descarga del Wayback Machine: lo que realmente funciona
Por el equipo editorial de Restorix · 9 de mayo de 2026 · 8 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Buscas un descargador del Wayback Machine y terminas en el mismo puñado de herramientas que todos han usado durante una década, más un cementerio de repositorios de GitHub abandonados. Algunas de estas herramientas realmente funcionan. Todas comparten el mismo techo. Esta es la reseña que wish someone had handed me before my first restore job: lo que hacen los scripts de código abierto, dónde se quedan cortos y qué usar en su lugar cuando el sitio tiene que volver a estar en línea.
Qué hace realmente un descargador del Wayback Machine
Cada descargador del Wayback Machine es la misma máquina bajo distinta pintura. Le pide a la CDX API una lista de capturas, recorre esa lista y guarda cada archivo desde su URL con marca de tiempo. Los mejores añaden filtros por fecha y tipo de archivo, además de lógica de reintentos para cuando archive.org empieza a limitarte. Ninguno se conecta a una copia secreta de tu sitio. Raspan el mismo archivo público que puedes abrir en un navegador ahora mismo.
Esa distinción importa más que cualquier lista de características. Un descargador hereda cada hueco del archivo: las páginas que nunca se rastrearon, las imágenes que nunca se capturaron, el directorio bloqueado por un robots.txt que alguien configuró mal en 2015. La herramienta solo puede obtener lo que existe.
Las cifras también crecen rápido. Un sitio modesto de 200 páginas, una vez que cuentas imágenes, hojas de estilo y scripts, se convierte fácilmente en 2.000 archivos. A una solicitud por segundo con buenos modales, son más de media hora de descarga pura, antes de reintentos, antes de las limitaciones, antes de los archivos que devuelven 404 porque el archivo los perdió hace años.
Las opciones de código abierto
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Tres nombres aparecen en cada hilo de foro, y por buenas razones:
- wayback-machine-downloader, una gema de Ruby. La más conocida del grupo. Un solo comando, wayback_machine_downloader http://example.com --from 2015 --to 2019, y llena un directorio ./websites con cada captura coincidente. Incluye un flag de concurrencia y filtros por extensión de archivo.
- waybackpack, una herramienta en Python. Descarga capturas organizadas por marca de tiempo, lo que la hace útil para sacar una instantánea específica de una página y está menos orientada a espejos completos del sitio.
- HTTrack apuntando a una URL de una instantánea. No es realmente una herramienta de archivo. Sigue los enlaces reescritos que Wayback inyecta en las páginas y arrastra todo el árbol de una captura. Cruda, ocasionalmente efectiva en sitios pequeños y completamente perdida con los query strings.
Las tres son gratis. Las tres se mantienen a ritmo de proyecto personal. Y las tres te dejan una pila de archivos. Lo que pasa después es tu problema, y esa frase cubre aproximadamente el ochenta por ciento de lo que sigue. Antes de instalar cualquiera de ellas, lee los issues abiertos en el repositorio. Diez minutos ahí te dicen más que cualquier comparativa.

Qué esperar de un script gratuito de descarga del Wayback Machine
Ajusta las expectativas antes de ejecutar nada. Una primera sesión típica con un descargador gratuito del Wayback Machine sigue este guion: treinta minutos peleándote con tu instalación de Ruby o Python, diez minutos de progreso prometedor, y entonces archive.org empieza a responder con errores 429 y todo se ralentiza hasta casi detenerse. Un sitio de 5.000 archivos a tasas educadas es un trabajo de toda la noche, y los trabajos de toda la noche fallan en silencio a las 3 de la madrugada.
Una primera ejecución realista
- Instala el runtime y la herramienta. Depura los conflictos de versiones que nadie menciona en el README.
- Ejecuta una prueba pequeña contra un directorio del sitio para confirmar el formato de salida.
- Lanza la ejecución completa y observa cómo llegan los primeros cien archivos.
- Topas con los límites de tasa, bajas la concurrencia, reinicias y esperas que la lógica de reanudación funcione.
- Abres la carpeta de salida y descubres la basura que descargaste junto con el oro.
La salida siempre necesita triage. A menos que hayas filtrado bien, obtienes cada captura de cada URL: basura de parámetros de seguimiento, vistas de impresión, páginas de error que devolvieron un 200 de todas formas. Y a menos que la herramienta haya obtenido las variantes id_, los bytes originales sin modificar, cada archivo HTML llega con los enlaces reescritos por Wayback y la barra de herramientas todavía incrustada.
Otra sorpresa es la organización. La mayoría de los scripts vuelcan todo en rutas con marca de tiempo que reflejan el archivo, no la estructura de directorios original. Reconstruir el árbol de carpetas real y renombrar los archivos a como los llamaba el servidor es trabajo manual que nadie presupuesta.
Los límites con los que te vas a topar
- Sin lógica de restauración. Un descargador obtiene archivos. No elimina la barra de Wayback, no corrige los enlaces internos, no elige un host canónico ni convierte nada a HTTPS.
- Sin inteligencia de deduplicación. La misma imagen guardada bajo seis marcas de tiempo se convierte en seis archivos, a menos que tú mismo la colapses por hash de contenido.
- Límites de tasa. Si aprietas demasiado, archive.org te limita o te bloquea directamente durante un rato. Las reejecuciones son parte normal del flujo, no señal de que hiciste algo mal.
- Putrefacción de dependencias. Los scripts anclados a versiones antiguas de Ruby o Python se rompen en sistemas modernos. Revisa la fecha del último commit en el repositorio antes de instalar nada.
- Sin soporte. Cuando la herramienta se rompe, el tracker de issues es el servicio técnico, y la última respuesta puede ser de hace dos años.
- Sin línea de meta. Cuando el script termina, tienes una carpeta. Convertir esa carpeta en un sitio web alojado y funcional es un segundo proyecto de tamaño similar.

La alternativa llave en mano
La alternativa a estar vigilando scripts es un servicio que trata la descarga como el paso uno de una restauración en lugar de todo el trabajo. El servicio Restorix empieza con un presupuesto gratuito: número exacto de archivos archivados, tamaño total y precio cerrado antes de que pagues un céntimo. A partir de ahí descarga todo, lo limpia y puede desplegar directamente a tu hosting por SSH, FTP o S3.
Los detalles están pensados para este trabajo concreto. Pagas por archivo restaurado, con el primero gratis. Si una restauración o un despliegue falla, el reembolso llega a tu saldo automáticamente, sin ticket de soporte. Las opciones de restauración eliminan analítica y anuncios, reescriben los enlaces a rutas relativas y fuerzan HTTPS. Los despliegues incluyen un pequeño CMS de un solo archivo con su propia contraseña de administrador generada, para que el sitio restaurado siga siendo editable. Sin suscripciones en ningún sitio: recargas saldo y lo gastas.
Cuándo un descargador del Wayback Machine es la herramienta equivocada
Un script descargador es la herramienta adecuada para archivos offline, conjuntos de datos de investigación y rescatar una carpeta de PDFs antiguos. Es la herramienta equivocada cuando:
- El sitio tiene que volver a estar en línea y verse correcto al hacerlo
- La persona que hace el trabajo no va a abrir nunca una terminal
- El archivo contiene decenas de miles de URLs, la mitad basura de query strings
- Hay una fecha límite: un relanzamiento, un requerimiento legal, un cliente encima
Para esos casos el script no es más barato que el servicio. Solo esconde la factura en tus horas. Un presupuesto de Restorix al menos te dice el precio real por adelantado, antes de que comprometas un fin de semana entero a descubrirlo por las malas. Nada de eso convierte a los scripts en malas herramientas. Los convierte en herramientas con una descripción de puesto, y esa descripción termina en la carpeta.
Cómo elegir
| Tu situación | Herramienta adecuada | Por qué |
|---|---|---|
| Necesitas una instantánea como referencia | Navegador más el truco de la URL id_ | Dos minutos, sin instalación |
| Sitio pequeño, cómodo con la CLI | Gema wayback-machine-downloader | Gratis, probada, buenos filtros |
| Archivos específicos a escala | CDX API más tu propio script | Control total sobre el filtrado |
| El sitio tiene que volver a vivir | Restorix | Descarga, limpieza y despliegue en un solo trabajo |
Elige por destino, no por descarga. Si una carpeta de archivos es el objetivo, las herramientas gratuitas se ganan su sitio y siempre lo harán. Si el objetivo es el sitio web en sí, sáltate por completo la etapa de la carpeta y ve directo a lo que lo reconstruye.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Existe un descargador oficial del Wayback Machine?
No. La Internet Archive mantiene el Wayback Machine y ofrece la CDX API, pero no publica ningún descargador masivo oficial. Cada herramienta en este espacio es de terceros y está construida sobre los mismos endpoints públicos que tú mismo puedes consultar.
¿Es segura la gema wayback-machine-downloader de Ruby?
Es un proyecto de código abierto con larga trayectoria y seguro en el sentido habitual: lee el código, instala desde el repositorio oficial y desconfía de paquetes con nombres similares. El riesgo práctico mayor es un fork abandonado que falle en silencio a mitad de un sitio grande.
¿Por qué mi descarga se detuvo a mitad de camino?
Casi siempre por rate limiting. archive.org responde a los clientes agresivos con errores 429. Baja la concurrencia, añade pausas entre solicitudes y reanuda. La mayoría de las herramientas pueden continuar donde se quedaron, así que una pausa cuesta tiempo, no progreso.
¿Puede un descargador obtener páginas protegidas por contraseña o eliminadas?
No a las contraseñas: el rastreador nunca pasó el inicio de sesión, así que no hay nada que descargar. Sí a las páginas eliminadas: el borrado de la web es justo lo que el archivo protege, siempre que se haya rastreado antes del borrado.
¿Son mejores las apps de pago que los scripts gratuitos?
A veces son los mismos scripts gratuitos con una interfaz encima. Juzga por el resultado, no por el precio: ¿obtienes los archivos id_ originales, deduplicación sensata y enlaces limpios, o una carpeta de HTML reescrito? Un servicio de restauración se salta la pregunta por completo entregándote un sitio terminado en lugar de archivos.
¿Cómo convierto los archivos descargados en un sitio web funcional?
Elimina las reescrituras de Wayback, haz relativos los enlaces internos, elige un host canónico y luego despliega y prueba. O deja que un servicio de restauración haga las cuatro cosas por ti, que es justo la razón por la que esos servicios existen.
Guías relacionadas

wayback download
Descarga de Wayback: Todos los métodos ordenados por esfuerzo
Todos los métodos de descarga de Wayback ordenados por esfuerzo: páginas individuales, scripts wget, la API CDX y servicios automatizados que reconstruyen todo el sitio por ti.

wayback machine download site
Descargar un sitio completo desde Wayback Machine
Cómo descargar un sitio entero desde Wayback Machine: tropiezos del rastreo, páginas con parámetros, recursos faltantes y cuándo una restauración automatizada supera a los scripts caseros.

restore website from wayback machine
Restaurar un sitio web desde Wayback Machine: guía completa
Restaura un sitio web desde Wayback Machine de principio a fin: elige la instantánea correcta, configura las opciones de restauración y despliega un sitio funcional con CMS en menos de una hora.
