Herramientas de descarga de sitios web de Archive.org: una comparación honesta
Por el equipo editorial de Restorix · 7 de julio de 2026 · 8 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Hay tres formas sensatas de extraer un sitio de la Wayback Machine, y las he usado todas en trabajos reales: HTTrack, la gema Ruby wayback-machine-downloader y sus scripts relacionados, y Restorix, el servicio al que dirijo a los clientes cuando el sitio tiene que volver a funcionar, no solo como un montón de archivos.
Ninguno de ellos es "el mejor". Resuelven problemas diferentes a precios diferentes, y el precio se paga mayormente en horas en lugar de dólares. Aquí está lo que cada uno realmente hace, dónde falla y quién debería elegir cuál. Sin clasificaciones afiliadas, solo lo que he visto salir bien y mal.
Qué tiene que hacer bien una herramienta de descarga de sitios web de archive.org
Juzgar estas herramientas por la velocidad de descensa pierde el punto. Las partes difíciles de un trabajo de descarga de sitios web de archive.org no son glamurosas, y son donde las herramientas difieren silenciosamente:
- Encontrar cada archivo. El índice del archivo es la única fuente completa, seguir enlaces desde la página de inicio extraña todas las páginas huérfanas.
- Emparejar activos a través de marcas de tiempo. La página de 2014 puede necesitar el logo de su única captura sobreviviente en 2012.
- Obtener los bytes originales. Hechos sin cuidado, guardas el marcado de la barra de herramientas de Wayback incrustado en cada archivo HTML.
- Reescribir enlaces internos para que la copia se navegue sin depender de los servidores de archive.org.
- Sobrevivir la limitación de velocidad. Archive.org limita la tasa a clientes impacientes, y los reintentos tienen que ser educados y pacientes.
Ten esas cinco cosas en mente. Explican cada fila en la tabla de comparación a continuación, y la mayoría de las malas reseñas que reciben estas herramientas se remontan a una de ellas.
HTTrack: gratis, antiguo y todavía en acción
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
HTTrack es el veterano: un navegador offline gratuito y de código abierto que ha estado copiando sitios desde la década de 1990. Apúntalo a una URL de la Wayback Machine y sigue los enlaces, guardando lo que encuentre en el disco. Hay una interfaz gráfica para Windows, el precio es adecuado, y para una copia rápida de un sitio pequeño funciona realmente bien.
Usado contra archive.org, las reservas se acumulan. HTTrack no sabe nada del índice del archivo, solo encuentra páginas alcanzables siguiendo enlaces desde tu URL de inicio, así que las páginas huérfanas quedan atrás. Captura lo que la redirección de wayback envía, mezclando marcas de tiempo sin avisarte. Y sus reglas de filtrado requieren una puesta a punto real: si las pones mal, tu copia de un blog de 2013 se desvía por un enlace hacia la web en vivo, y descargas el sitio actual en su lugar. Pregúntame cómo lo sé.
Una referencia realista: copiar un blog de WordPress de 40 páginas de 2012 a través de la Wayback Machine me tomó unas 40 minutos de configuración y un rastreo no supervisado de dos horas, y aún gasté otra hora limpiando fugas de la web en vivo de la carpeta. Esa es la forma honesta de un trabajo con HTTrack, barato, mayormente automático, y nunca del todo terminado cuando el rastreo finaliza.
- Costo: gratis.
- Esfuerzo: una o dos horas para aprender la sintaxis de filtrado; luego las copias se ejecutan sin supervisión.
- Ideal para: copias rápidas de sitios pequeños y bien enlazados cuando la fidelidad perfecta no es el objetivo.
- Cuidado con: desviarse a la web en vivo, marcas de tiempo de captura mixtas y URLs reescritas de wayback que terminan en tus archivos.

wayback-machine-downloader y la ruta de los scripts
wayback-machine-downloader es una gema Ruby que consulta el índice CDX del archivo, luego descarga cada archivo que lista para tu dominio, opcionalmente dentro de un rango de fechas. Debido a que lee el índice en lugar de seguir enlaces, encuentra páginas que HTTrack nunca ve. Varios scripts de Python flotando por GitHub hacen el mismo trabajo con diferentes banderas y diferentes niveles de pulido.
Las compensaciones son las típicas del código abierto. Necesitas Ruby o Python instalado y la confianza para leer un README. Los proyectos en este nicho se quedan en silencio durante años, así que revisa el rastreador de problemas antes de apostar una fecha límite por uno. Y cuando el rastreo finaliza, te corresponde el ensamblaje: los enlaces internos aún apuntan al dominio original, las marcas de tiempo de captura necesitan una verificación, y cualquier limpieza, eliminar etiquetas de analíticas antiguas, corregir URLs canónicas, convertir a HTTPS, es tu tarde del sábado.
- Costo: gratis, más tus horas.
- Esfuerzo: medio día si te sientes cómodo en una terminal; el rastreo en sí luego se ejecuta solo.
- Ideal para: desarrolladores y archivistas que quieren control total sobre cada byte y les gusta tenerlo.
- Cuidado con: rastreos limitados sin lógica de reintento, reescritura de enlaces dejada como tarea pendiente y lagunas de mantenimiento en el repositorio.
Dos hábitos hacen que la ruta del script sea viable. Guarda la respuesta CDX de la que partiste, sirve como tu manifiesto cuando alguien pregunta qué debería estar en la carpeta. Y sirve el resultado localmente antes de darlo por terminado: cinco minutos navegando la copia en localhost encuentras activos faltantes más rápido que cualquier archivo de registro.
Restorix: la opción hecha por ti de descarga de sitios web de archive.org
Restorix CMS está en el extremo de pago y hecho por ti del espectro, y está construido específicamente para restauraciones de archive.org en lugar de scraping general. Ingresa el dominio y obtienes una estimación instantánea gratuita: número exacto de archivos archivados, tamaño total y un precio fijo. Eliges un rango de fechas y tus opciones, enlaces internos relativos, eliminación de analíticas y anuncios, conversión a HTTPS, minimización de JS/CSS, canonicización con www o sin www, y el servicio maneja la enumeración del índice, el emparejamiento de activos entre marcas de tiempo, la limitación de velocidad y la reescritura de enlaces.
El resultado se descarga como una copia limpia y navegable, o se despliega directamente en tu hosting por SSH/SFTP, FTP/FTPS, o S3, con un pequeño CMS de un solo archivo incluido para editar páginas restauradas después. Pagas por archivo restaurado, el primer archivo es gratis, y las restauraciones fallidas reembolsan automáticamente a tu saldo. No hay suscripción, las recargas son únicas, con tarjeta o cripto. No es la ruta del aficionado, y no intenta serlo.

Herramientas de descarga de sitios web de Archive.org, lado a lado
| HTTrack | Scripts (gema / Python) | Restorix | |
|---|---|---|---|
| Precio | Gratis | Gratis | Pago por archivo, primer archivo gratis |
| Encuentra páginas sin enlace | No, solo sigue enlaces | Sí, lee el índice CDX | Sí, lee el índice CDX |
| Emparejamiento de activos entre marcas de tiempo | No | Parcial | Sí |
| Bytes originales sin marcado de barra de herramientas | No | Sí, con las banderas correctas | Sí |
| Enlaces internos reescritos | Parcial | Los reescribes tú mismo | Sí, enlaces relativos opcionales |
| Se despliega en tu hosting | No | No | Sí, SSH, FTP, S3 |
| Esfuerzo típico de tu parte | Horas de ajuste de filtros | Medio día más ensamblaje | Unos 15 minutos |
| Ideal para | Copias rápidas y pequeñas | Desarrolladores que quieren control | Devolver el sitio a línea |
Lee la fila de esfuerzo dos veces. Cada herramienta en esta lista puede producir eventualmente la misma carpeta de archivos, lo que realmente estás eligiendo es quién hace el tedioso 20% del trabajo: tú, o algo más.
Una fila más que la tabla no puede contener: riesgo. Con las herramientas gratuitas, un trabajo mal hecho te cuesta otra noche. Con un servicio de pago, busca los términos de fallo, reembolsos automáticos al saldo, precio fijado antes de comenzar y estimación gratuita significan que el riesgo financiero de una restauración fallida es aproximadamente cero.
¿Cuál deberías elegir?
Guía honesta. Si necesitas un sitio pequeño copiado como referencia y te gustan las herramientas gratuitas, HTTrack lo pondrá en tu disco esta noche. Si escribes código, quieres los archivos crudos, y tienes un fin de semana para dedicar, la ruta de la gema es genuinamente buena y genuinamente gratis. Si el sitio es un activo comercial, la tienda WooCommerce de un cliente, un foro con diez años de publicaciones, tu propia obra de vida, paga la tarifa por archivo y pasa la tarde en otra cosa. El tutorial muestra el flujo completo de restauración antes de que gastes un centavo, y la estimación gratuita significa que puedes ver el precio exacto antes de decidir nada.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Hay una función oficial de descarga de sitios web en archive.org?
No. La Wayback Machine está construida para navegar capturas individuales, y archive.org no ofrece una exportación de sitios completos. Cada método por lotes, HTTrack, scripts descargadores, servicios de restauración, es una herramienta de terceros que lee las mismas capturas públicas y el mismo índice público.
¿HTTrack o wayback-machine-downloader es mejor para archive.org?
Trabajos diferentes. HTTrack rastrea enlaces y es adecuado para copias pequeñas y simples. wayback-machine-downloader lee el índice del archivo, así que encuentra páginas sin enlaces y maneja rangos de fechas correctamente. Para cualquier cosa más grande que unas pocas docenas de páginas, el enfoque basado en índice gana.
¿Cuánto cuesta restaurar un sitio con Restorix?
Pagas una pequeña tarifa fija por archivo restaurado, con el primer archivo gratis y el precio fijado en el momento de la estimación, así que ves el total exacto para tu sitio específico antes de pagar nada. Las recargas son únicas, con tarjeta o cripto, y existen códigos promocionales. Nada es recurrente.
¿Pueden estas herramientas devolver el sitio a mi hosting, o solo descargar archivos?
HTTrack y los scripts se detienen en archivos en tu disco; subirlos, corregir enlaces y configurar el hosting es tu responsabilidad. Restorix puede desplegar la copia restaurada directamente en servidores SSH/SFTP, hosting compartido FTP/FTPS, o S3, e incluye un CMS simple para editar páginas después.
¿Necesito conocer todas las URLs antiguas antes de descargar?
No. Las herramientas basadas en índice enumeran cada URL capturada desde la API CDX, así que solo necesitas el dominio. Los rastreadores de enlaces como HTTrack necesitan solo una URL de inicio, pero se perderán cualquier cosa que no estuviera enlazada desde algún lugar que su rastreo pudiera alcanzar.
Guías relacionadas

wayback machine downloader
Herramientas de descarga del Wayback Machine: lo que realmente funciona
Un análisis honesto de las herramientas de descarga del Wayback Machine: los scripts de código abierto, sus límites reales y la opción llave en mano que vuelve a poner tu sitio en línea.

web downloader
Herramientas de descarga web comparadas: lo que guardan y lo que rompen
Cómo funciona un descargador web, qué conservan realmente HTTrack, wget, SiteSucker y la opción del navegador, qué rompe cada uno y cuándo conviene restaurar.

download a website from archive org
Cómo descargar un sitio web de Archive.org: 3 métodos que funcionan
Tres formas comprobadas de descargar un sitio web de archive.org: guardar páginas manualmente, programar la API CDX o ejecutar una restauración automática. Estimaciones realistas de tiempo para cada una.
