Herramientas de descarga web comparadas: lo que guardan y lo que rompen
Por el equipo editorial de Restorix · 17 de mayo de 2026 · 9 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Un proveedor de hosting dejó tirado a un cliente un fin de semana. Sin copias de seguridad, claro. El sitio seguía respondiendo el lunes por la mañana, a duras penas, y lo primero que hice fue apuntarle un descargador web para sacar todas las páginas accesibles antes de que se apagara para siempre. Para eso sirven estas herramientas: para atrapar lo que un servidor todavía te dé, rápido, antes de que deje de dártelo.
Pero un descargador web no es magia, y las cuatro herramientas que la gente suele usar de verdad, HTTrack, SiteSucker, wget y el propio botón Guardar del navegador, difieren mucho en lo que conservan. Aquí verás qué guarda cada una, qué rompe sin que lo notes y cómo elegir entre ellas.
Qué guarda realmente un descargador web
Todos los descargadores web funcionan igual por dentro. Piden una URL, analizan el HTML que vuelve, encuentran los recursos enlazados y los enlaces internos, los descargan, reescriben los enlaces para que funcionen desde tu disco y siguen hasta vaciar la cola. Un crawler con botón de guardar.
Qué acaba en tu disco:
- Páginas HTML, normalmente renombradas para que se abran en local sin servidor
- CSS, JavaScript y fuentes que referencian esas páginas
- Imágenes, vídeos, PDF y cualquier otro archivo al que las páginas enlacen directamente
- Una estructura de carpetas que refleja el esquema de URL original
Lo que no llega: todo lo que el servidor genera en el momento. El descargador recibe el mismo HTML renderizado que cualquier visitante anónimo. El PHP, la base de datos, el panel de administración, el historial de pedidos, nada de eso viaja por la red, así que nada de eso vuelve a casa. Un sitio de WordPress descargado es una estatua del sitio, no el sitio.
Dos detalles del alcance determinan lo que terminas teniendo. Primero, el descubrimiento: un crawler solo encuentra URLs enlazadas desde páginas que ya tiene, más el sitemap si se lo pasas, las páginas huérfanas sin enlaces entrantes siguen siendo invisibles. Segundo, la cortesía: la mayoría de las herramientas respetan robots.txt por defecto, y aunque HTTrack te permite saltártelo, solo deberías hacerlo en sitios que sean tuyos.
HTTrack y SiteSucker: las opciones con interfaz gráfica
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
HTTrack (WinHTTrack en Windows) es el abuelo de la categoría: gratis, de código abierto y con nosotros desde 1998. Pegas una URL, eliges una carpeta de proyecto y replica el sitio. El verdadero valor está en las opciones: límites de profundidad de rastreo, filtros por tipo de archivo, topes de ancho de banda y reglas de escaneo que incluyen o excluyen patrones de URL. Repliqué el portfolio de un fotógrafo de 400 páginas en unos veinte minutos, con todas las imágenes.
Ajustes que realmente cambio respecto a los valores por defecto:
- Profundidad máxima de réplica: sin límite en sitios pequeños, tope de 3 o 4 en los grandes
- Reglas de escaneo: añade un patrón de inclusión para el dominio objetivo para que el rastreo no se vaya a otros sitios
- Control de flujo: de dos a cuatro conexiones y límite de ancho de banda en cualquier servidor que no sea el tuyo
- Tipos MIME: excluye los vídeos en las primeras pasadas, una carpeta de webinars olvidada puede ocupar 40 GB
Los contras: la interfaz se nota su edad, la última versión importante salió hace años y no entiende JavaScript. Si una página construye su contenido en el navegador, HTTrack guarda el andamio vacío.
SiteSucker es la respuesta para Mac, unos pocos dólares en la App Store. Pegas una URL, le das a iniciar y descarga en segundo plano con valores por defecto razonables, pausa y reanudación incluidas. Tiene menos ajustes que HTTrack y la misma ceguera frente a JavaScript, pero para una réplica rápida y limpia en macOS es la opción menos dolorosa.
wget para quienes prefieren la terminal
wget es la opción guionizable, instalada en casi cualquier Linux y a un brew install de distancia en un Mac. La receta clásica para una réplica completa:
wget --mirror --convert-links --adjust-extension --page-requisites --no-parent https://example.com
Qué te aporta cada flag:
- --mirror activa la recursión y el control de fechas, así que las reejecuciones solo traen lo que cambió
- --convert-links reescribe los enlaces después de la descarga para que las páginas funcionen sin conexión
- --adjust-extension guarda las páginas generadas por el servidor como archivos.html correctos
- --page-requisites descarga el CSS, JS e imágenes que cada página necesita para renderizarse
- --no-parent mantiene el rastreo por debajo de la ruta inicial en lugar de tragarse todo el dominio
Complementos que conviene conocer: --wait=1 --random-wait te mantiene educado en servidores pequeños, -c reanuda una réplica interrumpida sin volver a descargar los archivos terminados, y --load-cookies con un archivo de cookies exportado puede sacar páginas protegidas por tu propio login. Y no confundas wget con curl: curl descarga una URL de maravilla, wget replica sitios enteros. La gente los mezcla constantemente.

Guardar del navegador: la opción que ya tienes
Ctrl+S, Página web completa: el descargador que ya tienes. Guarda una página más una carpeta de recursos. Para un recibo, un artículo o una página de contacto que necesitas ahora mismo, va bien. Incluso tiene un auténtico superpoder: el navegador guarda la página después de que JavaScript se haya ejecutado, así que una página cargada de React que a wget le da una cáscara vacía sale completamente renderizada.
Los límites se notan rápido. Las imágenes de fondo en CSS y las cadenas de @import suelen faltar, los enlaces apuntan de vuelta al sitio en vivo en lugar de unos a otros, y no hay recursión: un sitio de 300 páginas significa 300 guardados manuales. Un truco cercano que conviene conocer: la extensión SingleFile integra todos los recursos en un único archivo HTML autocontenido, después de que JavaScript se ejecute. Para archivar páginas individuales con mucho JS supera limpiamente al simple Ctrl+S. Guardar como PDF es otra historia: captura la apariencia, no la página, y nada dentro funciona.
Una sesión de descarga web, de principio a fin
La primera réplica de un sitio desconocido va mejor con una rutina. La mía:
- Revisa robots.txt y los términos del sitio antes de rastrear, y usa un flag de espera en servidores pequeños de todos modos.
- Elige el alcance: todo el dominio o solo una sección. Una regla no-parent o una regla de escaneo de HTTrack evita que un rastreo del blog se trague la tienda de al lado.
- Ejecuta la réplica y vigila el log. 403s repetidos significan detección de bots; un aluvión de páginas de calendario o tags significa que tu alcance se está escapando.
- Verifica al azar diez páginas sin conexión, incluyendo una con formulario de contacto y una galería pesada. Roto ahora significa roto para siempre.
- Compara el número de archivos locales con el sitemap del sitio. Una gran diferencia significa contenido renderizado por JavaScript o reglas de alcance que se comen páginas.
Lo que rompe cualquier descargador web
Elijas la herramienta que elijas, se rompen las mismas cosas, porque los problemas están en el medio, no en el software:
| Qué se rompe | Por qué pasa | Daño |
|---|---|---|
| Búsqueda, formularios, logins | El código del servidor ya no está | Funcionalidades muertas al llegar |
| Contenido renderizado por JavaScript | Los crawlers ven el HTML previo a JS | Secciones enteras desaparecidas |
| URLs construidas dentro de scripts o estilos en línea | El reescritor de enlaces no puede parsearlas | Imágenes y enlaces rotos |
| Páginas con query string (?p=123) | Nombres de archivo destrozados o deduplicados | Páginas perdidas en silencio |
| Vídeo en streaming (HLS/DASH) | Las URLs de los segmentos caducan a mitad de descarga | Clips que nunca se reproducen |
Vigila también los recursos de otros dominios. La mayoría de los crawlers se quedan en el host inicial por defecto, así que las imágenes servidas desde un subdominio de CDN o las fuentes de un host externo se saltan, a menos que amplíes el alcance, y entonces las páginas guardadas llegan a casa llenas de referencias rotas. También está el residuo SEO: las etiquetas canonical, las URLs de Open Graph y los enlaces internos absolutos siguen apuntando al dominio antiguo. Inofensivo en un archivo personal, un problema real si la réplica vuelve a estar en línea.
Un sitio descargado es una estatua: se ve exactamente bien, y nada dentro se mueve.

Cuándo un descargador web no es la herramienta adecuada
El caso obvio: el sitio ya está caído. Un descargador necesita un servidor en vivo que responda peticiones, y un dominio caducado o un host muerto no le da nada que rastrear. La copia superviviente está en la Wayback Machine, y apuntar wget a web.archive.org es un infierno: peticiones limitadas, URLs reescritas por el archivo, una barra de herramientas inyectada en cada página y snapshots desperdigados a lo largo de años.
Para eso existe nuestra plataforma. Restaura sitios a partir de snapshots de archivo con selección de rango de fechas, elimina la morralla del archivo y las analíticas antiguas, y muestra el número exacto de archivos archivados, el tamaño total y un precio cerrado antes de que pagues nada.
Segundo caso de herramienta equivocada: quieres el contenido, no los píxeles, artículos a una hoja de cálculo, productos a una base de datos. Eso es extracción, no descarga. Y tercero: si el sitio necesita recuperar sus funcionalidades basadas en base de datos, una tienda, un foro, una réplica estática te da el aspecto, no la máquina. Necesitas restauración más un backend nuevo.
De archivos a un sitio en vivo otra vez
Una carpeta de réplica no es un sitio web. Volver a ponerlo en línea implica alojarlo en algún sitio, corregir los enlaces absolutos, eliminar scripts de tracking muertos y resolver HTTPS. Se puede hacer a mano, o saltarte la fontanería: Restorix despliega los sitios restaurados directamente a SSH/SFTP, FTP/FTPS o S3, con un CMS ligero incluido para que el sitio vuelva a ser editable, no solo visualizable. De cualquier forma, prueba el resultado en un móvil antes de darlo por bueno.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Es legal descargar un sitio web con un descargador web?
Descargar páginas que un servidor entrega públicamente suele ser correcto: esos bytes se dan a cualquiera que los pida. Lo que importa es lo que hagas después. Republicar el contenido de otro en bloque es un problema de copyright, y martillear un servidor pequeño a toda velocidad puede incumplir sus términos de uso. Descarga tus propios sitios, pide permiso para el trabajo de clientes y mantén los límites de velocidad para todo lo demás.
¿Puede un descargador web atrapar páginas protegidas por login?
Para tus propias cuentas, sí. wget lo hace con --load-cookies y un archivo de cookies exportado; HTTrack tiene un truco de proxy catch-URL que captura tu sesión. Espera fricción: las sesiones caducan y los tokens CSRF rompen los rastreos a mitad de proceso, así que vigílalo de cerca. Y nunca entregues tus cookies a una herramienta online.
¿Por qué mi sitio descargado se ve roto cuando lo abro?
Casi siempre una de tres causas: URLs absolutas que aún apuntan al dominio en vivo, recursos cargados por JavaScript que el crawler nunca vio, o páginas con query string guardadas con nombres destrozados. Abre la consola del navegador en la copia local y lee los 404: listan exactamente lo que la herramienta se perdió.
¿Puedo ejecutar wget o HTTrack contra la Wayback Machine?
Técnicamente sí, prácticamente un desastre. Te encontrarás con límites de tasa, URLs reescritas por el archivo, marcado de barra de herramientas incrustado en cada página y archivos sacados de snapshots de hace años. Un restaurador hecho a propósito se encarga de todo eso por ti, para eso existe Restorix.
¿Cuál es el mejor descargador web para un sitio completo?
HTTrack si quieres una GUI en Windows o Linux, SiteSucker en Mac, wget si prefieres scripts. Para un sitio que ya está caído, ninguno te puede ayudar: no hay nada en vivo que rastrear, así que restaura desde snapshots de archivo.
Guías relacionadas

wayback machine downloader
Herramientas de descarga del Wayback Machine: lo que realmente funciona
Un análisis honesto de las herramientas de descarga del Wayback Machine: los scripts de código abierto, sus límites reales y la opción llave en mano que vuelve a poner tu sitio en línea.

download entire website from archive org
Descarga un sitio web completo desde Archive.org, no solo la página de inicio
Para descargar un sitio web completo desde archive.org necesitas todas las páginas, imágenes y hojas de estilo. Los archivos se esconden bajo diferentes fechas, aquí te explicamos por qué, además de una lista de verificación completa.

online website extractor
Herramientas de extracción de sitios web online: usos, límites y seguridad
Qué extrae de una página un extractor de sitios web online: texto, imágenes, enlaces, datos estructurados. Cómo se comparan las herramientas online con las locales y cómo mantenerse seguro.

restoration websites
Sitios web de restauración: Qué significa realmente la restauración de sitios web
Los sitios web de restauración reconstruyen sitios perdidos a partir de archivos web. En qué se diferencia la restauración de las copias de seguridad y los rediseños, y el flujo de trabajo desde la captura hasta el sitio en producción.
