Cómo descargar de Archive.org: items, capturas y más
Por el equipo editorial de Restorix · 28 de abril de 2026 · 8 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
La expresión «descargar de Archive.org» engloba dos trabajos muy distintos, y confundirlos es la mejor forma de perder una tarde. Trabajo uno: bajar archivos de un item, ya sea un libro, un driver o la grabación de un concierto. Trabajo dos: extraer un sitio web desde la Wayback Machine. El primero tiene un botón de descarga. El segundo, desde luego, no.
Yo hago las dos cosas cada semana, para restauraciones de clientes y para investigación. Aquí están todos los métodos que siguen funcionando, con sus pros y sus contras honrados: qué es un clic, qué es línea de comandos y qué es una trampa disfrazada de botón de descarga.
Dos formas de descargar de Archive.org
Archive.org almacena contenido en forma de items, paquetes autónomos de archivos con metadatos, como una carpeta etiquetada en una estantería. La Wayback Machine guarda capturas: copias con marca de tiempo de URLs individuales, servidas ya renderizadas con enlaces reescritos. Los items están pensados para descargarse. Las capturas están pensadas para verse en el navegador.
Todo lo que puedes hacer se deduce de esa división. La descarga de items cuenta con soporte oficial: botones, torrents, una CLI, una API de metadatos. Las «descargas» de capturas son en realidad reconstrucciones: preguntas a la API CDX qué existe, bajas los bytes originales de cada URL y luego arreglas los enlaces. Herramientas distintas, modos de fallo distintos, presupuestos de tiempo distintos.
¿No estás seguro de en qué mundo te mueves? Mira la URL. archive.org/details/algo es un item, descargable. web.archive.org/web/2012/http://example.com es una captura, solo visualizable. El mismo archivo, dos esquemas de direcciones, dos conjuntos de reglas.
Descarga items de Archive.org de la forma más sencilla
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Abre cualquier página de item y mira la caja de descargas a la derecha. Verás archivos individuales, casi siempre un enlace de torrent y, a veces, un atajo a un ZIP o al texto completo. Para un PDF o un ISO, haz clic en el archivo. Listo. Esta es la única parte de la descarga en Archive.org que funciona como la gente espera.
- Pulsa «SHOW ALL» para ver todos los archivos del item, incluidos logs y formatos derivados que la caja oculta.
- Las URLs directas son predecibles: archive.org/download/{identifier}/{filename}, perfectas para scripts y wget.
- La opción torrent suele superar a HTTP en items de varios gigas y reanuda sin problemas tras una conexión caída.
- Los derivados son versiones generadas, como texto con OCR o MP4 más pequeños. La subida original está marcada como tal; elige esa cuando la fidelidad importa.
Un truco más para quienes programan: añade /metadata/{identifier} a archive.org y obtendrás un listado en JSON con todos los archivos, su tamaño, checksum y formato. Ese JSON es exactamente lo que consume la herramienta de línea de comandos por debajo.

Descargas masivas con la CLI de Internet Archive
Si son más de unos pocos items, instala la herramienta oficial de línea de comandos, el paquete de Python internetarchive, que proporciona el comando ia. Se encarga de autenticación, reanudación y reintentos, y es la diferencia entre un script y un fin de semana de clics.
- Instala con pip install internetarchive y luego ejecuta ia configure una vez con tu cuenta.
- Un item: ia download {identifier} replica todo el item en una carpeta local.
- Selección a medida: ia download {identifier} --glob='*.pdf', para evitar sorpresas de 40 GB.
- Búsquedas completas: ia search 'collection:archiveteam AND year:2013' --itemlist > list.txt y luego itera ia download sobre ese archivo.
Los límites de peticiones existen. La CLI reintenta sola y con educación; tu bucle de wget contra archive.org no lo hará, y si lo golpeas sin pausa te van a limitar o bloquear. Sé el educado: el archivo es una organización sin ánimo de lucro, no una CDN.
Cómo descargar capturas web de Archive.org
Ahora viene la parte difícil. Una captura de la Wayback no es un item, así que no hay caja de descarga. Tienes cuatro rutas realistas, en orden de esfuerzo:
- Una sola página, ahora mismo: abre la captura y usa la función «guardar» del navegador. Bien para una página; la copia guardada seguirá apuntando sus recursos a web.archive.org.
- Bytes originales de un archivo: inserta id_ después de la marca de tiempo en la URL de la captura, web.archive.org/web/20120501000000id_/http://example.com/style.css, y obtendrás el contenido sin modificar. Ideal para imágenes, CSS y PDFs sueltos.
- Descargas con script: consulta la API CDX para obtener todas las URLs capturadas bajo una ruta y luego pide cada una con el modificador id_. Funciona, pero pasarás a mantener un scraper, deduplicar hashes y reescribir enlaces tú mismo.
- Herramientas de descarga y servicios de restauración: herramientas de la comunidad como la gema wayback-machine-downloader automatizan el ciclo CDX más fetch; un servicio de restauración como Restorix hace eso y además la limpieza y el redespliegue.
Fíjate en el patrón: en cuanto quieras más de una o dos páginas, estás escribiendo o ejecutando herramientas. No tiene nada de malo, pero présupuéstalo con honestidad.
Un matiz sobre el truco de id_, porque lo vende demasiado bien: te da los bytes originales de esa única respuesta, pero no arregla nada. Una página bajada con id_ sigue conteniendo las URLs absolutas que el sitio usó en 2012, sigue referencias a recursos que el crawler nunca llegó a capturar y sigue dando por hecho un dominio que quizá ya ni te pertenece. Los bytes originales son el material de partida, no el sitio terminado.

Items frente a capturas web: cuándo usar cada uno
| Quieres | Usa | Método |
|---|---|---|
| Un libro, canción, driver o ISO | Item | Botón de descarga, torrent o ia download |
| Una versión antigua de una página | Captura | Guardar del navegador o URL con id_ |
| Una imagen o archivo CSS suelto | Captura | URL con id_ directo a wget |
| Un sitio web entero caído | Conjunto de capturas | API CDX con algo de tooling, o un servicio de restauración |
| Un servicio que cerró (estilo GeoCities) | Item más capturas | WARCs de Archive Team, cruzada con CDX |
Esa última fila sorprende a la gente: cuando Archive Team rescata un host a punto de morir, el resultado aterriza en el archivo de items en forma de enormes archivos WARC. El mismo sitio puede ser a la vez una descarga de item y un conjunto de capturas. Comprueba primero el lado de items: un crawl ya empaquetado le gana a mil fetches sueltos, y nuestra guía de formatos explica qué hacer con esos WARCs.
Errores de descarga que te cuestan horas
- wget recursivo contra web.archive.org. Cada enlace está reescrito para quedarse en su dominio, así que tu crawler descargará encantado la propia interfaz de la Wayback Machine hasta el fin de los tiempos.
- Descargar el item completo para un solo archivo. Un clic en «SHOW ALL» lleva diez segundos; un ZIP de 40 GB te llevas la noche entera.
- Tratar una captura como si fuera el sitio entero. Las capturas son por URL y oportunistas: a menudo faltan por completo las imágenes servidas desde un subdominio tipo CDN.
- Ignorar los códigos de estado en la salida de CDX. Los redirects y 404 también se archivan; filtra por statuscode:200 y agrupa por hash, o restaurarás stubs de redirección como si fueran páginas.
- No comprobar los checksums. Los items traen archivos md5 y sha1: verifica las descargas grandes antes de construir nada encima.
- Asumir que basta con una fecha de captura. La home de 2011 con imágenes de 2009 es lo normal; los sitios se crawlearon a trozos, así que prepárate para mezclar fechas de captura hasta tener la imagen completa.
Ya tienes los archivos. ¿Y ahora?
Las descargas de items encajan tal cual en tu biblioteca o pipeline de archivos: esa parte está resuelta. Las descargas de capturas son donde empieza el trabajo de verdad: URLs reescritas, recursos faltantes, formularios de contacto muertos, HTTP y HTTPS mezclados. Convertir una carpeta de capturas de 2011 en un sitio que de verdad cargue es un trabajo de reconstrucción, no de descarga.
Este es el punto en el que dejé de montar scripts a mano y empecé a derivar a la gente hacia este servicio. El presupuesto gratuito lee el archivo por ti: recuento exacto de archivos, tamaño total y precio cerrado antes de gastar un céntimo. El primer archivo restaurado es gratis, pagas por archivo a partir de ahí, recargas únicas, sin suscripción. Si una restauración o un despliegue falla, el reembolso se aplica a tu saldo de forma automática, sin tickets de soporte.
Las opciones de restauración cubren los detalles que de otro modo tendrías que programar a mano: quitar analítica y anuncios, convertir enlaces en relativos, forzar HTTPS, canonicalizar www, mantener redirects. El despliegue en un solo clic envía el resultado a SSH/SFTP, FTP o S3, y el CMS de un solo archivo integrado en /webarchive-cms.php te permite corregir contenido en el sitio. El tutorial recorre un trabajo completo de principio a fin. Las descargas terminan la búsqueda, no terminan el trabajo.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Puedo descargar un sitio web entero desde Archive.org?
No con un botón. Los sitios web viven en el lado de la Wayback como capturas por URL, así que descargar un sitio significa enumerar las URLs a través de la API CDX y traer cada una, y luego reparar los enlaces. Para algo más grande que unas pocas páginas, usa una herramienta de descarga o un servicio de restauración: comparamos las opciones en [descargar un sitio web entero desde Archive.org](/es/download-entire-website-from-archive-org).
¿Es legal descargar desde Archive.org?
Los items de dominio público y Creative Commons se pueden descargar sin problema. Los items con copyright siguen dependiendo del titular de los derechos: descargar para investigación personal suele tolerarse, no así la republicación. Reconstruir tu propio sitio antiguo a partir de sus capturas es el caso legítimo clásico.
¿Qué diferencia hay entre ia download y los torrents?
Los mismos bytes, distinto transporte. Los torrents brillan en items enormes y con conexiones inestables; la CLI brilla en scripting, filtros --glob y trabajos por lotes sobre muchos identificadores. Para un único item de 200 MB, el botón de descarga normal gana a ambos.
¿Por qué mis descargas de capturas están llenas de URLs de web.archive.org?
La Wayback Machine reescribe los enlaces para que las páginas se rendericen dentro de su reproductor. Recupera con el modificador id_ para obtener los bytes originales, o ejecuta una restauración que reescriba los enlaces de vuelta: la opción de enlaces relativos de Restorix existe precisamente para esta limpieza.
¿Cómo descargo una colección completa en vez de un solo item?
Genera la lista de items con ia search 'collection:nombre' --itemlist, ejecuta ia download por cada identificador y añade filtros --glob para quedarte solo con los tipos de archivo que quieras. Espera que lleve un rato: las colecciones grandes llegan a terabytes, así que revisa las estadísticas de tamaño de la colección antes de empezar.
Guías relacionadas

archive org download
Formatos de descarga de Archive.org: WARC, CDX y archivos individuales
Lo que realmente contiene cada formato de descarga de Archive.org, capturas WARC, índices JSON CDX y archivos originales individuales, y qué hacer con cada uno.

download a website from archive org
Cómo descargar un sitio web de Archive.org: 3 métodos que funcionan
Tres formas comprobadas de descargar un sitio web de archive.org: guardar páginas manualmente, programar la API CDX o ejecutar una restauración automática. Estimaciones realistas de tiempo para cada una.

download entire website from archive org
Descarga un sitio web completo desde Archive.org, no solo la página de inicio
Para descargar un sitio web completo desde archive.org necesitas todas las páginas, imágenes y hojas de estilo. Los archivos se esconden bajo diferentes fechas, aquí te explicamos por qué, además de una lista de verificación completa.

wayback machine downloader
Herramientas de descarga del Wayback Machine: lo que realmente funciona
Un análisis honesto de las herramientas de descarga del Wayback Machine: los scripts de código abierto, sus límites reales y la opción llave en mano que vuelve a poner tu sitio en línea.
