Formatos de descarga de Archive.org: WARC, CDX y archivos individuales
Por el equipo editorial de Restorix · 28 de junio de 2026 · 8 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Encontraste el rastreo, hiciste clic en descargar, y ahora estás mirando un archivo de 900 MB que termina en.warc.gz que nada en tu máquina puede abrir. Bienvenido a la parte menos documentada de Archive.org: los formatos. La biblioteca entrega datos de captura en bruto, y los datos de captura en bruto esperan que traigas tus propias herramientas.
Tres formatos cubren casi todo lo que alguna vez extraerás: archivos WARC, salida JSON CDX y archivos individuales simples. Aquí te explicamos qué es cada uno realmente, cuándo lo quieres y cómo convertirlo en algo útil, incluyendo el atajo para cuando solo quieres recuperar tu sitio antiguo.
Lo que realmente contiene una descarga de Archive.org
Dos mundos de almacenamiento nuevamente. Las descargas de ítems te dan archivos terminados, un PDF es un PDF, un ISO es un ISO. Las descargas del lado de Wayback te dan datos de captura web: respuestas HTTP congeladas en el momento del rastreo, más índices que las describen. Todos los formatos confusos provienen de ese segundo mundo, además hay una trampilla de archivo único que conecta ambos.
Los tamaños importan para la planificación. Un solo segmento WARC de una colección de rastreo pesa aproximadamente 1 GB comprimido. La lista CDX de un sitio mediano puede tener 50.000 líneas de JSON. Un archivo individual es, bueno, un archivo. Empareja el formato con el trabajo antes de comenzar la transferencia, no después, volver a descargar un gigabyte porque agarraste lo incorrecto es un rito de iniciación que es mejor saltarse.
WARC: El formato de captura en bruto
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
WARC, Web ARChive, estándar ISO 28500, es un contenedor que concatena registros. Cada registro es un intercambio HTTP capturado: los encabezados de respuesta seguidos de los bytes exactos de la carga útil, más metadatos como la hora de captura y la URL de destino. Los registros vienen en tipos, response, resource, metadata, warcinfo, y los archivos casi siempre llegan comprimidos con gzip, un registro por miembro gzip, para que las herramientas puedan buscar sin descomprimir todo el archivo.
- Nada se renderiza ni se limpia. Obtienes byte por byte lo que vio el rastreador, incluyendo páginas 404 y cadenas de redirección.
- Un solo WARC contiene miles de URLs a menudo no relacionadas de un rastreo, tu sitio puede ser el 2% del archivo.
- Necesitas herramientas para leerlo: la biblioteca warcio de Python para extraer, o ReplayWeb.page y pywb para reproducirlo como páginas navegables.
Extraer con warcio es un bucle de filtrado: abre el archivo, salta los registros cuya URL de destino está fuera de tu dominio, escribe las cargas útiles en el disco reflejando las rutas originales, deduplica resúmenes idénticos. Cincuenta líneas de Python, o una larga noche aprendiendo por qué la gente paga por esto.
¿Dónde consigues realmente WARCs? Dos lugares. Los rastreos de rescate de Archive Team y las colecciones de rastreo de Internet Archive los envían como archivos de ítem normales, busca.warc.gz en el cuadro de descarga del ítem. Y si alguna vez encargas o exportas un rastreo propio, WARC es lo que obtienes. Es el contenedor de envío del mundo del archivo web: feo, estandarizado y omnipresente.

JSON CDX: El índice, no el contenido
CDX es el catálogo de fichas de Wayback Machine. Si consultas web.archive.org/cdx/search/cdx?url=example.com&output=json obtienes un arreglo JSON donde cada fila describe una captura: urlkey, timestamp, URL original, mimetype, statuscode, resumen (digest) y longitud en bytes. Sin contenido de página en absoluto, solo un menú preciso de lo que existe, captura por captura.
Dos parámetros justifican su uso en cada consulta: filter=statuscode:200 elimina las redirecciones y páginas de error, y collapse=digest elimina capturas duplicadas de contenido idéntico. En la tienda WooCommerce de un cliente, esos dos parámetros redujeron 38.000 filas brutas a 4.100 páginas reales y únicas. Esa lista se convirtió en el plan de restauración, y en la estimación de precio.
Trucos de consulta que vale la pena conocer: añade matchType=prefix para cubrir cada URL bajo una ruta, y usa from=2008&to=2012 para acotar los años. Un comodín como url=example.com/* ya implica una coincidencia de prefijo en todo el dominio. Empieza de forma estrecha, una consulta de dominio sin filtrar en un sitio grande devuelve megabytes de JSON y una pestaña del navegador congelada.
- Alcance: cuánto del sitio fue capturado alguna vez, y en qué años.
- Análisis de brechas: encontrar los directorios de imágenes y hosts CDN que nunca fueron rastreados.
- Listas de descarga por lotes: alimenta a tu descargador con los pares timestamp-más-URL, una solicitud id_ cada uno.
- Estimaciones: Restorix lee estos mismos datos CDX para cotizar una restauración, cantidad de archivos, tamaño total, precio fijo, por adelantado.

Archivos individuales: La descarga fácil de Archive.org
El tercer formato es apenas un formato: un archivo original, obtenido directamente. Para los ítems, es el enlace al archivo en el cuadro de descarga. Para las instantáneas, es el truco de id_, inserta id_ después de la marca de tiempo, como en web.archive.org/web/20130501000000id_/http://example.com/logo.png, y Wayback Machine devuelve la carga útil intacta sin barra de herramientas ni marcado reescrito.
Recurre a los archivos individuales cuando ya sabes exactamente qué falta: la hoja de estilo que no se rastreó, la lista de precios en PDF, la imagen destacada que un cliente no deja de preguntar. Mantengo una carpeta de trabajo de estos por proyecto. Lo que no debes hacer es construir un sitio completo de esta manera, 4.000 solicitudes id_ manuales son un script pidiendo a gritos ser escrito.
Dos modos de fallo que debes esperar. En el lado de las instantáneas, id_ solo funciona si esa URL exacta fue capturada, verifica primero el índice CDX en lugar de adivinar URLs. En el lado de los ítems, el patrón de URL directa archive.org/download/{identifier}/{filename} es estable y se puede automatizar, pero los nombres de archivo con espacios necesitan una codificación URL adecuada o wget dará 404 en un archivo que claramente existe.
¿Qué formato de descarga de Archive.org necesitas?
| Formato | Contiene | Ideal para | Herramientas |
|---|---|---|---|
| WARC (.warc.gz) | Respuestas HTTP en bruto en bloque | Rastreos completos, archivos fuera de línea | warcio, pywb, ReplayWeb.page |
| JSON CDX | Solo metadatos de captura | Alcance, análisis de brechas, listas de descarga | Cualquier cliente HTTP más un script |
| Archivo individual / id_ | Una carga útil original | Activos faltantes específicos | Navegador o wget |
| Descarga de ítem | Archivos terminados (PDF, ISO, MP3) | Libros, software, medios | Ninguna, haz clic y ya |
La cadena de dependencia honesta para restaurar un sitio web es: CDX primero, descargas WARC o id_ después, archivos individuales para tapar agujeros al final. Saltarse el paso de CDX es cómo terminas descargando un gigabyte de datos de rastreo y aún así te pierdes la mitad del sitio. Las descargas de ítems están completamente fuera de esta cadena, son productos terminados, y si lo que necesitas es un libro o un controlador, deja de leer y haz clic.
Trabajando con lo que descargaste
Trampas que pican a todos una vez. Los WARCs comprimidos con gzip son de múltiples miembros, un gunzip simple funciona, pero los lectores en flujo no deben detenerse en el primer miembro. Los resúmenes se repiten entre capturas, así que deduplica antes de contar archivos o tus totales mentirán. Las codificaciones de caracteres de 2004 no son UTF-8; mantén los bytes como bytes hasta que debas decodificar. Y cada URL reescrita por Wayback dentro del HTML capturado todavía apunta a web.archive.org hasta que la reescribas de vuelta.
Planifica la estructura de salida antes de extraer: refleja las rutas de URL originales, mantén un manifiesto de qué carga útil provino de qué registro, y nunca sobrescribas una variante que puedas necesitar después. Restorix puede exportar exactamente este tipo de manifiesto (JSON o SQLite) con cada restauración, haciéndolo a mano, entenderás por qué existe esa funcionalidad.
O saltate completamente la lucha con los formatos
Todo lo anterior se puede aprender, y nada de ello es un buen uso del fin de semana de un dueño de negocio. Restorix existe exactamente para esta capa: lee los datos CDX, extrae las capturas, deduplica, reescribe enlaces y te entrega un sitio funcional. La estimación gratuita muestra la cantidad de archivos archivados, el tamaño total y un precio fijo antes de que pagues, primer archivo restaurado gratis, paga por archivo después, reembolso automático al saldo si algo falla.
Las opciones de restauración se corresponden uno a uno con los puntos débiles anteriores: enlaces internos relativos en lugar de URLs de archive.org, conversión a HTTPS, eliminación de análisis y anuncios antiguos, mantener las redirecciones 301 intactas. La implementación es con un solo clic a SSH/SFTP, FTP/FTPS o S3 desde el panel de restauración, y el CMS incluido en /webarchive-cms.php, contraseña generada aleatoriamente, modo seguro activado por defecto, significa que puedes editar el sitio revivido sin tocar una línea de herramientas WARC. Los formatos son para archiveros. Tú quieres recuperar tu sitio.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Qué es un archivo WARC y cómo lo abro?
Un WARC es un contenedor estándar ISO de respuestas HTTP capturadas, encabezados más bytes exactos de la carga útil, generalmente comprimido con gzip. Ábrelo con la biblioteca warcio de Python para extraer archivos, o reprodúcelo como páginas navegables con ReplayWeb.page o pywb. Hacer doble clic no hace nada; no hay un visor de escritorio nativo.
¿Qué significan los campos en la salida JSON CDX?
Cada fila es una captura: urlkey (URL canonizada), timestamp (hora de captura, yyyyMMddhhmmss), original (la URL tal como fue rastreada), mimetype, statuscode, digest (resumen de contenido, resúmenes idénticos significan bytes idénticos) y length (tamaño del registro comprimido). Describe capturas; no contiene contenido de página en sí.
¿Cómo obtengo el archivo original sin el HTML reescrito por Wayback?
Usa el modificador id_: insértalo justo después de la marca de tiempo en cualquier URL de instantánea y el archivo devuelve la carga útil sin modificar, sin barra de herramientas, sin enlaces reescritos. Funciona para páginas, imágenes, CSS, cualquier cosa capturada.
¿Puedo convertir una descarga de Archive.org de nuevo en un sitio web funcional?
Sí, con esfuerzo: enumera las capturas mediante CDX, extrae las cargas útiles de WARC o solicitudes id_, reescribe enlaces, corrige activos faltantes, luego implementa. Para un puñado de páginas es una noche divertida. Para un sitio real, un servicio de restauración como Restorix automatiza toda la cadena y te muestra el precio antes de cobrarte nada.
¿Qué tamaño tiene la descarga típica de un sitio en Archive.org?
Más pequeño de lo que temes, normalmente. Un sitio de folletos de 200 páginas de cinco años suele totalizar 200-800 MB en todas las capturas; deduplicado, el contenido único puede ser 60 MB. La lista CDX te dice los números reales antes de descargar nada, siempre delimita primero.
Guías relacionadas

download archive org
Cómo descargar de Archive.org: items, capturas y más
Todas las formas prácticas de descargar contenido de Archive.org: archivos de items, descargas masivas por CLI y capturas web de la Wayback Machine, y cómo elegir la opción adecuada para tu caso.

archive.org download website
Herramientas de descarga de sitios web de Archive.org: una comparación honesta
Una comparación honesta de herramientas de descarga de sitios web de archive.org: HTTrack, scripts wayback-machine-downloader y Restorix. Costos reales, esfuerzo y manejo de activos.

wayback download
Descarga de Wayback: Todos los métodos ordenados por esfuerzo
Todos los métodos de descarga de Wayback ordenados por esfuerzo: páginas individuales, scripts wget, la API CDX y servicios automatizados que reconstruyen todo el sitio por ti.

restore website from archive.org
Restaura un sitio web desde Archive.org: ¿bricolaje o servicio completo?
¿Debes restaurar un sitio web desde Archive.org por tu cuenta o pagar un servicio completo? Una comparación honesta de costo, tiempo, habilidad y riesgo, más un marco de decisión.
