La historia de los sitios de internet: guardados, perdidos y por qué
Por el equipo editorial de Restorix · 29 de mayo de 2026 · 9 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
En abril de 2009, Yahoo anunció el cierre de GeoCities. Treinta y ocho millones de páginas de usuarios, archivos MIDI, letreros de obras animados, altares de fans de todo, desde Expediente X hasta peces tropicales, estaban programadas para ser eliminadas ese octubre. Un equipo de voluntarios llamado Archive Team pasó seis meses descargando tanto como su ancho de banda les permitió y publicó el botín como un torrent. Un pedazo de la web primitiva sobrevivió porque unos desconocidos decidieron que debía hacerlo. La mayor parte de la web primitiva no tuvo esa suerte.
Este es un repaso a lo que realmente se conservó de las primeras décadas en línea, lo que se ha ido para siempre y las razones técnicas y sociales detrás de ambos casos. Si intentas recuperar un sitio antiguo específico, pasa a la última sección, esa parte es para ti.
La historia de los sitios de internet es más joven de lo que crees
La web se hizo pública en agosto de 1991, cuando Tim Berners-Lee anunció el proyecto World Wide Web desde CERN y señaló a la gente hacia info.cern.ch. Nadie lo archivó. No había nada con qué archivar, los rastreadores web a gran escala todavía estaban a años de distancia, y la idea de preservar sitios web deliberadamente le parecía a la mayoría simple acumulación.
El Internet Archive se fundó en mayo de 1996 por Brewster Kahle, con datos de rastreo llegando desde Alexa Internet. La Wayback Machine en sí se abrió al público en octubre de 2001, conteniendo ya 10 mil millones de páginas. Hoy contiene más de 900 mil millones. Impresionante, pero la brecha importa. De 1991 a 1996 no hubo ningún archivado sistemático. Cuando CERN restauró el primer sitio web en su dirección original en 2013, la copia más antigua que cualquiera pudo localizar era de noviembre de 1992. El original de 1991, posiblemente la página más importante de la historia de la web, solo sobrevive en capturas de pantalla y reconstrucciones.
Todo lo que procede de ese hueco de cinco años sobrevive por accidente: una cinta de respaldo de un administrador de sistemas, un CD-ROM que venía con una revista, un espejo FTP que alguien olvidó borrar.
Quién guardó qué: archiveros, voluntarios y bibliotecas
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Cuatro grupos hicieron el guardado, cada uno con motivos diferentes y con coberturas diferentes.
- El Internet Archive ejecuta rastreos continuos y acepta envíos públicos de Save Page Now. Es la memoria por defecto de la web y el primer lugar donde hay que mirar.
- Archive Team es un colectivo de rescate voluntario que se moviliza cuando un servicio anuncia un cierre. GeoCities en 2009, Google+ y Yahoo Groups en 2019, capturan lo que pueden y lo publican como torrents.
- Las bibliotecas nacionales archivan de forma selectiva. El UK Web Archive opera bajo depósito legal desde 2013; el archivo PANDORA de Australia ha seleccionado sitios australianos destacados desde 1996.
- Common Crawl ha publicado enormes conjuntos de datos abiertos de rastreo desde 2008, muy valiosos para investigadores, pero no hay una interfaz amigable tipo calendario para navegar de forma casual.
Merece una mención aparte: archive.today, en funcionamiento desde 2012, toma instantáneas bajo demanda y a menudo guarda páginas que el Internet Archive se perdió, sobre todo las bloqueadas para los rastreadores de IA.

Lo que la historia de los sitios de internet conservó: estático, público, popular
Mira lo que mejor sobrevivió y un patrón salta a la vista. Los archivos están sesgados hacia lo que un rastreador podía alcanzar de forma barata y frecuente.
- Páginas HTML estáticas con enlaces simples, el alimento natural de un rastreador.
- Imágenes y archivos enlazados directamente desde una página capturada, al menos cuando los tamaños de archivo eran razonables.
- Páginas con muchos enlaces entrantes, porque los rastreadores siguen enlaces y las páginas populares se rastreaban una y otra vez.
- Sitios cuyo robots.txt permitía el rastreo, un único Disallow: / lo ocultaba todo.
- Texto de cualquier tipo. Se comprime muy bien y se sirve rápido.
Una página personal hecha a mano en 1998, fondo morado, contador de visitas, página de enlaces, normalmente se puede recuperar entera, con GIFs incluidos. Una tienda online de 2008 con diez veces más huella cultural a menudo no. La popularidad y la simplicidad le ganan a todo lo demás.
Lo que se ha ido para siempre, y por qué
Las pérdidas se agrupan en unas pocas categorías predecibles, y la más grande es un simple archivo de texto. Hasta un cambio de política en 2017, el Internet Archive respetaba las exclusiones de robots.txt y las aplicaba de forma retroactiva, una sola edición del archivo podía ocultar años de capturas existentes de la vista pública. Los dominios se venden, el nuevo dueño pone un archivo de robots restrictivo y una década de historia se oscurece de la noche a la mañana. Innumerables sitios desaparecieron del archivo de esta manera mientras los datos técnicamente todavía existían.
Todo lo que estaba detrás de un inicio de sesión nunca fue rastreado: foros privados, redes sociales tempranas, comunidades solo para miembros. El rediseño de Friendster en 2011 borró años de perfiles de una sola implementación. Las páginas dinámicas, basadas en bases de datos, se rastreaban como mucho de forma inconsistente, los rastreadores manejan enlaces GET, no formularios POST, así que los resultados de búsqueda, los carros de compra y los listados filtrados, en la práctica, nunca existieron a ojos de los archivos.

Los contenidos pesados también corrieron mala suerte. El audio y video en streaming de la era RealPlayer, los applets de Java y todo lo servido por protocolos extraños se saltaba o se capturaba roto. Flash es el caso límite famoso: los archivos.swf a menudo se guardaban pero quedaron inactives durante años, hasta que el emulador Ruffle hizo que muchos volvieran a funcionar en 2020. Los contenidos en Flash que nadie capturó simplemente se han ido.
Las cifras son sombrías incluso para la web reciente. Pew Research descubrió en 2024 que el 38 por ciento de las páginas que existían en 2013 ya no eran accesibles. Un estudio de Harvard sobre link rot encontró que cerca de la mitad de las URL citadas en opiniones de la Corte Suprema de EE. UU. ya estaban muertas. La preservación es la excepción. La degradación es la norma.
Por qué los sitios dinámicos rompían el archivado
Un rastreador obtiene URL. Ese es todo el truco. Un foro phpBB de 2005 o una tienda osCommerce no son una colección de URL, son una base de datos disfrazada de URL, generando páginas bajo demanda a partir de cadenas de consulta como viewtopic.php?t=4821&start=40. El espacio de URL es efectivamente infinito, así que los rastreadores lo muestrean. Capturan las páginas de índice y los hilos que estaban bien enlazados ese mes, y se pierden el resto.
Las sesiones y las cookies lo empeoran: la misma URL devuelve contenido diferente por visitante, así que una captura puede almacenar un esqueleto sin sesión iniciada o una redirección. Y hay un ángulo económico crudo, el texto es barato de obtener y almacenar, los contenidos multimedia no. Los rastreos limitados se saltaban los archivos grandes para mantener los costes bajos, por eso tantas páginas archivadas se cargan como texto con agujeros grises donde estaban las imágenes.
El resultado: los archivos suelen guardar el esqueleto de un sitio, páginas de inicio, artículos estáticos, unos pocos hilos bien enlazados, pero no el organismo vivo. El buscador, la lista de miembros, el flujo de compra: nunca fueron capturables de forma significativa.
Cómo explorar tú mismo la historia de los sitios de internet
Para un sitio específico, el flujo de trabajo es corto:
- Introduce el dominio en web.archive.org. La línea de tendencia sobre el calendario muestra la densidad de capturas por año, años con mucha actividad significan cobertura completa.
- Abre primero la captura más antigua y luego avanza en el tiempo. Las capturas tempranas revelan la estructura original y los patrones de URL antiguos.
- ¿Buscas una URL específica? Consulta el índice CDX o pega la dirección directamente en la barra de la Wayback, mi guía para encontrar todas las páginas que tuvo un sitio cubre los trucos de la API.
- Compara con archive.today para cualquier cosa que el Internet Archive se haya perdido.
- Para material anterior a 1996, busca espejos mantenidos por operadores, colecciones universitarias y proyectos de nostalgia en lugar de archivos formales.
Si quieres la imagen completa en vez de una sola página, nuestros tutoriales sobre cómo buscar el historial de un sitio web y profundizar en la investigación del historial de sitios web cubren el calendario, las colecciones y los archivos alternativos en detalle.
Cuando navegar por el pasado no es suficiente
La Wayback Machine es una sala de lectura, no un botón de restaurar. El día que necesitas que el sitio real vuelva, los archivos, las imágenes, los enlaces internos que funcionen en tu propio dominio, el guardado manual se derrumba después de unas doce páginas. Clic derecho, guardar como, arreglar rutas, repetir: eso es una tarde por sección, y el resultado es una carpeta de fragmentos.
este servicio de restauración existe exactamente para ese trabajo. Pega el dominio y el presupuesto gratuito muestra el número exacto de archivos archivados, el tamaño total y un precio cerrado antes de que pagues nada. Pagas por archivo restaurado, el primer archivo es gratis, y las restauraciones se pueden filtrar por rango de fechas y limpiar, se eliminan las analíticas y anuncios antiguos, los enlaces se vuelven relativos, se fuerza HTTPS. El sitio reconstruido se despliega en tu propio hosting con un clic, o se exporta como datos estructurados. El tutorial muestra el flujo completo.
La historia de los sitios de internet es irregular, pero lo que sobrevive suele ser recuperable si usas la herramienta adecuada para el trabajo.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Hasta dónde llega la historia de los sitios de internet en la Wayback Machine?
Las capturas comienzan en 1996, cuando el Internet Archive empezó a rastrear. La web en sí comenzó en 1991, así que los primeros cinco años solo existen en respaldos privados y reconstrucciones, el primer sitio web restaurado por CERN, por ejemplo, proviene de una copia de noviembre de 1992.
¿Está todo lo de los primeros tiempos de internet archivado en algún sitio?
No. Las páginas bloqueadas por robots.txt, el contenido detrás de inicios de sesión, los contenidos multimedia pesados y las páginas generadas dinámicamente rara vez se capturaron. Si ni la Wayback Machine ni archive.today tienen una página, lo más probable es que solo sobreviva en manos privadas, si es que sobrevive.
¿Por qué una página antigua muestra 'no está en el archivo' cuando el sitio es claramente antiguo?
Normalmente por una de cuatro razones: el robots.txt bloqueó a los rastreadores, la página no tenía enlaces entrantes que los rastreadores pudieran seguir, se generó dinámicamente, o las capturas del dominio se ocultaron tras un cambio de propiedad. La antigüedad por sí sola nunca garantizó cobertura.
¿Qué pasó con todos los sitios de GeoCities?
Yahoo los eliminó en octubre de 2009. Archive Team rescató una buena parte y la publicó como un torrent de unos 900 GB, y espejos como Reocities mantienen partes navegables. Muchas páginas de GeoCities también viven en la Wayback Machine, pero nunca se hizo público un respaldo oficial completo.
¿Puede el dueño de un sitio borrarlo de los archivos web?
El Internet Archive acepta solicitudes de eliminación por parte de los dueños de los sitios, y los cambios en robots.txt históricamente ocultaban capturas de forma retroactiva hasta el cambio de política de 2017. La venta de dominios ha borrado el acceso público a archivos de esta manera. Sin embargo, eliminar un sitio de tu servidor no elimina por sí solo las capturas existentes.
¿Eliminar mi sitio web lo elimina de la Wayback Machine?
No automáticamente. Las capturas ya tomadas siguen disponibles a menos que el dueño del dominio presente una solicitud de exclusión. Si quieres que algo desaparezca del archivo, tienes que pedirlo, simplemente quitar el sitio de línea deja la historia en su lugar.
Guías relacionadas

website history
Historial de un sitio web: capturas, WHOIS, DNS y las herramientas para cada caso
El historial de un sitio web puede referirse a capturas archivadas, registros WHOIS, cambios de DNS o posiciones antiguas. Descubre qué herramienta responde cada pregunta y cómo reconstruir un sitio perdido.

search website history
Cómo Buscar el Historial de un Sitio Web Antes de Comprar un Dominio
Busca el historial de un sitio web antes de comprar un dominio: instantáneas antiguas, cambios de propiedad, lastre de spam y trampas de marcas registradas, un flujo de trabajo de diligencia debida de 30 minutos.

historical web
La web histórica como recurso de investigación: lo que realmente vale
Cómo académicos, periodistas y abogados usan la web histórica: dónde se conservan los registros, cómo juzgar la calidad de preservación y cuándo una captura sirve como prueba.

wayback machine
Wayback Machine: La guía completa para navegar por el historial web
Wayback Machine archiva más de 900 mil millones de páginas web. Aprende cómo funcionan los rastreos, las capturas, el calendario y la sintaxis de búsqueda, y cómo restaurar un sitio perdido.
