Cómo encontrar todas las páginas de un sitio web (incluso las eliminadas)
Por el equipo editorial de Restorix · 25 de mayo de 2026 · 8 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
¿Cuántas páginas tiene nuestro sitio? Parece una pregunta con una base de datos detrás. Rara vez lo es. El año pasado, un cliente juraba que su sitio tenía unas 400 páginas. El sitemap decía 1.900. Un rastreo encontró 3.400. El índice del Wayback Machine listaba 11.000 URLs que el sitio había servido alguna vez, la mitad eliminadas hacía tiempo. Cuatro fuentes, cuatro respuestas, y las cuatro eran correctas sobre cosas diferentes.
Estos son los cuatro métodos que uso para encontrar todas las páginas de un sitio web, qué cubre realmente cada uno y cómo fusionarlos en una lista limpia sobre la que puedas actuar.
Por qué es difícil encontrar todas las páginas de un sitio web
No existe una lista maestra a menos que el CMS conserve una, y aun así solo sabe de sí mismo. Los sitios reales acumulan páginas que quedan fuera de cualquier inventario único: páginas huérfanas a las que ningún menú enlaza, secciones que dejó atrás una migración antigua, archivos a los que se hizo referencia una vez en una campaña de email, URLs facetadas generadas sobre la marcha, subdominios enteros que alguien configuró en 2016 y olvidó.
Cada método de descubrimiento ve una porción diferente de ese desorden. El sitemap es el autorreporte del CMS. Un rastreador mapea el grafo de enlaces. El índice CDX del Wayback Machine recuerda el historial. Search Console informa lo que Google realmente mostró a los usuarios. Ninguno es completo; juntos se acercan.
Decide para qué es la lista antes de construirla. Un inventario de migración, una auditoría SEO y la recuperación de un sitio caído necesitan la misma materia prima, pero una limpieza diferente.
El sitemap: la forma más rápida de encontrar todas las páginas de un sitio web
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Empieza en /sitemap.xml. Si da 404, revisa robots.txt buscando una directiva Sitemap:; muchos sitios guardan el archivo en una ruta poco habitual. El núcleo de WordPress sirve /wp-sitemap.xml desde la versión 5.5; Yoast y Rank Math generan /sitemap_index.xml, que se despliega en sitemaps hijos por tipo de contenido. Descarga el índice y luego cada sitemap hijo.
El protocolo limita cada archivo de sitemap a 50.000 URLs y 50 MB sin comprimir, así que los sitios grandes siempre usan índices: no te detengas en el primer archivo que encuentres.
Ahora las advertencias, porque los sitemaps mienten por omisión. Un sitemap solo lista lo que el CMS conoce: nada de archivos multimedia huérfanos, nada de páginas eliminadas hace años, nada de secciones heredadas que viven fuera del CMS, nada generado por aquel script personalizado en /old-tools/. Y en sitemaps hechos a mano o desactualizados, incluso la lista conocida es ficción. Compara al azar las fechas de lastmod con páginas que actualizaste recientemente; si no coinciden, no confíes en nada.

Rastrea el sitio como lo haría Googlebot
Un rastreador empieza en la página de inicio y sigue cada enlace que puede ver, igual que un motor de búsqueda. Screaming Frog es el estándar de la industria y es gratis hasta 500 URLs; Sitebulb es más amigable para auditorías; para tener control total, un pequeño script en Python con requests y BeautifulSoup, o wget en modo araña, no cuesta nada.
El rastreo encuentra lo que los sitemaps se saltan: archivos paginados que nadie añadió al sitemap, páginas de etiquetas y categorías, enlaces rotos que apuntan a páginas que aún existen, cadenas de redirecciones que queman presupuesto de rastreo.
Sus puntos ciegos son la imagen especular de los del sitemap. Si nada enlaza a una página, el rastreador nunca la encuentra. Los menús renderizados con JavaScript necesitan un navegador headless o el rastreo se detiene en la página de inicio. Y la navegación facetada (filtros, calendarios, órdenes de clasificación) puede disparar una tienda de 500 páginas hasta convertirla en una trampa de rastreo de 500.000 URLs; define reglas de exclusión antes de darle a iniciar, no después. En sitios que no te pertenecen, mantén la concurrencia baja y respeta robots.txt.
La API CDX del Wayback Machine: encuentra todas las páginas de un sitio web, pasadas y presentes
Este es el método que casi nadie usa y el que más encuentra. El servidor CDX del Internet Archive listará cada URL que haya capturado de un dominio, incluidas páginas eliminadas hace una década, que ningún método en vivo puede ver.
Un solo comando curl obtiene el inventario completo:
curl "https://web.archive.org/cdx/search/cdx?url=example.com/*&output=text&fl=timestamp,original,statuscode&filter=statuscode:200&collapse=urlkey&from=2010&to=2020"
Los parámetros que importan: collapse=urlkey elimina duplicados de capturas repetidas de la misma URL; filter=statuscode:200 descarta los 404 y las redirecciones; matchType=domain amplía la red a los subdominios; from y to delimitan los años. Para un sitio caído, esa ventana de fechas es donde está el oro.
Espera volumen. Un foro o tienda con años de vida puede devolver millones de filas, y el ruido de las cadenas de consulta (IDs de sesión, parámetros de seguimiento) infla la lista. La API es gratis pero tiene límite de velocidad, así que ten paciencia con dominios grandes y divide las extracciones enormes en bloques anuales.

Si quieres la respuesta sin complicarte, Restorix ejecuta ese mismo índice para su estimación gratuita: pega un dominio y te informa el recuento exacto de archivos archivados y el tamaño total en segundos, sin necesidad de consultas.
Google Search Console: encuentra todas las páginas que tu sitio web muestra a Google
Para los sitios que te pertenecen, Search Console añade el único conjunto de datos que nadie más tiene: lo que Google realmente indexó y sirvió. Verifica la propiedad y luego trabaja con dos informes.
- Informe de Rendimiento, pestaña Páginas: cada URL que obtuvo una impresión, exportable. La interfaz web limita las exportaciones a 1.000 filas; la API de Search Analytics pagina mucho más allá, y la exportación masiva a BigQuery entrega el conjunto de datos completo a diario.
- Indexación, informe de Páginas: indexadas frente a rastreadas actualmente no indexadas, con URLs de muestra, una lectura rápida de cuánto del sitio Google se molesta siquiera en conservar.
El valor único está en los datos de impresiones: páginas que alcanzaron usuarios reales, incluidos los huérfanos a los que nada enlaza. Si una landing olvidada todavía consigue treinta clics al mes, va a la lista de conservación. Bing Webmaster Tools ofrece los mismos informes si el tráfico de Bing te importa.
Fusiona, deduplica y limpia la lista
Cuatro fuentes, cuatro formatos: la fusión es donde aparece el valor. Vuelca todo en un único CSV y luego normaliza antes de deduplicar, o la misma página aparecerá seis veces con seis disfraces.
Esos disfraces no son hipotéticos. Una página real de producto puede aparecer como https://www.example.com/page/?utm_source=newsletter, http://example.com/page, example.com/page/#comments, example.com/page?fbclid=abc123, www.example.com/page/index.html y EXAMPLE.com/page: seis filas, un solo documento. Mayúsculas, protocolo, www, parámetros, fragmentos y nombres de archivo por defecto tienen que colapsar a una única forma canónica antes de que la pasada de deduplicación signifique algo. Si te lo saltas, tu inventario de 11.000 URLs son en realidad 6.000 URLs disfrazadas.
- Pasa el hostname a minúsculas; elimina por completo los fragmentos (#section).
- Quita los parámetros de seguimiento: utm_*, fbclid, gclid, ref. Ordena los parámetros de consulta que queden.
- Elige una convención de barra final y aplícala.
- Colapsa las variantes de protocolo y www a tu forma canónica.
Tras la deduplicación, clasifica cada URL: 200 en vivo, redirigiendo, 404 ahora pero archivada, o desaparecida por completo. Ese tercer grupo (eliminado pero presente en los datos CDX) es el que las migraciones olvidan y lamentan. Un script de Python de veinte líneas se encarga de todo esto en la mayoría de los sitios; las hojas de cálculo aguantan hasta unos pocos miles de URLs.
Comparación rápida de las cuatro fuentes:
| Fuente | ¿Ve páginas eliminadas? | ¿Necesita acceso al sitio? | Qué cubre realmente |
|---|---|---|---|
| sitemap.xml | No | No | Páginas que el CMS admite, ahora mismo |
| Rastreador | No | No | Todo lo alcanzable por enlaces |
| Wayback CDX API | Sí | No | Cada URL que el archivo capturó alguna vez |
| Search Console | No | Sí | URLs que Google indexó o sirvió |
Encontraste cada página, ¿y ahora qué?
Para una migración, la lista se convierte en tu mapa de redirecciones: cada URL con impresiones en Search Console o capturas en los datos CDX recibe un 301 hacia su equivalente moderno más cercano. Para una auditoría SEO, las columnas de rastreo e índice dejan al descubierto secciones pobres y trampas de rastreo. Ambas son unas cuantas tardes de trabajo honesto.
Si la lista es para un sitio caído que quieres recuperar, sáltate la reconstrucción manual. nuestra plataforma restaura todo desde el Wayback Machine: la estimación gratuita muestra el recuento exacto de archivos y el tamaño con un precio cerrado, pagas por archivo restaurado con el primero gratis, y las opciones de limpieza eliminan analíticas antiguas, convierten los enlaces a relativos y minifican los assets. El resultado se despliega en tu hosting con un clic, o se exporta como XML, CSV o JSON con un manifiesto completo de archivos si prefieres la materia prima. En cualquier caso, el trabajo de enumeración que acabas de hacer te dice exactamente qué debería contener una buena restauración.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿El sitemap lista cada página de un sitio web?
No. Un sitemap solo lista lo que el CMS publica: sin páginas huérfanas, sin archivos subidos, sin contenido eliminado y sin nada que viva fuera del CMS. Trátalo como el autorreporte del sitio, no como un censo.
¿Cómo encuentro páginas huérfanas sin enlaces internos que apunten a ellas?
Combina tres fuentes: datos de impresiones de Search Console, el índice CDX del Wayback y registros del servidor si los tienes. Los huérfanos que alguna vez tuvieron tráfico o una captura aparecen en al menos una de las tres.
¿Puedo encontrar páginas que se eliminaron hace años?
Sí, eso es exactamente lo que te da la API CDX del Wayback: cada URL que el Internet Archive capturó alguna vez, incluidas páginas eliminadas hace una década. Los métodos en vivo como sitemaps y rastreadores no pueden ver en absoluto el contenido eliminado.
¿Es legal rastrear el sitio web de otra persona?
Rastrear páginas públicas a tasas razonables se acepta generalmente, y tribunales en varias jurisdicciones han tratado el scraping de datos públicos como legal, pero respeta robots.txt, acata los términos del sitio, mantén bajas las tasas de peticiones y recuerda que republicar contenido con copyright es una cuestión aparte de leerlo.
¿Por qué mi rastreo encuentra más páginas de las que Google ha indexado?
Rastreable e indexado son cosas distintas. Google rechaza indexar páginas que considera pobres, duplicadas o de bajo valor, y la navegación facetada puede inflar tu rastreo con URLs casi duplicadas. El informe de indexación de Search Console muestra en qué categoría cae cada página.
¿Cuál es la forma más rápida de obtener un inventario completo de páginas?
Descarga el sitemap, luego extrae el índice CDX con collapse=urlkey, fusiona las dos listas y deduplica. En la mayoría de los sitios eso es menos de una hora de trabajo y cubre tanto el presente como todo el pasado archivado.
Guías relacionadas

wayback machine downloader
Herramientas de descarga del Wayback Machine: lo que realmente funciona
Un análisis honesto de las herramientas de descarga del Wayback Machine: los scripts de código abierto, sus límites reales y la opción llave en mano que vuelve a poner tu sitio en línea.

download entire website from archive org
Descarga un sitio web completo desde Archive.org, no solo la página de inicio
Para descargar un sitio web completo desde archive.org necesitas todas las páginas, imágenes y hojas de estilo. Los archivos se esconden bajo diferentes fechas, aquí te explicamos por qué, además de una lista de verificación completa.

find website history
Encuentra el historial de un sitio web: Prueba lo que un sitio dijo y cuándo
Encuentra historial web que se sostenga: instantáneas archivadas, marcas de tiempo y fuentes corroborativas para disputas, periodismo e investigaciones OSINT.

restore deleted site
Restaurar un sitio eliminado: qué hacer en las primeras 48 horas
¿Tu hosting eliminó tu sitio? Sigue este plan de triaje de 48 horas y luego restaura el sitio eliminado desde los archivos web paso a paso.
