Artículos web: Cómo extraer texto limpio de cualquier sitio web
Por el equipo editorial de Restorix · 7 de mayo de 2026 · 8 min de lectura

Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Una vez un cliente me llamó en pánico: su agencia había rediseñado el sitio de la empresa y simplemente no había migrado el blog. Unos cuarenta artículos, cuatro años de equidad de búsqueda, desaparecidos. La agencia no tenía copia de seguridad. La primera pregunta que nos hicieron fue la correcta: ¿podemos recuperar el texto de los artículos?
Ese trabajo, y el trabajo cotidiano mucho más pequeño de guardar un artículo limpio de una página con mucho contenido, son la misma habilidad a diferentes escalas. Así es como hago ambas cosas: qué herramientas funcionan realmente, cómo recuperar artículos web de sitios que ya no existen y dónde están los límites legales antes de volver a publicar cualquier cosa.
Por qué la extracción es más difícil de lo que parece
En una página de noticias típica, el artículo representa menos de una quinta parte del HTML. El resto es navegación, barras laterales, banners de cookies, ventanas emergentes de boletines, carruseles de publicaciones relacionadas y scripts de rastreo. Copiar y pegar del navegador arrastra todo eso, o peor, pega texto que se reorganiza en caos porque estaba construido con divs y spans anidados.
Los obstáculos habituales:
- Renderizado de JavaScript: el HTML que descargas es una cáscara vacía hasta que se ejecutan los scripts
- Paginación: un artículo dividido en cinco URLs para impresiones de anuncios
- Muros anti-bots: desafíos que bloquean descargadores simples a la vista
- Carga diferida: imágenes que solo existes una vez que haces scroll
- RSS truncado: feeds que se detienen después de dos oraciones y un punto suspensivo
El método que elijas depende de la escala: un artículo, un sitio completo o un sitio muerto.
Método 1: modo de lectura para artículos web individuales
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
Para una página, no construyas nada. La Vista de lectura de Firefox (F9, o el ícono de página en la barra de direcciones) elimina todo de una página excepto el titular, el autor y el cuerpo del texto. Safari y Edge tienen sus propias versiones, Edge incluso leerá el artículo en voz alta. Desde el modo de lectura, copia en tu editor o imprime a PDF para un guardado de calidad de archivo.
- Abre el artículo y activa la Vista de lectura
- Corrige el título y el autor si el detector adivinó mal
- Copia en tu editor o imprime a PDF
- Guarda la URL original y la fecha de captura junto con el texto, la necesitarás después para la procedencia
Un truco poco conocido: muchos sitios envían una hoja de estilos para impresión. A veces, al usar la vista previa de impresión, obtienes el artículo completo y limpio incluso cuando el modo de lectura falla, y 'Guardar como PDF' mantiene la URL de origen en el encabezado si habilitas encabezados y pies de página en el diálogo de impresión.
Los límites son reales: una página a la vez, los metadatos (autor, fecha, etiquetas) a menudo se pierden o son incorrectos, y falla por completo en páginas con muro de pago, paginadas o con muchos scripts. Pocket e Instapaper hacen la misma limpieza con una capa adicional de guardar para después, útil para leer, inútil para procesamiento por lotes.
Método 2: extracción estructurada de artículos web
Más allá de una docena de páginas, el trabajo manual deja de tener sentido. La extracción estructurada significa pasar cada página por una biblioteca que sabe cómo encontrar el artículo dentro del contenido estándar, el mismo truco que usa el modo de lectura, pero programable.
| Herramienta | Lenguaje | Mejor para |
|---|---|---|
| Readability.js | JavaScript | El motor detrás de la Vista de lectura de Firefox; combinar con Playwright para páginas renderizadas con JS |
| Postlight Parser | JavaScript | Extracción rápida de una sola vez con reglas personalizadas por sitio |
| trafilatura | Python | Mejores metadatos (autor, fecha, etiquetas); rastrea feeds y sitemaps por ti |
| newspaper3k | Python | Scripts rápidos y prototipos; API fácil, menos mantenimiento |
| go-readability | Go | Rastreos de alto volumen donde la velocidad importa |
Antes de escribir cualquier código de extracción, consulta dos trucos rápidos. Primero, /wp-json/wp/v2/posts?per_page=100, si el sitio ejecuta WordPress, esa URL te entrega cada publicación como JSON limpio, sin necesidad de scraping. Segundo, sitemap.xml: lista las URLs del sitio para que puedas enumerar artículos en lugar de rastrear a ciegas. Cuando rastrees, sé cortés: una solicitud por segundo, una cadena de usuario real, respeta robots.txt, deduplica por URL canónica.

Errores de extracción que desperdician horas
Cuatro errores explican la mayor parte del trabajo de limpieza que veo en trabajos de extracción, y todos son más baratos de evitar que de corregir:
- Confiar en la fecha detectada. Los extractores capturan alegremente la fecha de modificación, la fecha de un comentario o el año en el pie de página. Verifica contra la línea de autor o la fecha de captura del archivo.
- Perder la URL canónica. Guárdala con el texto. Sin ella no puedes deduplicar, configurar redirecciones ni demostrar la procedencia después.
- Extraer páginas de listas como artículos. Las páginas de categorías y etiquetas parecen contenido para un detector. Filtra por patrón de URL antes de ejecutar el lote, no después.
- Ignorar la codificación. Un sitio de 2008 en Windows-1251 se convierte en sopa de letras si asumes UTF-8, verifica la cabecera HTTP charset, no solo la etiqueta meta.
Recuperar artículos web de un sitio muerto
Cuando el sitio ha desaparecido, el archivo se convierte en tu fuente. La API CDX de la Wayback Machine lista cada captura bajo una ruta, example.com/blog/*, y puedes obtener la última buena instantánea de cada publicación, luego ejecutar las mismas herramientas de extracción contra las URLs de web.archive.org. Funciona, pero es lento: el archivo limita la velocidad, las capturas antiguas referencian imágenes que faltan y cincuenta artículos se convierten en una tarde de supervisión.
La ruta más rápida es restaurar el sitio correctamente primero. La herramienta gratuita te ofrece una estimación gratuita, conteo exacto de archivos archivados, tamaño total, precio fijo, y luego restaura los archivos en un rango de fechas de tu elección. La parte que la mayoría olvida: hay una opción de exportación estructurada de artículos que te entrega el texto del artículo como XML, CSV o JSON, más un manifiesto JSON o SQLite de cada archivo restaurado. El blog de 2016 de mi historia inicial volvió así, 412 archivos, 96 MB, publicaciones exportadas a CSV con título, slug, fecha y cuerpo, reimportadas a WordPress esa misma tarde. El tutorial explica todo el proceso.
Una fuente más que la gente olvida: Google retiró sus enlaces de caché en 2024, pero archive.today a menudo guarda páginas que la Wayback Machine perdió, especialmente artículos de noticias, y Bing todavía sirve copias en caché para algunos sitios. Vale la pena buscar antes de declarar un artículo irrecuperable.

Reglas de derechos de autor antes de volver a publicar
No es asesoramiento legal, solo son los límites dentro de los que realmente trabajan los profesionales. Los hechos e ideas no están protegidos por derechos de autor; la expresión específica de ellos sí. Tus propios artículos son tuyos para hacer con ellos lo que quieras. Para el texto de cualquier otra persona:
- Verifica si hay una licencia. Las marcas de Creative Commons importan: CC0 y CC-BY permiten la republicación (CC-BY requiere atribución); CC-BY-NC prohíbe el uso comercial; sin marca significa todos los derechos reservados.
- Obtén permiso por escrito cuando no haya licencia. Un correo electrónico que diga sí vale más que una página de teoría de uso justo.
- El uso justo es una defensa en la sala de juicios, no un permiso. Evalúa propósito, cantidad, naturaleza y efecto en el mercado, y citar un artículo completo falla la prueba de cantidad casi siempre.
- La atribución y un enlace canónico son buena educación y buen SEO. No curan la infracción.
- Las imágenes tienen sus propios derechos de autor, separados del texto. Volver a alojarlas requiere su propio permiso.
Un matiz que afecta a las agencias: el trabajo realizado por empleados generalmente pertenece a la empresa, pero el trabajo de contratistas puede no pertenecerle a menos que el contrato lo indique. Si estás recuperando el blog de tu propia empresa, confirma quién es el dueño real del texto antes de volver a publicarlo bajo una nueva marca.
Una lista de verificación para republicar que te mantiene a salvo
- Confirma que eres dueño o tienes licencia de cada pieza, texto e imágenes por separado
- Mantén el nombre del autor original y la fecha de publicación con el artículo
- Establece una URL canónica si la versión anterior todavía existe en algún lugar
- Redirige 301 las URLs antiguas a las nuevas ubicaciones
- Actualiza los enlaces internos para que apunten a páginas activas, no a muertas
- Indica ediciones materiales ('actualizado julio 2026') en lugar de reescribir silenciosamente la historia
Haz estas seis cosas y un blog recuperado recupera sus posiciones de búsqueda sorprendentemente rápido, Google trata una restauración fiel en las URLs originales como el mismo sitio que regresa, no como uno nuevo que empieza desde cero.
Restaura tu sitio web desde la Wayback Machine
Estimación gratuita en segundos — solo pagas al confirmar. Los fallos se reembolsan automáticamente.
FAQ
¿Es legal hacer scraping de artículos web del sitio de alguien?
Para uso privado, archivar una página que pagaste, guardar un tutorial para lectura offline, generalmente está bien. Copiar artículos de otra persona en masa para republicar no lo está: el texto está protegido por derechos de autor sin importar lo fácil que haya sido descargarlo. Los términos de servicio añaden una capa contractual adicional. Sé dueño del contenido o ten permiso, esa prueba resuelve la mayoría de los casos.
¿Cuál es la forma más rápida de extraer un artículo web ahora mismo?
Ábrelo en Firefox y presiona F9. La Vista de lectura elimina todo excepto el artículo en aproximadamente un segundo, y desde ahí puedes copiarlo o imprimirlo a PDF. Sin herramientas, sin código.
¿Puedo recuperar artículos web de un sitio que ya no existe?
Sí, si fue archivado. La Wayback Machine guarda capturas de la mayoría de los sitios que tuvieron tráfico; puedes obtener páginas manualmente, programarlo a través de la API CDX o restaurar el sitio completo y usar una exportación estructurada para obtener cada artículo como CSV o JSON de una sola vez.
¿Qué formato de exportación debo elegir, XML, CSV o JSON?
Adapta al importador. El importador nativo de WordPress acepta XML. Los flujos de trabajo basados en hojas de cálculo y scripts simples funcionan mejor con CSV. Los desarrolladores que construyen pipelines quieren JSON. En caso de duda, toma los tres, son baratos de generar y solo haces la restauración una vez.
¿El modo de lectura funciona en todos los sitios?
No. Falla en artículos con muro de pago, galerías de múltiples páginas y páginas donde el texto solo existe después de que se ejecuta JavaScript. Para esos, usa un extractor con navegador headless o, para tu propio sitio muerto, una restauración de archivo seguida de exportación estructurada.
¿Las herramientas de extracción conservan las imágenes?
La mayoría de los extractores de texto eliminan las imágenes o dejan URLs enlazadas que mueren con el host original. Restaurar el sitio conserva los archivos de imagen reales junto con el texto. De cualquier manera, trata los derechos de imagen por separado de los derechos de texto, son derechos de autor diferentes.
Guías relacionadas

wayback machine downloader
Herramientas de descarga del Wayback Machine: lo que realmente funciona
Un análisis honesto de las herramientas de descarga del Wayback Machine: los scripts de código abierto, sus límites reales y la opción llave en mano que vuelve a poner tu sitio en línea.

download entire website from archive org
Descarga un sitio web completo desde Archive.org, no solo la página de inicio
Para descargar un sitio web completo desde archive.org necesitas todas las páginas, imágenes y hojas de estilo. Los archivos se esconden bajo diferentes fechas, aquí te explicamos por qué, además de una lista de verificación completa.

restore old website
Restaurar un sitio web antiguo sin revivir sus problemas
Cómo restaurar un sitio web antiguo: manejar PHP, Flash y framesets antiguos, decidir qué conservar o modernizar y extraer archivos de archivos web.

web cache
Caché web explicado: cómo funcionan las cachés y cómo usar una
Qué es una caché web, cómo funcionan las cachés del navegador, CDN, motores de búsqueda y archivos, y cómo usar una caché web para ver una página que ha desaparecido.
