Articoli Web: Come Estrarre Testo Pulito da Qualsiasi Sito
A cura di la redazione di Restorix · 7 maggio 2026 · 8 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Un cliente mi chiamò in preda al panico: la sua agenzia aveva ridisegnato il sito aziendale e semplicemente non aveva migrato il blog. Quaranta articoli circa, quattro anni di equity sui motori di ricerca, andati in fumo. L'agenzia non aveva alcun backup. La prima domanda che fecero fu quella giusta: possiamo recuperare il testo dell'articolo?
Quel lavoro, e il lavoro molto più piccolo di salvare un singolo articolo pulito da una pagina disordinata, sono la stessa competenza su scale diverse. Ecco come faccio entrambe le cose: quali strumenti funzionano davvero, come recuperare articoli web da siti che non esistono più e dove si trovano i confini legali prima di ripubblicare qualsiasi cosa.
Perché l'estrazione è più difficile di quanto sembri
In una tipica pagina di notizie, l'articolo rappresenta meno di un quinto dell'HTML. Il resto è navigazione, barre laterali, banner per i cookie, popup per newsletter, caroselli di articoli correlati e script di tracciamento. Copiare e incollare dal browser trascina tutto quanto, o peggio, incolla testo che si riorganizza in modo caotico perché è stato costruito da div e span annidati.
Gli ostacoli abituali:
- Rendering JavaScript: l'HTML che scarichi è un guscio vuoto finché gli script non vengono eseguiti
- Impaginazione: un articolo suddiviso in cinque URL per impressioni pubblicitarie
- Muri anti-bot: verifiche che bloccano i semplici downloader a vista
- Caricamento pigro: immagini che esistono solo dopo lo scroll
- RSS troncato: feed che si fermano dopo due frasi e un ellissi
Il metodo che scegli dipende dalla scala: un articolo, un intero sito, o un sito non più attivo.
Metodo 1: modalità di lettura per singoli articoli web
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Per una pagina, non costruire nulla. La Vista Lettura di Firefox (F9, o l'icona della pagina nella barra degli indirizzi) riduce una pagina a titolo, firma e corpo del testo. Safari e Edge hanno le loro versioni, Edge addirittura legge l'articolo ad alta voce. Dalla modalità di lettura, copia nell'editor, oppure stampa in PDF per un salvataggio di qualità archivistica.
- Apri l'articolo e attiva la Vista Lettura
- Correggi il titolo e la firma se il rilevatore ha indovinato male
- Copia nell'editor, oppure stampa in PDF
- Salva l'URL originale e la data di acquisizione accanto al testo, ti servirà la provenienza più avanti
Un trucco meno noto: molti siti includono un foglio di stile per la stampa. Premere anteprima di stampa a volte ti restituisce l'intero articolo pulito anche quando la modalità di lettura si blocca, e 'Salva come PDF' mantiene l'URL sorgente nell'intestazione se abiliti intestazioni e piè di pagina nella finestra di dialogo di stampa.
I limiti sono reali: una pagina alla volta, i metadati (autore, data, tag) spesso persi o errati, e fallisce del tutto su pagine con paywall, impaginate o pesantemente basate su script. Pocket e Instapaper fanno la stessa pulizia con un livello di salvataggio per dopo, utili per la lettura, inutili per l'estrazione in blocco.
Metodo 2: estrazione strutturata di articoli web
Oltre una dozzina di pagine, il lavoro manuale non ha più senso. L'estrazione strutturata significa elaborare ogni pagina attraverso una libreria che sa come trovare l'articolo dentro il contenuto boilerplate, lo stesso trucco della modalità di lettura, ma scriptabile.
| Strumento | Linguaggio | Ideale per |
|---|---|---|
| Readability.js | JavaScript | Il motore dietro la Vista Lettura di Firefox; abbinalo a Playwright per pagine renderizzate con JS |
| Postlight Parser | JavaScript | Estrazione rapida con regole personalizzate per sito |
| trafilatura | Python | Migliori metadati (autore, data, tag); esplora feed e sitemap per te |
| newspaper3k | Python | Script rapidi e prototipi; API semplice, meno manutenuto |
| go-readability | Go | Crawl ad alto volume dove la velocità conta |
Prima di scrivere qualsiasi codice di estrazione, controlla due scorciatoie. Prima, /wp-json/wp/v2/posts?per_page=100, se il sito usa WordPress, quell'URL ti restituisce ogni post come JSON pulito, senza bisogno di scraping. Seconda, sitemap.xml: elenca gli URL del sito così puoi enumerare gli articoli invece di fare crawl alla cieca. Quando fai crawl, mantienilo educato: una richiesta al secondo, una stringa user-agent reale, rispetta robots.txt, deduplica per URL canonico.

Errori di estrazione che fanno perdere ore
Quattro errori rappresentano la maggior parte del lavoro di pulizia che vedo nei lavori di estrazione, e tutti costano meno da evitare che da correggere:
- Fidarsi della data rilevata. Gli estrattori prendono allegramente la data di modifica, una data di commento o l'anno nel piè di pagina. Verifica contro la firma o la data di acquisizione dell'archivio.
- Perdere l'URL canonico. Salvalo con il testo. Senza di esso non puoi deduplicare, configurare reindirizzamenti o provare la provenienza più avanti.
- Estrarre pagine di elenco come articoli. Le pagine di categoria e tag sembrano contenuto per un rilevatore. Filtra per pattern URL prima di eseguire il batch, non dopo.
- Ignorare la codifica. Un sito del 2008 in Windows-1251 diventa zuppa di lettere se assumi UTF-8, controlla l'header charset HTTP, non solo il meta tag.
Recuperare articoli web da un sito non più attivo
Quando il sito è sparito, l'archivio diventa la tua fonte. L'API CDX della Wayback Machine elenca ogni acquisizione sotto un percorso, example.com/blog/*, e puoi prelevare l'ultima buona istantanea di ogni post, poi eseguire gli stessi strumenti di estrazione contro gli URL di web.archive.org. Funziona, ma è lento: l'archivio limita la velocità, le acquisizioni vecchie referenziano immagini mancanti, e cinquanta articoli diventano un pomeriggio di supervisione.
Il percorso più veloce è ripristinare prima il sito correttamente. Il nostro servizio di ripristino ti dà una stima gratuita, conteggio esatto dei file archiviati, dimensione totale, prezzo fisso, poi ripristina i file su un intervallo di date di tua scelta. La parte che la maggior parte delle persone si perde: c'è un'opzione esportazione strutturata degli articoli che ti consegna il testo degli articoli come XML, CSV o JSON, più un manifest JSON o SQLite di ogni file ripristinato. Il blog del 2016 della mia storia di apertura è tornato così, 412 file, 96 MB, post esportati in CSV con titolo, slug, data e corpo, reimportati in WordPress lo stesso pomeriggio. Il tutorial guida attraverso l'intero flusso.
Un'altra fonte che la gente dimentica: Google ha ritirato i suoi link cache nel 2024, ma archive.today spesso ha pagine che la Wayback Machine ha perso, specialmente articoli di notizie, e Bing serve ancora copie cache per alcuni siti. Vale la pena di cercare prima di dichiarare un articolo irrecuperabile.

Regole sul copyright prima di ripubblicare
Non è consulenza legale, solo le linee che i professionisti effettivamente seguono. I fatti e le idee non sono protetti da copyright; lo è l'espressione specifica di essi. I tuoi articoli sono tuoi e puoi farne quello che vuoi. Per il testo di chiunque altro:
- Verifica la licenza. I marchi Creative Commons contano: CC0 e CC-BY permettono la ripubblicazione (CC-BY richiede attribuzione); CC-BY-NC vieta l'uso commerciale; nessun marchio significa tutti i diritti riservati.
- Ottieni il permesso per iscritto quando non c'è licenza. Un'email che dice sì batte pagine di teoria sul fair use.
- Il fair use è una difesa in tribunale, non un permesso. Pesa lo scopo, la quantità, la natura e l'effetto sul mercato, e citare un intero articolo fallisce il test della quantità quasi ogni volta.
- Attribuzione e link canonico sono buona educazione e buon SEO. Non curano l'infrazione.
- Le immagini hanno i loro propri copyright, separati dal testo. Riutilizzarle richiede un permesso a parte.
Una sfumatura che colpisce le agenzie: il lavoro fatto dai dipendenti di solito appartiene all'azienda, ma il lavoro dei contractor potrebbe non esserlo a meno che il contratto non dica diversamente. Se stai recuperando il blog della tua stessa azienda, conferma chi possiede effettivamente il testo prima di ripubblicarlo sotto un nuovo brand.
Una checklist di ripubblicazione che ti tiene al sicuro
- Conferma di possedere o avere la licenza per ogni elemento, testo e immagini separatamente
- Mantieni il nome dell'autore originale e la data di pubblicazione con l'articolo
- Imposta un URL canonico se la versione vecchia esiste ancora da qualche parte
- Reindirizza 301 gli URL vecchi alle nuove posizioni
- Aggiorna i link interni così puntano a pagine attive, non morte
- Nota le modifiche sostanziali ('aggiornato luglio 2026') invece di riscrivere silenziosamente la storia
Fai queste sei cose e un blog recuperato ritrova i suoi ranking di ricerca in modo sorprendentemente veloce, Google tratta un ripristino fedele agli URL originali come lo stesso sito che torna, non uno nuovo che ricomincia.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
È legale fare scraping di articoli web dal sito di qualcuno?
Per uso privato, archiviare una pagina che hai pagato, salvare un tutorial per la lettura offline, generalmente ok. Copiare in blocco gli articoli di qualcun altro per ripubblicarli non lo è: il testo è protetto da copyright indipendentemente da quanto fosse facile scaricarlo. I Termini di servizio aggiungono un livello contrattuale sopra. Possiedi il contenuto o hai il permesso, quel test risolve la maggior parte dei casi.
Qual è il modo più veloce per estrarre un articolo web adesso?
Aprilo in Firefox e premi F9. La Vista Lettura riduce tutto tranne l'articolo in circa un secondo, e da lì puoi copiarlo o stamparlo in PDF. Nessuno strumento, nessun codice.
Posso recuperare articoli web da un sito che non esiste più?
Sì, se è stato archiviato. La Wayback Machine conserva acquisizioni della maggior parte dei siti che avevano traffico; puoi prelevare le pagine manualmente, scriptarlo tramite l'API CDX, oppure ripristinare l'intero sito e usare un'esportazione strutturata per ottenere ogni articolo come CSV o JSON in un solo passaggio.
Quale formato di esportazione dovrei scegliere, XML, CSV o JSON?
Abbina l'importatore. L'importatore nativo di WordPress mangia XML. I flussi di lavoro basati su fogli di calcolo e gli script semplici sono più felici con CSV. Gli sviluppatori che costruiscono pipeline vogliono JSON. In caso di dubbio, prendi tutti e tre, costano poco generarli e il ripristino lo fai una volta sola.
La modalità di lettura funziona su ogni sito?
No. Fallisce su articoli con paywall, gallerie multipagina e pagine dove il testo esiste solo dopo l'esecuzione di JavaScript. Per those, usa un estrattore con browser headless, oppure, per il tuo sito non più attivo, un ripristino dall'archivio seguito da esportazione strutturata.
Gli strumenti di estrazione mantengono le immagini?
La maggior parte degli estrattori di testo rimuove le immagini o lascia URL hotlinked che muoiono con l'host originale. Ripristinare il sito preserva i file immagine effettivi insieme al testo. In ogni caso, tratta i diritti delle immagini separatamente dai diritti del testo, sono copyright diversi.
Guide correlate

wayback machine downloader
Strumenti per scaricare dalla Wayback Machine: cosa funziona davvero
Uno sguardo onesto agli strumenti per scaricare dalla Wayback Machine: gli script open-source, i loro reali limiti e l'opzione chiavi in mano che rimette online il tuo sito.

download entire website from archive org
Scarica un intero sito web da Archive.org, non solo la homepage
Per scaricare un intero sito web da archive.org servono tutte le pagine, le immagini e i fogli di stile. Le risorse si nascondono sotto timestamp diversi, ecco perché, più una checklist completa.

restore old website
Ripristinare un vecchio sito web senza riportare in vita i suoi problemi
Come ripristinare un vecchio sito web: gestire PHP obsoleto, Flash e frameset, decidere cosa conservare o modernizzare e recuperare i file dagli archivi web.

web cache
Web Cache spiegata: come funzionano le cache e come usarle
Cos'è una web cache, come funzionano le cache di browser, CDN, motori di ricerca e archivi, e come usare una web cache per visualizzare una pagina scomparsa.
