Strumenti online per estrarre siti web: utilizzi, limiti e sicurezza
A cura di la redazione di Restorix · 1 giugno 2026 · 9 min di lettura

Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Un cliente mi ha chiesto una volta di recuperare tutte le foto dei prodotti dal suo vecchio sito, circa 300 immagini sparse in quattro anni di pagine catalogo. Nessuno voleva l'HTML, il CSS o una copia completa. Solo le immagini, in una cartella, con nomi sensati. Questo è un lavoro di estrazione, e un estrattore di siti web online è di solito il modo più veloce per farlo.
Gli estrattori sono i cugini selettivi dei downloader. Invece di prendere tutto, estraggono un tipo di contenuto, testo, immagini, link, metadati, e lo restituiscono in una forma utilizzabile. Ecco cosa sanno fare bene, dove gli strumenti online battono il software locale e dove perdono, e le domande sulla sicurezza che vale la pena farsi prima di incollare un URL nel form di uno sconosciuto.
Cosa fa davvero un estrattore di siti web online
Gli dai un URL, lui recupera la pagina, a volte con un crawl superficiale intorno, analizza l'HTML e restituisce una fetta filtrata di ciò che ha trovato. Nessuna installazione, nessun codice; tutto avviene in una scheda del browser. Le fette disponibili, a seconda dello strumento:
- Estrazione dei contenuti: il testo leggibile dell'articolo, ripulito da menu, annunci e testi ripetitivi
- Estrazione dei media: ogni immagine, video o file audio a cui la pagina fa riferimento, raggruppati per il download
- Estrazione dei link: ogni href presente nella pagina, di solito suddiviso in liste interne ed esterne
- Estrazione dei contatti: indirizzi email, numeri di telefono e profili social visibili nel markup
- Dati strutturati: blocchi JSON-LD, tag Open Graph, meta title e description, a volte intere tabelle HTML convertite in CSV
Sotto il cofano, i buoni estrattori di contenuti eseguono un algoritmo in stile readability che assegna un punteggio ai blocchi HTML e tiene quello più sostanzioso, lo stesso trucco che usano le modalità reader dei browser. Ecco perché uno strumento valido restituisce un testo pulito dell'articolo, mentre uno scadente restituisce il menu di navigazione con l'articolo come nota a piè di pagina.
I lavori per cui la gente li usa davvero
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
Quattro sono i lavori che coprono la maggior parte degli usi reali. Primo, inventario pre-migrazione: tirare fuori ogni meta title, description e heading in un foglio di calcolo prima di ricostruire un sito, così non si dimentica nulla. Secondo, recuperare i propri asset, come quel lavoro sulle foto dei prodotti, quando gli originali sono persi ma il sito continua a servirli. Terzo, manutenzione SEO: estrarre ogni link in uscita dalle pagine chiave e trovare quelli che ora puntano a domini parcheggiati. Quarto, audit dei contenuti: tutti i titoli e le date dei post di un vecchio blog, esportati in CSV, per decidere cosa vale la pena tenere.
Un caso recente: il proprietario di un blog WordPress del 2014 voleva ogni titolo, data e corpo dei post in un foglio di calcolo prima di lasciar scadere l'hosting. Venti minuti con un estrattore, un CSV, hosting cancellato la stessa settimana. Nota cosa hanno in comune questi lavori, vuoi un sottoinsieme, in un formato strutturato, senza dover gestire una copia completa.
Strumenti online per estrarre siti web vs software locale
Gli strumenti online vincono sulla semplicità. Niente da installare, risultati in pochi secondi, e quelli validi producono CSV o zip direttamente. Perdono su scala e controllo: la maggior parte ti limita a una pagina o a un crawl superficiale, mette il tuo lavoro in coda dietro a quelli degli altri, e offre poche opzioni per cookie, header o impostazioni di rendering.
Gli strumenti locali invertono la situazione. Un'estensione del browser può estrarre dalle pagine a cui sei loggato, perché sfrutta la tua sessione. Uno script Python con requests e BeautifulSoup, o Scrapy per lavori più grandi, gestisce autenticazione, paginazione e centomila pagine senza chiedere il permesso a nessuno. wget e HTTrack stanno nel mezzo: più grezzi, ma tirano giù volentieri ogni immagine di un dominio con le giuste regole di accettazione.
| Estrattore online | Strumenti locali | |
|---|---|---|
| Configurazione | Nessuna, incolli un URL | Installi, configuri, a volte scrivi codice |
| Scala | Una pagina o un crawl superficiale | Siti interi, crawl schedulati |
| Pagine con login | Raramente | Sì, la tua sessione o i cookie |
| Pagine ricche di JavaScript | Alcuni eseguono il rendering, molti no | Browser headless se necessario |
| Ideale per | Estrazioni rapide e una tantum | Lavori ripetibili e di grandi dimensioni |
La mia divisione onesta: se il lavoro sta in un pomeriggio e le pagine sono pubbliche, inizia con uno strumento online. Nel momento in cui ti servono cookie, logica di paginazione o una seconda esecuzione il mese prossimo, scrivi lo script.
È sicuro incollare un URL in un estrattore di siti web online?
Sì, nella maggior parte dei casi, con tre eccezioni concrete che vale la pena conoscere.
Prima: il servizio vede e registra ogni URL che invii. Va bene per le pagine pubbliche. Non va bene per link di staging, URL di anteprima con token di accesso o hostname intranet, ho visto URL interni di sistemi di ticketing nei suggerimenti di autocompletamento di un estrattore molto popolare, il che la dice lunga sul loro logging. Seconda: il pacchetto scaricato. Un estrattore legittimo ti dà immagini, testo o un CSV. Uno che ti consegna un visualizzatore eseguibile non è un estrattore, è un veicolo per consegnare qualcosa. Terza: siti clone. Gli annunci sui motori di ricerca per nomi di strumenti noti portano regolarmente a cloni che esistono per distribuire malware o raccogliere tutto ciò che incolli.
La checklist operativa:
- Resta su siti HTTPS con una reputazione reale, verifica prima di incollare
- Non incollare mai URL che contengono token, ID di sessione o link per il reset della password
- Non inserire mai credenziali o caricare file di cookie su uno strumento web
- Aspettati immagini, testo, CSV o zip, chiudi la scheda se ricevi un.exe
Se uno strumento ti restituisce un installer invece di uno zip di immagini, non è mai stato un estrattore.

Dove questi strumenti non arrivano
Ogni estrattore, online o locale, incontra gli stessi muri. Le single-page app renderizzate in JavaScript restituiscono un guscio vuoto, a meno che lo strumento non esegua un vero motore browser. I muri di login fermano tutto ciò che non ha la tua sessione. I blocchi su robots.txt fanno voltare le spalle ai crawler educati. I rate limit e i CAPTCHA fanno desiderare loro di averlo fatto. La paginazione profonda, pagina 47 di un elenco di thread del forum, supera la pazienza della maggior parte degli strumenti online.
Lo scroll infinito merita un discorso a parte: la pagina contiene solo il primo blocco di elementi e carica il resto mentre scorri, quindi qualsiasi strumento che non simula lo scrolling vede solo una frazione della lista. Marketplace e profili social sono i casi più comuni.
Il muro più duro, però, è il più semplice: gli estrattori recuperano pagine live. Se il sito non c'è più, dominio scaduto, host morto, cancellato anni fa, non c'è nulla da cui estrarre. L'URL restituisce una pagina parcheggiata, e lo strumento torna a mani vuote.
Un workflow di estrazione sensato
- Definisci l'obiettivo prima di toccare uno strumento: testo dell'articolo, immagini, link o metadati. Ognuno punta a un estrattore diverso.
- Fai una prova su una pagina rappresentativa e controlla l'output, encoding, risoluzioni delle immagini, se il testo ha mantenuto le sue intestazioni.
- Verifica il formato di output: CSV per i fogli di calcolo, zip per i media, JSON se alimenta un altro sistema.
- Esegui il lavoro completo in modo educato. Rallenta se lo strumento lo consente, specialmente su siti piccoli.
- Verifica i conteggi rispetto alle aspettative. Trecento prodotti dovrebbero produrre circa trecento set di immagini, non 180.
- Salva l'elenco degli URL sorgente insieme ai risultati. Sei mesi dopo, nessuno si ricorda da dove arrivano i dati.

Strumenti online gratuiti vs a pagamento per estrarre siti web
La maggior parte degli estrattori online segue lo stesso modello freemium: una manciata di estrazioni gratuite al giorno, poi un paywall. Il piano gratuito è davvero sufficiente per i lavori una tantum, tirare giù le immagini da cinque pagine di catalogo non ti costa nulla se non un po' di pazienza.
Paga quando il lavoro si ripete o cresce: accesso API, profondità di crawl oltre un paio di livelli, esecuzioni schedulate e liste di URL in blocco sono ciò che compra davvero un abbonamento. Quello per cui non vale la pena pagare è qualsiasi strumento la cui unica proposta sia un wrapper più carino intorno a wget. Se il lavoro è scaricare tutto su questo dominio, uno strumento locale lo fa gratis, per sempre.
Quando l'estrazione diventa restauro
A volte la richiesta di estrazione è una richiesta di restauro travestita. Prendere tutto il testo e le immagini dal mio vecchio sito presume che il vecchio sito sia online. Quando non lo è, il contenuto esiste ancora, nella Wayback Machine, ma nessun estrattore che recupera pagine live può toccarlo.
È questo il gap che Restorix colma. Ripristina un sito morto a partire da snapshot d'archivio e può esportare gli articoli recuperati come XML, CSV o JSON strutturati, più un file manifest in JSON o SQLite, estrazione e restauro in un unico passaggio, con il numero di file e il prezzo bloccati prima del pagamento. Il manifest è più importante di quanto sembri: confrontalo con la tua vecchia sitemap e saprai esattamente cosa manca prima di ricostruire.
Ripristina il tuo sito dalla Wayback Machine
Stima gratuita in pochi secondi — paghi solo se confermi. I ripristini falliti vengono rimborsati automaticamente.
FAQ
Cos'è un estrattore di siti web online?
Uno strumento basato sul web che estrae dati specifici, testo, immagini, link, dettagli di contatto, metadati strutturati, dalle pagine agli URL che incolli. A differenza di un downloader di siti completo, filtra invece di fare una copia speculare, e a differenza di uno scraper personalizzato non richiede installazione o codice.
Un estrattore di siti web online può scaricare un intero sito?
In genere no. La maggior parte degli estrattori online lavora per pagina o esegue crawl superficiali con limiti, e i lavori grandi raggiungono rapidamente i limiti di coda. Le copie di interi siti sono territorio dei downloader, HTTrack o wget, e i siti morti sono territorio del restauro.
È legale estrarre dati da un sito web?
Estrarre dati dal proprio sito, ovviamente sì. Per i siti altrui: estrarre fatti pubblici è lecito in molte giurisdizioni, ma ripubblicare contenuti protetti da copyright non lo è, i termini di utilizzo possono vietare l'accesso automatizzato, e i dati personali su larga scala finiscono direttamente nel territorio del GDPR. Estrai per analisi e recupero, non per ripubblicazione.
Perché l'estrattore ha restituito quasi niente?
Apri la pagina e guarda il sorgente. Se il contenuto non è nell'HTML grezzo, la pagina viene renderizzata con JavaScript e qualsiasi estrattore che non esegue il rendering vede solo un guscio. Altri sospetti abituali: un redirect che non hai notato, un sistema anti-bot che serve una pagina con CAPTCHA, o un robots.txt che dice allo strumento di andarsene.
Posso estrarre contenuti da un sito che non esiste più?
Non dal web live, offline è offline. Il contenuto di solito sopravvive negli archivi web, però, e un ripristino da quegli snapshot rimette online le pagine; Restorix può quindi esportare gli articoli come XML, CSV o JSON se sono i dati strutturati quello che ti serve davvero.
Un estrattore può tirare fuori il testo da PDF o documenti su un sito?
La maggior parte elenca o raggruppa i file collegati, PDF, documenti, fogli di calcolo, invece di analizzarne il contenuto. Per il testo al loro interno, scarica prima i file ed esegui localmente un passaggio da PDF a testo.
Guide correlate

web downloader
Strumenti di Web Downloader a confronto: cosa salvano e cosa rompono
Come funziona un web downloader, cosa conservano realmente HTTrack, wget, SiteSucker e il salvataggio del browser, cosa rompe ciascuno e quando il ripristino è la scelta migliore.

find all pages on a website
Come trovare tutte le pagine di un sito web (anche quelle eliminate)
Hai bisogno di trovare tutte le pagine di un sito web, comprese quelle a cui nessun link punta? Confronta sitemap, crawler, l'API CDX del Wayback Machine ed export di Search Console.

restore website from wayback machine
Ripristinare un sito web dalla Wayback Machine: guida completa
Ripristina un sito web dalla Wayback Machine dall'inizio alla fine: scegli lo snapshot giusto, imposta le opzioni di ripristino e distribuisci un sito funzionante con un CMS in meno di un'ora.

download archive org
Come scaricare da Archive.org: elementi, snapshot e altro
Ogni modo pratico per scaricare contenuti da Archive.org, file di elementi, download massivi da CLI e snapshot web del Wayback Machine, e come scegliere quello giusto per il tuo lavoro.
