PDF in testo
Estrai il testo da un PDF e copialo o salvalo come file .txt. Tutto avviene nel tuo browser: il file non viene mai caricato.
Trascina qui un PDF per estrarne il testo
oppure fai clic per scegliere un file
- Al 100% nel tuo browser
- Nessun caricamento, nessuna registrazione
- Nessun limite di pagine o dimensione
- I file non lasciano il tuo dispositivo
Se il tuo PDF è una scansione, dentro non c'è testo da estrarre. Controlliamo ogni pagina e te lo diciamo prima che tu scarichi qualcosa.
Perché si estrae il testo da un PDF
Un PDF è la descrizione di una pagina stampata. Sa dove si trova ogni carattere, quanto è grande e quale font lo disegna, ma non sa che quei caratteri formano una frase, un titolo o un paragrafo. Va benissimo finché vuoi leggere la pagina, e diventa un problema nel momento in cui vuoi fare qualcos'altro con ciò che dice.
Da qui il ricorso al testo semplice. C'è chi ha una relazione lunga e vuole cercarci dentro davvero, o passare da una sezione all'altra invece di scorrere novanta pagine. Chi cita un paragrafo in un'email e non vuole che font, a capo e formattazione invisibile vengano dietro. Chi incolla un documento in un assistente AI, che vuole parole e non arredo di pagina. Chi archivia un contratto in un formato che si aprirà ancora fra vent'anni senza un programma particolare.
C'è poi il motivo dell'accessibilità, più frequente di quanto sembri. Le impaginazioni su più colonne sono faticose da leggere sul telefono, e uno screen reader che segue l'ordine sbagliato legge una pagina a due colonne come un discorso senza senso. Ridurre un documento alle sue parole nell'ordine giusto lo rende utilizzabile in modi che l'impaginazione originale impediva.
Due tipi di PDF, e solo uno contiene testo
Estrarre testo da un PDF significa leggere i caratteri conservati dentro il file. Funziona quando il PDF ha un livello di testo: le lettere vere e proprie, tenute accanto alle istruzioni che le disegnano. Un PDF scansionato non ha un livello di testo: è l'immagine di una pagina, e dentro non c'è nemmeno un carattere.
La maggior parte dei PDF creati da software — esportati da un elaboratore di testi, stampati in PDF dal browser, generati da un gestionale di fatturazione — ha un livello di testo. Lo si verifica aprendo il file e provando a selezionare una frase con il cursore. Se l'evidenziazione segue le parole, i caratteri ci sono davvero e qualunque strumento può leggerli.
Un PDF fatto con uno scanner o con la fotocamera del telefono è un'altra cosa. Ogni pagina è un'immagine. Tu vedi le parole perché il riconoscimento lo fanno i tuoi occhi, ma per il file quella pagina contiene una fotografia e nient'altro. Selezionare non fa nulla, cercare non trova nulla ed estrarre non restituisce nulla: non perché lo strumento abbia fallito, ma perché lì non c'è nulla da restituire.
Trasformare l'immagine di parole di nuovo in parole è un lavoro a parte che si chiama OCR, ed è un problema di riconoscimento e non di lettura: il software tira a indovinare su ogni forma e a volte sbaglia. Qui non lo facciamo. Quello che facciamo è controllare ogni pagina e dire in quale categoria ricade, prima che tu scarichi qualcosa. Uno strumento che ti consegna un file vuoto, o che passa all'OCR in silenzio senza dirtelo, ti toglie il modo di capire che tipo di documento avevi.
Questo controllo non è una stima. Una pagina con livello di testo restituisce i suoi caratteri; una senza non ne restituisce nessuno. Non c'è una via di mezzo su cui sbagliare. Per questo il risultato compare sopra al testo e non sepolto in un avviso più in basso.
Come estrarre il testo da un PDF
Non si installa nulla e non si carica nulla. Trascina il file, guarda cosa abbiamo trovato e portati via il testo come ti serve.
Trascina il tuo PDF
Scegli un file o trascinalo sul riquadro. Lo legge il tuo stesso browser: non viene inviato da nessuna parte e non c'è altro limite di pagine o dimensione oltre a quello che il tuo dispositivo regge.
Leggi prima il riepilogo
Prima che compaia qualsiasi testo saprai quante pagine hanno un livello di testo, quali sono scansioni, se il documento ha campi modulo compilati e se è stata rilevata e riordinata un'impaginazione su due colonne.
Regola la lettura se serve
Per impostazione predefinita il testo segue la pagina come la vedi e le righe sparse vengono riunite in paragrafi. Entrambe le cose si possono cambiare: l'ordine del documento conserva la sequenza memorizzata nel PDF, e lasciare ogni riga com'è conserva gli a capo originali.
Copia o salva
Copia mette il testo direttamente negli appunti, che è quello che serve a quasi tutti quando incollano in un documento o in un assistente AI. Scarica scrive lo stesso contenuto in un file .txt in UTF-8.
Correlato: Se ti serve il testo di poche pagine, è più rapido estrarre prima quelle pagine.
Cosa fa di diverso questo convertitore da PDF a testo
Il modo ingenuo di estrarre è prendere l'elenco dei frammenti che pdf.js restituisce e unirli e basta. È una riga di codice e produce qualcosa che sembra quasi giusto, ed è per questo che tanti strumenti fanno così. Su un modulo fiscale di due pagine quell'approccio incolla le parole attraverso settantasei a capo. Su otto pagine di un articolo scientifico, duecentonovantatré. Vengono fuori cose come «permission toreproduce» e «neural networksin particular», sparse nel documento dove non è detto che le noti prima di usare il testo.
Il problema più profondo è l'ordine. Un PDF memorizza il testo nell'ordine in cui viene dipinto sulla pagina, che non è l'ordine in cui lo leggi. In un modulo, un campo data può uscire come «MM DD YYYY/ /» perché i separatori vengono disegnati per ultimi. In una pagina a due colonne le due colonne si intrecciano una riga alla volta, che è esattamente quello che succede quando selezioni una pagina intera in un lettore PDF e la incolli altrove. Noi ricostruiamo l'ordine di lettura da dove i caratteri stanno davvero, e così torna «MM / DD / YYYY» e ogni colonna resta intera.
Poi ci sono le cose che è facile perdere del tutto. Se hai compilato un modulo PDF, nessuna delle tue risposte è nel testo della pagina: vivono nei campi modulo, e un estrattore che legge solo la pagina ti consegna un modello vuoto con tutta l'aria di aver funzionato. Noi li raccogliamo e li aggiungiamo in fondo. Inoltre alcuni generatori di PDF emettono caratteri che sembrano giusti e non lo sono: un documento cinese può uscire pieno di radicali Kangxi, indistinguibili sullo schermo, invisibili a una ricerca, sbagliati una volta incollati. Ogni stringa che consegniamo viene normalizzata perché torni ai caratteri che rappresenta.
A cosa serve, in pratica:
- Cercare davvero dentro una relazione lunga, o passare fra le sue sezioni
- Incollare un documento in un assistente AI senza l'arredo di pagina
- Citare da un articolo senza portarsi dietro la formattazione
- Recuperare le risposte da un modulo che qualcuno ha compilato e rimandato
- Archiviare un documento come testo semplice, apribile ovunque e per sempre
- Leggere sul telefono un'impaginazione a più colonne in una sola colonna
Funziona dove sei già
L'elaborazione avviene dentro il browser, quindi non c'è nulla da installare né account da creare. Va bene qualunque browser recente su qualunque sistema.
Windows
Chrome, Edge o Firefox. Nessun lettore, nessun abbonamento ad Acrobat, nulla da scaricare.
macOS
Safari, Chrome o Firefox. Più rapido che aprire il file in Anteprima e selezionare pagina per pagina.
Linux
Qualunque browser moderno. Lo stesso risultato del comando pdftotext, senza lasciare la pagina.
iPhone e iPad
Safari o Chrome. Utile quando un PDF arriva per email e ti serve il testo in un messaggio.
Android
Chrome, Firefox o Samsung Internet. Comodo per leggere un documento a due colonne in una sola.
Chromebook
Funziona del tutto offline una volta caricata la pagina, il che si adatta a un dispositivo scolastico gestito.
Perché copiare il testo da un PDF di solito viene male
Se hai mai selezionato una pagina in un lettore PDF, l'hai incollata e ti sei ritrovato le frasi rimescolate, il motivo è questo — ed è lo stesso per cui la maggior parte degli strumenti di conversione produce lo stesso pasticcio.
Cosa memorizza il PDF
L'ordine in cui la pagina viene dipinta. Il testo si posa nella sequenza che faceva comodo al programma che ha prodotto il file: un titolo, poi un piè di pagina, poi il corpo, poi i separatori che cadono fra i campi. La copia segue quella sequenza, quindi in una pagina a due colonne ottieni una riga della colonna di sinistra, una di quella di destra, e così fino in fondo.
Cosa ricostruiamo noi
L'ordine in cui leggeresti. I caratteri vengono raggruppati in righe in base a dove si trovano, le righe in colonne, e le colonne si leggono una dopo l'altra. Gli a capo tornano, le colonne restano intere e i separatori tornano in mezzo ai campi a cui appartengono.
Dove restano dei limiti
L'immagine di una pagina non si può leggere affatto, e una tabella smette di essere una tabella nel momento in cui diventa testo semplice: le righe sopravvivono, la griglia no. Una riga che attraversa entrambe le colonne senza che nessuna parte tagli la colonnina centrale, come una fila di nomi di autori, è indistinguibile da una riga per colonna, quindi un blocco di titolo può uscire in un ordine strano. La stessa comunità di Adobe dice lo stesso di Acrobat: con barre laterali e testo inserito, è «quasi impossibile» sapere quale riga seguire. Quando la nostra lettura sembra sbagliata, passa all'ordine del documento e confronta.
Testo o Word?
Il testo semplice è la risposta giusta quando vuoi le parole e nient'altro: cercare, citare, incollare in un assistente, archiviare. È la risposta sbagliata quando ti serve il documento come documento, con titoli, tabelle e immagini: quello è il lavoro di una conversione da PDF a Word, e nessun .txt lo farà. Vale la pena sapere per quale delle due sei venuto prima di giudicare il risultato.
Il tuo documento resta sul tuo dispositivo
I file che si portano a uno strumento come questo raramente sono irrilevanti. Sono contratti, fatture, curriculum, referti medici, moduli compilati: documenti in cui la parte delicata è tutto il contenuto. Vale la pena pensarci prima di caricarne uno da qualche parte.
Questo strumento non carica nulla. È il tuo browser ad aprire il PDF, leggerlo e comporre il testo sulla tua macchina. Non c'è nessuna richiesta che porti il tuo file, nessuna coda su un server, nulla messo in cache da qualche parte e nessuna copia che qualcuno debba cancellare in seguito. Chiudi la scheda ed è finita.
Significa anche che i soliti limiti non si applicano. Nessun tetto di pagine, nessun tetto di dimensione, nessuna quota giornaliera, perché dietro non c'è alcuna bolletta di server: solo quello che il tuo dispositivo regge comodamente.
Nessun caricamento
Il PDF viene letto dov'è già. Non viaggia mai.
Nessun account
Nessuna registrazione, nessuna email, nessuna filigrana sul risultato.
Nulla conservato
Dalla nostra parte non c'è alcuna copia da archiviare, registrare o cancellare.
Domande sull'estrazione di testo dai PDF
Perché il testo estratto è vuoto?⌄
Che cos'è un livello di testo?⌄
Fate l'OCR sui PDF scansionati?⌄
Perché copiando e incollando da un PDF viene fuori un pasticcio?⌄
Perché l'ordine è ancora sbagliato nel mio documento a due colonne?⌄
Ho compilato un modulo PDF: perché manca il mio testo?⌄
Le tabelle mantengono l'impaginazione?⌄
Meglio convertire in testo o in Word?⌄
I miei file vengono caricati?⌄
C'è un limite di dimensione del file?⌄
Funziona con PDF in cinese, giapponese, coreano o arabo?⌄
Che codifica ha il file .txt?⌄
Tira fuori il testo dal tuo PDF
Gratis, senza limiti ed elaborato interamente nel tuo browser, con una risposta onesta su cosa c'è davvero nel tuo file.
Estrai il testo da un PDFArticoli correlati
Approfondisci la conversione da PDF a PNG con le nostre guide e recensioni più recenti
Come convertire un PDF in PNG online (metodi gratuiti e veloci)
La guida completa per convertire gratis un PDF in PNG online. Confronto dei 5 migliori convertitori, procedure passo passo, consigli avanzati e soluzioni ai problemi più comuni.
Leggi l'articoloCome trasformare un PDF in PNG su Windows, Mac e telefono
La guida per convertire i PDF in PNG su ogni dispositivo. Strumenti già inclusi nel sistema, programmi consigliati e app per smartphone.
Leggi l'articoloDa PDF a PNG o da PDF a JPG: quale formato scegliere?
Confronto dettagliato tra i formati PNG e JPG per la conversione dei PDF. Peso dei file, differenze di qualità, casi d'uso e una guida per decidere.
Leggi l'articoloStrumenti di conversione correlati
Scopri gli altri strumenti della nostra suite completa per la conversione dei file
Estrai pagine da un PDF
Porta le pagine che ti servono in un nuovo PDF, o un file per pagina. Il tuo originale resta intatto. Senza caricamenti.
Appiattire PDF
Unisce i campi modulo compilati e i commenti nella pagina. Il testo resta testo, e ciò che non si può unire viene segnalato anziché cancellato.
Sbloccare un PDF
Togli una password che già conosci, o elimina i limiti a stampa e copia che non ne richiedono nessuna. Non viene caricato niente.