PDF in testo

Estrai il testo da un PDF e copialo o salvalo come file .txt. Tutto avviene nel tuo browser: il file non viene mai caricato.

  • Al 100% nel tuo browser
  • Nessun caricamento, nessuna registrazione
  • Nessun limite di pagine o dimensione
  • I file non lasciano il tuo dispositivo

Se il tuo PDF è una scansione, dentro non c'è testo da estrarre. Controlliamo ogni pagina e te lo diciamo prima che tu scarichi qualcosa.

Perché si estrae il testo da un PDF

Un PDF è la descrizione di una pagina stampata. Sa dove si trova ogni carattere, quanto è grande e quale font lo disegna, ma non sa che quei caratteri formano una frase, un titolo o un paragrafo. Va benissimo finché vuoi leggere la pagina, e diventa un problema nel momento in cui vuoi fare qualcos'altro con ciò che dice.

Da qui il ricorso al testo semplice. C'è chi ha una relazione lunga e vuole cercarci dentro davvero, o passare da una sezione all'altra invece di scorrere novanta pagine. Chi cita un paragrafo in un'email e non vuole che font, a capo e formattazione invisibile vengano dietro. Chi incolla un documento in un assistente AI, che vuole parole e non arredo di pagina. Chi archivia un contratto in un formato che si aprirà ancora fra vent'anni senza un programma particolare.

C'è poi il motivo dell'accessibilità, più frequente di quanto sembri. Le impaginazioni su più colonne sono faticose da leggere sul telefono, e uno screen reader che segue l'ordine sbagliato legge una pagina a due colonne come un discorso senza senso. Ridurre un documento alle sue parole nell'ordine giusto lo rende utilizzabile in modi che l'impaginazione originale impediva.

Con caricamentoIl loro server?Questo sitoTuo dispositivoNulla esce dal dispositivo: nessuna copia da cancellare.
Altri convertitori caricano il tuo documento. Questo lo legge dov'è.

Due tipi di PDF, e solo uno contiene testo

Estrarre testo da un PDF significa leggere i caratteri conservati dentro il file. Funziona quando il PDF ha un livello di testo: le lettere vere e proprie, tenute accanto alle istruzioni che le disegnano. Un PDF scansionato non ha un livello di testo: è l'immagine di una pagina, e dentro non c'è nemmeno un carattere.

La maggior parte dei PDF creati da software — esportati da un elaboratore di testi, stampati in PDF dal browser, generati da un gestionale di fatturazione — ha un livello di testo. Lo si verifica aprendo il file e provando a selezionare una frase con il cursore. Se l'evidenziazione segue le parole, i caratteri ci sono davvero e qualunque strumento può leggerli.

Un PDF fatto con uno scanner o con la fotocamera del telefono è un'altra cosa. Ogni pagina è un'immagine. Tu vedi le parole perché il riconoscimento lo fanno i tuoi occhi, ma per il file quella pagina contiene una fotografia e nient'altro. Selezionare non fa nulla, cercare non trova nulla ed estrarre non restituisce nulla: non perché lo strumento abbia fallito, ma perché lì non c'è nulla da restituire.

Trasformare l'immagine di parole di nuovo in parole è un lavoro a parte che si chiama OCR, ed è un problema di riconoscimento e non di lettura: il software tira a indovinare su ogni forma e a volte sbaglia. Qui non lo facciamo. Quello che facciamo è controllare ogni pagina e dire in quale categoria ricade, prima che tu scarichi qualcosa. Uno strumento che ti consegna un file vuoto, o che passa all'OCR in silenzio senza dirtelo, ti toglie il modo di capire che tipo di documento avevi.

Questo controllo non è una stima. Una pagina con livello di testo restituisce i suoi caratteri; una senza non ne restituisce nessuno. Non c'è una via di mezzo su cui sbagliare. Per questo il risultato compare sopra al testo e non sepolto in un avviso più in basso.

Invoice 2026Total 1,240.00Due 30 daysTesto veroSolo pixel
Due PDF identici sullo schermo: uno contiene caratteri, l'altro solo un'immagine di essi — e ingrandire non trasforma mai un'immagine in parole.

Come estrarre il testo da un PDF

Non si installa nulla e non si carica nulla. Trascina il file, guarda cosa abbiamo trovato e portati via il testo come ti serve.

Trascina un PDFLeggi l'esitoCopia o salva
Trascina il file, leggi cosa abbiamo trovato, poi copia o salva il testo.
1

Trascina il tuo PDF

Scegli un file o trascinalo sul riquadro. Lo legge il tuo stesso browser: non viene inviato da nessuna parte e non c'è altro limite di pagine o dimensione oltre a quello che il tuo dispositivo regge.

2

Leggi prima il riepilogo

Prima che compaia qualsiasi testo saprai quante pagine hanno un livello di testo, quali sono scansioni, se il documento ha campi modulo compilati e se è stata rilevata e riordinata un'impaginazione su due colonne.

3

Regola la lettura se serve

Per impostazione predefinita il testo segue la pagina come la vedi e le righe sparse vengono riunite in paragrafi. Entrambe le cose si possono cambiare: l'ordine del documento conserva la sequenza memorizzata nel PDF, e lasciare ogni riga com'è conserva gli a capo originali.

4

Copia o salva

Copia mette il testo direttamente negli appunti, che è quello che serve a quasi tutti quando incollano in un documento o in un assistente AI. Scarica scrive lo stesso contenuto in un file .txt in UTF-8.

Correlato: Se ti serve il testo di poche pagine, è più rapido estrarre prima quelle pagine.

Cosa fa di diverso questo convertitore da PDF a testo

Il modo ingenuo di estrarre è prendere l'elenco dei frammenti che pdf.js restituisce e unirli e basta. È una riga di codice e produce qualcosa che sembra quasi giusto, ed è per questo che tanti strumenti fanno così. Su un modulo fiscale di due pagine quell'approccio incolla le parole attraverso settantasei a capo. Su otto pagine di un articolo scientifico, duecentonovantatré. Vengono fuori cose come «permission toreproduce» e «neural networksin particular», sparse nel documento dove non è detto che le noti prima di usare il testo.

Il problema più profondo è l'ordine. Un PDF memorizza il testo nell'ordine in cui viene dipinto sulla pagina, che non è l'ordine in cui lo leggi. In un modulo, un campo data può uscire come «MM DD YYYY/ /» perché i separatori vengono disegnati per ultimi. In una pagina a due colonne le due colonne si intrecciano una riga alla volta, che è esattamente quello che succede quando selezioni una pagina intera in un lettore PDF e la incolli altrove. Noi ricostruiamo l'ordine di lettura da dove i caratteri stanno davvero, e così torna «MM / DD / YYYY» e ogni colonna resta intera.

Poi ci sono le cose che è facile perdere del tutto. Se hai compilato un modulo PDF, nessuna delle tue risposte è nel testo della pagina: vivono nei campi modulo, e un estrattore che legge solo la pagina ti consegna un modello vuoto con tutta l'aria di aver funzionato. Noi li raccogliamo e li aggiungiamo in fondo. Inoltre alcuni generatori di PDF emettono caratteri che sembrano giusti e non lo sono: un documento cinese può uscire pieno di radicali Kangxi, indistinguibili sullo schermo, invisibili a una ricerca, sbagliati una volta incollati. Ogni stringa che consegniamo viene normalizzata perché torni ai caratteri che rappresenta.

A cosa serve, in pratica:

  • Cercare davvero dentro una relazione lunga, o passare fra le sue sezioni
  • Incollare un documento in un assistente AI senza l'arredo di pagina
  • Citare da un articolo senza portarsi dietro la formattazione
  • Recuperare le risposte da un modulo che qualcuno ha compilato e rimandato
  • Archiviare un documento come testo semplice, apribile ovunque e per sempre
  • Leggere sul telefono un'impaginazione a più colonne in una sola colonna

Funziona dove sei già

L'elaborazione avviene dentro il browser, quindi non c'è nulla da installare né account da creare. Va bene qualunque browser recente su qualunque sistema.

§ 01

Windows

Chrome, Edge o Firefox. Nessun lettore, nessun abbonamento ad Acrobat, nulla da scaricare.

§ 02

macOS

Safari, Chrome o Firefox. Più rapido che aprire il file in Anteprima e selezionare pagina per pagina.

§ 03

Linux

Qualunque browser moderno. Lo stesso risultato del comando pdftotext, senza lasciare la pagina.

§ 04

iPhone e iPad

Safari o Chrome. Utile quando un PDF arriva per email e ti serve il testo in un messaggio.

§ 05

Android

Chrome, Firefox o Samsung Internet. Comodo per leggere un documento a due colonne in una sola.

§ 06

Chromebook

Funziona del tutto offline una volta caricata la pagina, il che si adatta a un dispositivo scolastico gestito.

Perché copiare il testo da un PDF di solito viene male

Se hai mai selezionato una pagina in un lettore PDF, l'hai incollata e ti sei ritrovato le frasi rimescolate, il motivo è questo — ed è lo stesso per cui la maggior parte degli strumenti di conversione produce lo stesso pasticcio.

Ordine disegnoOrdine lettura
Un PDF memorizza il testo nell'ordine in cui lo disegna. Noi ricostruiamo quello in cui lo leggi.

Cosa memorizza il PDF

L'ordine in cui la pagina viene dipinta. Il testo si posa nella sequenza che faceva comodo al programma che ha prodotto il file: un titolo, poi un piè di pagina, poi il corpo, poi i separatori che cadono fra i campi. La copia segue quella sequenza, quindi in una pagina a due colonne ottieni una riga della colonna di sinistra, una di quella di destra, e così fino in fondo.

Cosa ricostruiamo noi

L'ordine in cui leggeresti. I caratteri vengono raggruppati in righe in base a dove si trovano, le righe in colonne, e le colonne si leggono una dopo l'altra. Gli a capo tornano, le colonne restano intere e i separatori tornano in mezzo ai campi a cui appartengono.

Dove restano dei limiti

L'immagine di una pagina non si può leggere affatto, e una tabella smette di essere una tabella nel momento in cui diventa testo semplice: le righe sopravvivono, la griglia no. Una riga che attraversa entrambe le colonne senza che nessuna parte tagli la colonnina centrale, come una fila di nomi di autori, è indistinguibile da una riga per colonna, quindi un blocco di titolo può uscire in un ordine strano. La stessa comunità di Adobe dice lo stesso di Acrobat: con barre laterali e testo inserito, è «quasi impossibile» sapere quale riga seguire. Quando la nostra lettura sembra sbagliata, passa all'ordine del documento e confronta.

Testo o Word?

Il testo semplice è la risposta giusta quando vuoi le parole e nient'altro: cercare, citare, incollare in un assistente, archiviare. È la risposta sbagliata quando ti serve il documento come documento, con titoli, tabelle e immagini: quello è il lavoro di una conversione da PDF a Word, e nessun .txt lo farà. Vale la pena sapere per quale delle due sei venuto prima di giudicare il risultato.

Il tuo documento resta sul tuo dispositivo

I file che si portano a uno strumento come questo raramente sono irrilevanti. Sono contratti, fatture, curriculum, referti medici, moduli compilati: documenti in cui la parte delicata è tutto il contenuto. Vale la pena pensarci prima di caricarne uno da qualche parte.

Questo strumento non carica nulla. È il tuo browser ad aprire il PDF, leggerlo e comporre il testo sulla tua macchina. Non c'è nessuna richiesta che porti il tuo file, nessuna coda su un server, nulla messo in cache da qualche parte e nessuna copia che qualcuno debba cancellare in seguito. Chiudi la scheda ed è finita.

Significa anche che i soliti limiti non si applicano. Nessun tetto di pagine, nessun tetto di dimensione, nessuna quota giornaliera, perché dietro non c'è alcuna bolletta di server: solo quello che il tuo dispositivo regge comodamente.

§ 01

Nessun caricamento

Il PDF viene letto dov'è già. Non viaggia mai.

§ 02

Nessun account

Nessuna registrazione, nessuna email, nessuna filigrana sul risultato.

§ 03

Nulla conservato

Dalla nostra parte non c'è alcuna copia da archiviare, registrare o cancellare.

Domande sull'estrazione di testo dai PDF

Perché il testo estratto è vuoto?
Quasi certamente perché il PDF è una scansione. Una pagina scansionata è un'immagine e dentro non ci sono caratteri da leggere: l'estrazione non restituisce nulla perché non c'è nulla. Apri il file e prova a selezionare una frase: se non compare nessuna evidenziazione, è questo. Ti diciamo quali pagine sono coinvolte invece di consegnarti un file vuoto.
Che cos'è un livello di testo?
I caratteri conservati dentro il PDF, accanto alle istruzioni che li disegnano sullo schermo. Un PDF esportato da un software ce l'ha; uno prodotto da uno scanner o da una fotocamera no, perché contiene invece la fotografia di una pagina. Tutto ciò che riguarda l'estrazione del testo discende da quale dei due hai.
Fate l'OCR sui PDF scansionati?
No. L'OCR riconosce forme e indovina i caratteri: è un altro mestiere, con altri modi di sbagliare, e preferiamo non far finta del contrario. Se le tue pagine sono scansioni lo diciamo e ti indichiamo come convertirle in immagini, che poi puoi passare allo strumento OCR che preferisci. Quello che non faremo è sostituire in silenzio ciò che hai chiesto con una supposizione.
Perché copiando e incollando da un PDF viene fuori un pasticcio?
Perché un PDF memorizza il testo nell'ordine in cui viene disegnato, non in quello in cui lo leggi. La copia segue l'ordine memorizzato, quindi una pagina a due colonne esce intrecciata una riga alla volta e i campi disegnati in una sequenza insolita escono scombinati. Questo strumento ricostruisce l'ordine dalla posizione dei caratteri sulla pagina, ed è per questo che il risultato di solito si legge bene dove una copia semplice no.
Perché l'ordine è ancora sbagliato nel mio documento a due colonne?
Il rilevamento delle colonne si basa sullo spazio che scende al centro della pagina, e certe impaginazioni non danno una risposta netta: una figura larga, una barra laterale o una fila di nomi distesa su tutta la larghezza. Se una pagina esce nell'ordine sbagliato, passa l'ordine di lettura a «ordine del documento»: ottieni la sequenza memorizzata nel PDF, non modificata, e a volte è la più utile delle due.
Ho compilato un modulo PDF: perché manca il mio testo?
Perché quello che hai digitato non fa parte della pagina. I valori del modulo vivono nei campi modulo, separati dal testo che c'era già alla creazione del documento, quindi uno strumento che legge solo la pagina ti dà un modello vuoto e nessun avviso. Noi leggiamo anche i campi e aggiungiamo le risposte in fondo al testo, sotto un titolo dedicato. Puoi disattivarlo se vuoi solo la pagina.
Le tabelle mantengono l'impaginazione?
No, e nessuno strumento di testo semplice dovrebbe promettere altro. Un file .txt non ha la nozione di tabella: le celle escono come testo in ordine di lettura, riga per riga, senza la griglia. I confini fra le colonne di solito sopravvivono come spazi, abbastanza per vedere dove finisce un campo e comincia il successivo; se ti serve una tabella vera, punta a un foglio di calcolo o a una conversione in Word.
Meglio convertire in testo o in Word?
In testo se vuoi le parole: cercare, citare, incollare in un assistente AI, archiviare qualcosa che si aprirà ovunque. In Word se vuoi indietro il documento come documento, con titoli, tabelle, immagini e stile. Sono davvero due lavori diversi, e un .txt che ha buttato via la formattazione sta facendo esattamente ciò che deve.
I miei file vengono caricati?
No. Il PDF viene aperto e letto dal tuo stesso browser e il testo viene composto sul tuo dispositivo. Non viene inviato nulla a un server, quindi non esiste da nessuna parte una copia che qualcuno possa conservare o cancellare. Per uno strumento il cui input tipico è un contratto, un curriculum o un modulo compilato, è un aspetto che conta.
C'è un limite di dimensione del file?
Nessuno imposto da noi, perché non c'è di mezzo alcun server. Il tetto vero è il tuo dispositivo: un documento molto grande consuma memoria mentre viene letto, e un telefono vecchio farà fatica con un file che un portatile gestisce senza problemi. Le pagine vengono elaborate una alla volta, così l'avanzamento continua anche sui documenti grandi.
Funziona con PDF in cinese, giapponese, coreano o arabo?
Sì. Il testo in qualunque scrittura contenuta nel PDF viene estratto allo stesso modo e l'output è UTF-8. C'è un dettaglio che vale la pena conoscere sui documenti dell'Asia orientale: alcuni generatori di PDF emettono radicali Kangxi al posto dei caratteri normali; sembrano identici, ma una ricerca del carattere normale non li trova. Noi li normalizziamo prima di consegnarti il testo, cosa che la maggior parte degli strumenti non fa.
Che codifica ha il file .txt?
UTF-8, senza byte order mark. È ciò che si aspettano editor, terminali e linguaggi attuali, e mantiene intatti gli accenti e le scritture cirillica, greca e dell'Asia orientale. Se sei abituato al comando pdftotext, è la stessa convenzione di output.

Tira fuori il testo dal tuo PDF

Gratis, senza limiti ed elaborato interamente nel tuo browser, con una risposta onesta su cosa c'è davvero nel tuo file.

Estrai il testo da un PDF