PDF para texto

Tire o texto de um PDF e copie ou salve como arquivo .txt. Tudo acontece no seu navegador: o arquivo nunca é enviado.

  • 100% no seu navegador
  • Sem envio, sem cadastro
  • Sem limite de páginas ou tamanho
  • Os arquivos não saem do seu dispositivo

Se o seu PDF for digitalizado, não há texto dentro dele para extrair. Verificamos cada página e avisamos antes de você baixar qualquer coisa.

Por que as pessoas tiram o texto de um PDF

Um PDF é a descrição de uma página impressa. Ele sabe onde cada caractere fica, de que tamanho é e qual fonte o desenha, mas não sabe que esses caracteres formam uma frase, um título ou um parágrafo. Isso basta enquanto você só quer ler a página, e vira um problema no instante em que você quer fazer outra coisa com o que ela diz.

Daí o recurso ao texto puro. Alguém tem um relatório longo e quer buscar dentro dele de verdade, ou pular entre as seções em vez de rolar noventa páginas. Alguém cita um parágrafo num e-mail e não quer que a fonte, as quebras de linha e a formatação invisível venham junto. Alguém cola um documento num assistente de IA, que quer palavras e não mobília de página. Alguém arquiva um contrato num formato que ainda vai abrir daqui a vinte anos sem nenhum programa específico.

Há também o motivo de acessibilidade, mais comum do que parece. Layouts em várias colunas são difíceis de ler no celular, e um leitor de tela que segue a ordem errada lê uma página de duas colunas como algo sem sentido. Reduzir um documento às suas palavras na ordem certa o torna utilizável de formas que o layout original impedia.

Com envioServidor deles?Este siteSeu aparelhoNada sai do seu dispositivo, então não há cópia para apagar.
Outros conversores enviam seu documento. Este lê onde ele está.

Dois tipos de PDF, e só um tem texto

Extrair texto de um PDF significa ler os caracteres guardados dentro do arquivo. Isso funciona quando o PDF tem camada de texto: as letras de verdade, mantidas ao lado das instruções que as desenham. Um PDF digitalizado não tem camada de texto: é a imagem de uma página, e dentro dela não há nenhum caractere.

A maioria dos PDFs feitos por software — exportados de um editor de texto, impressos em PDF pelo navegador, gerados por um sistema de faturamento — tem camada de texto. Dá para conferir abrindo o arquivo e tentando selecionar uma frase com o cursor. Se o realce acompanhar as palavras, os caracteres estão realmente lá e qualquer ferramenta consegue lê-los.

Um PDF feito por um scanner ou pela câmera do celular é outra coisa. Cada página é uma imagem. Você vê as palavras porque quem faz o reconhecimento são os seus olhos, mas para o arquivo aquela página contém uma fotografia e nada mais. Selecionar não faz nada, buscar não encontra nada e extrair não devolve nada: não porque a ferramenta falhou, mas porque ali não há nada para devolver.

Transformar a imagem de palavras de volta em palavras é outro trabalho, chamado OCR, e é um problema de reconhecimento e não de leitura: o software adivinha cada forma e às vezes erra. Aqui não fazemos isso. O que fazemos é verificar cada página e dizer em qual categoria ela cai, antes de você baixar qualquer coisa. Uma ferramenta que te entrega um arquivo vazio, ou que troca para OCR em silêncio sem avisar, tira de você a chance de saber que tipo de documento tinha em mãos.

Essa verificação não é um palpite. Uma página com camada de texto devolve seus caracteres; uma sem ela não devolve nenhum. Não existe meio-termo em que dê para errar. Por isso o resultado aparece acima do texto, e não enterrado num aviso mais abaixo.

Invoice 2026Total 1,240.00Due 30 daysTexto realSó pixels
Dois PDFs que na tela parecem iguais: um contém caracteres, o outro só uma imagem deles — e ampliar nunca transforma uma imagem em palavras.

Como extrair o texto de um PDF

Nada para instalar e nada é enviado. Solte o arquivo, veja o que encontramos e leve o texto do jeito que você precisa.

Solte um PDFVeja o avisoCopie ou salve
Solte o arquivo, leia o que encontramos e copie ou salve o texto.
1

Solte seu PDF

Escolha um arquivo ou arraste até a caixa. Quem lê é o seu próprio navegador: ele não é enviado a lugar nenhum, e não há limite de páginas ou tamanho além do que o seu dispositivo aguenta.

2

Leia o resumo primeiro

Antes de qualquer texto aparecer, você já sabe quantas páginas têm camada de texto, quais são digitalizadas, se o documento tem campos de formulário preenchidos e se um layout de duas colunas foi detectado e reordenado.

3

Ajuste a leitura, se precisar

Por padrão o texto segue a página como você a vê e as linhas soltas voltam a formar parágrafos. Os dois podem ser trocados: a ordem do documento preserva a sequência guardada no PDF, e manter cada linha como está preserva as quebras originais.

4

Copie ou salve

Copiar coloca o texto direto na área de transferência, que é o que a maioria quer ao colar num documento ou num assistente de IA. Baixar grava o mesmo conteúdo num arquivo .txt em UTF-8.

Relacionado: Se você só precisa do texto de algumas páginas, é mais rápido extrair essas páginas antes.

O que este conversor de PDF para texto faz de diferente

O jeito ingênuo de extrair é pegar a lista de pedaços que o pdf.js devolve e emendar tudo. É uma linha de código e produz algo que quase parece certo, e é por isso que tantas ferramentas fazem assim. Num formulário fiscal de duas páginas, essa abordagem cola palavras em setenta e seis quebras de linha. Em oito páginas de um artigo científico, duzentas e noventa e três. Saem coisas como «permission toreproduce» e «neural networksin particular», espalhadas pelo documento onde você não necessariamente vai notar antes de usar o texto.

O problema mais profundo é a ordem. Um PDF guarda o texto na ordem em que ele é pintado na página, que não é a ordem em que você lê. Num formulário, um campo de data pode sair como «MM DD YYYY/ /» porque os separadores são desenhados por último. Numa página de duas colunas, as duas colunas se intercalam linha a linha, que é exatamente o que acontece quando você seleciona uma página inteira num leitor de PDF e cola em outro lugar. Nós reconstruímos a ordem de leitura a partir de onde os caracteres realmente estão, o que devolve «MM / DD / YYYY» e mantém cada coluna inteira.

E há o que é fácil perder por completo. Se você preencheu um formulário PDF, nenhuma das suas respostas está no texto da página: elas ficam nos campos de formulário, e um extrator que só lê a página te entrega um modelo em branco com toda a cara de ter funcionado. Nós recolhemos essas respostas e as acrescentamos no fim. Além disso, alguns geradores de PDF emitem caracteres que parecem certos e não são: um documento em chinês pode sair cheio de radicais Kangxi, indistinguíveis na tela, invisíveis para uma busca e errados quando colados. Toda string que entregamos é normalizada para voltar aos caracteres que representa.

Para que as pessoas usam:

  • Buscar de verdade dentro de um relatório longo, ou pular entre as seções
  • Colar um documento num assistente de IA sem a mobília de página
  • Citar um artigo sem arrastar a formatação junto
  • Recuperar as respostas de um formulário que alguém preencheu e devolveu
  • Arquivar um documento como texto puro que abre em qualquer lugar
  • Ler um layout de várias colunas no celular, em uma coluna só

Funciona onde você já está

O trabalho acontece dentro do navegador, então não há nada para instalar nem conta para criar. Qualquer navegador atual, em qualquer sistema, serve.

§ 01

Windows

Chrome, Edge ou Firefox. Sem leitor, sem assinatura do Acrobat, sem nada para baixar.

§ 02

macOS

Safari, Chrome ou Firefox. Mais rápido do que abrir o arquivo no Visualização e selecionar página por página.

§ 03

Linux

Qualquer navegador moderno. O mesmo resultado do comando pdftotext, sem sair da página.

§ 04

iPhone e iPad

Safari ou Chrome. Útil quando um PDF chega por e-mail e você precisa do texto numa mensagem.

§ 05

Android

Chrome, Firefox ou Samsung Internet. Prático para ler um documento de duas colunas em uma só.

§ 06

Chromebook

Funciona totalmente offline depois que a página carrega, o que combina com um aparelho escolar gerenciado.

Por que copiar texto de um PDF quase sempre sai errado

Se você já selecionou uma página num leitor de PDF, colou e encontrou as frases embaralhadas, o motivo é este — e é o mesmo motivo pelo qual a maioria das ferramentas de conversão produz a mesma bagunça.

Ordem de desenhoOrdem de leitura
Um PDF guarda o texto na ordem em que o desenha. Nós reconstruímos a ordem em que você lê.

O que o PDF guarda

A ordem em que a página é pintada. O texto é colocado na sequência que convinha ao programa que produziu o arquivo: um título, depois um rodapé, depois o corpo, depois os separadores que caem entre os campos. Copiar segue essa sequência, então numa página de duas colunas você recebe uma linha da coluna da esquerda, uma da direita, e assim até o fim.

O que nós reconstruímos

A ordem em que você leria. Os caracteres são agrupados em linhas conforme a posição, as linhas em colunas, e as colunas são lidas uma após a outra. As quebras voltam, as colunas ficam inteiras e os separadores retornam ao meio dos campos a que pertencem.

Onde ainda há limites

A imagem de uma página não pode ser lida de jeito nenhum, e uma tabela deixa de ser tabela assim que vira texto puro: as linhas sobrevivem, a grade não. Uma linha que atravessa as duas colunas sem que nenhuma parte cruze o vão central, como uma fileira de nomes de autores, é indistinguível de uma linha de cada coluna, então um bloco de título pode sair numa ordem estranha. A própria comunidade da Adobe diz o mesmo sobre o Acrobat: com barras laterais e texto inserido, é «quase impossível» saber qual linha seguir. Quando a nossa leitura parecer errada, troque para a ordem do documento e compare.

Texto ou Word?

Texto puro é a resposta certa quando você quer as palavras e mais nada: buscar, citar, colar num assistente, arquivar. É a resposta errada quando você precisa do documento de volta como documento, com títulos, tabelas e imagens; isso é trabalho de uma conversão de PDF para Word, e nenhum .txt vai dar conta. Vale saber por qual das duas você veio antes de julgar o resultado.

Seu documento fica no seu dispositivo

Os arquivos que as pessoas levam a uma ferramenta assim raramente são banais. São contratos, notas fiscais, currículos, laudos médicos, formulários preenchidos: documentos em que a parte sensível é todo o conteúdo. Vale pensar nisso antes de enviar um deles para qualquer lugar.

Esta ferramenta não envia nada. Seu navegador abre o PDF, lê e monta o texto na sua própria máquina. Não há requisição carregando seu arquivo, nem fila em servidor, nem cache em lugar nenhum, nem cópia que alguém precise apagar depois. Feche a aba e acabou.

Isso também quer dizer que os limites de sempre não se aplicam. Sem teto de páginas, sem teto de tamanho, sem cota diária, porque não há conta de servidor por trás: só o que o seu próprio dispositivo aguenta com folga.

§ 01

Sem envio

O PDF é lido onde já está. Ele nunca viaja.

§ 02

Sem conta

Sem cadastro, sem e-mail, sem marca d'água no resultado.

§ 03

Nada guardado

Do nosso lado não existe cópia para armazenar, registrar ou apagar.

Perguntas sobre extrair texto de PDF

Por que o texto extraído veio vazio?
Quase com certeza porque o PDF é digitalizado. Uma página digitalizada é uma imagem e dentro dela não há caracteres para ler: a extração não devolve nada porque não há nada. Abra o arquivo e tente selecionar uma frase; se nenhum realce aparecer, é isso. Nós dizemos quais páginas estão nessa situação em vez de te entregar um arquivo em branco.
O que é uma camada de texto?
São os caracteres guardados dentro do PDF, ao lado das instruções que os desenham na tela. Um PDF exportado de um software tem uma; um feito por scanner ou câmera não tem, porque contém a fotografia de uma página no lugar. Tudo relacionado a extrair texto decorre de qual dos dois você tem.
Vocês fazem OCR em PDFs digitalizados?
Não. OCR reconhece formas e adivinha caracteres: é outro trabalho, com outros modos de falhar, e preferimos não fingir o contrário. Se as suas páginas são digitalizadas, dizemos isso e apontamos o caminho de convertê-las em imagens, que depois você pode passar pela ferramenta de OCR que preferir. O que não faremos é trocar em silêncio o que você pediu por um palpite.
Por que copiar e colar de um PDF sai embaralhado?
Porque o PDF guarda o texto na ordem em que ele é desenhado, não na ordem em que você lê. A cópia segue a ordem guardada, então uma página de duas colunas sai intercalada linha a linha, e campos desenhados numa sequência incomum saem trocados. Esta ferramenta reconstrói a ordem pela posição dos caracteres na página, e por isso o resultado costuma ler direito onde uma cópia simples não lê.
Por que a ordem ainda está errada no meu documento de duas colunas?
A detecção de colunas se apoia no vão que desce pelo meio da página, e alguns layouts não dão uma resposta limpa: uma figura larga, uma barra lateral ou uma fileira de nomes espalhada por toda a largura. Se uma página sair na ordem errada, troque a ordem de leitura para «ordem do documento»: você recebe a sequência guardada no PDF, sem alteração, e às vezes ela é a mais útil das duas.
Preenchi um formulário PDF — por que meu texto sumiu?
Porque o que você digitou não faz parte da página. Os valores do formulário ficam nos campos de formulário, separados do texto que já existia quando o documento foi criado, então uma ferramenta que só lê a página te dá um modelo em branco e nenhum aviso. Nós lemos os campos também e acrescentamos as respostas no fim do texto, sob um título próprio. Dá para desligar isso se você só quiser a página.
As tabelas mantêm o layout?
Não, e nenhuma ferramenta de texto puro deveria prometer outra coisa. Um arquivo .txt não tem a noção de tabela: as células saem como texto na ordem de leitura, linha por linha, sem a grade. Os limites das colunas costumam sobreviver como espaços, o suficiente para ver onde um campo acaba e o próximo começa; se você precisa de uma tabela de verdade, quer uma planilha ou uma conversão para Word.
Devo converter para texto ou para Word?
Para texto se você quer as palavras: buscar, citar, colar num assistente de IA, arquivar algo que abre em qualquer lugar. Para Word se você quer o documento de volta como documento, com títulos, tabelas, imagens e estilo. São trabalhos realmente diferentes, e um .txt que jogou a formatação fora está fazendo exatamente o que deve.
Meus arquivos são enviados?
Não. O PDF é aberto e lido pelo seu próprio navegador, e o texto é montado no seu dispositivo. Nada vai para um servidor, então não existe em lugar algum uma cópia que alguém possa guardar ou apagar. Para uma ferramenta cuja entrada típica é um contrato, um currículo ou um formulário preenchido, isso conta.
Existe limite de tamanho de arquivo?
Nenhum imposto por nós, porque não há servidor envolvido. O teto real é o seu dispositivo: um documento muito grande consome memória enquanto é lido, e um celular antigo vai sofrer com um arquivo que um notebook processa tranquilo. As páginas são processadas uma a uma, então o progresso continua andando em documentos grandes.
Funciona com PDFs em chinês, japonês, coreano ou árabe?
Funciona. Texto em qualquer escrita que o PDF traga é extraído do mesmo jeito, e a saída é UTF-8. Há um detalhe que vale conhecer em documentos do Leste Asiático: alguns geradores de PDF emitem radicais Kangxi no lugar dos caracteres comuns; eles parecem idênticos, mas uma busca pelo caractere normal não os encontra. Nós normalizamos isso antes de te entregar o texto, o que a maioria das ferramentas não faz.
Qual é a codificação do arquivo .txt?
UTF-8, sem marca de ordem de bytes. É o que qualquer editor, terminal ou linguagem atual espera, e mantém intactos os acentos e os textos em cirílico, grego e do Leste Asiático. Se você está acostumado com o comando pdftotext, é a mesma convenção de saída.

Tire o texto do seu PDF

Grátis, sem limites e processado inteiramente no seu navegador — com uma resposta honesta sobre o que existe de fato no seu arquivo.

Extrair texto de um PDF