PDF para texto
Tire o texto de um PDF e copie ou salve como arquivo .txt. Tudo acontece no seu navegador: o arquivo nunca é enviado.
Solte um PDF para extrair o texto
ou clique para escolher um arquivo
- 100% no seu navegador
- Sem envio, sem cadastro
- Sem limite de páginas ou tamanho
- Os arquivos não saem do seu dispositivo
Se o seu PDF for digitalizado, não há texto dentro dele para extrair. Verificamos cada página e avisamos antes de você baixar qualquer coisa.
Por que as pessoas tiram o texto de um PDF
Um PDF é a descrição de uma página impressa. Ele sabe onde cada caractere fica, de que tamanho é e qual fonte o desenha, mas não sabe que esses caracteres formam uma frase, um título ou um parágrafo. Isso basta enquanto você só quer ler a página, e vira um problema no instante em que você quer fazer outra coisa com o que ela diz.
Daí o recurso ao texto puro. Alguém tem um relatório longo e quer buscar dentro dele de verdade, ou pular entre as seções em vez de rolar noventa páginas. Alguém cita um parágrafo num e-mail e não quer que a fonte, as quebras de linha e a formatação invisível venham junto. Alguém cola um documento num assistente de IA, que quer palavras e não mobília de página. Alguém arquiva um contrato num formato que ainda vai abrir daqui a vinte anos sem nenhum programa específico.
Há também o motivo de acessibilidade, mais comum do que parece. Layouts em várias colunas são difíceis de ler no celular, e um leitor de tela que segue a ordem errada lê uma página de duas colunas como algo sem sentido. Reduzir um documento às suas palavras na ordem certa o torna utilizável de formas que o layout original impedia.
Dois tipos de PDF, e só um tem texto
Extrair texto de um PDF significa ler os caracteres guardados dentro do arquivo. Isso funciona quando o PDF tem camada de texto: as letras de verdade, mantidas ao lado das instruções que as desenham. Um PDF digitalizado não tem camada de texto: é a imagem de uma página, e dentro dela não há nenhum caractere.
A maioria dos PDFs feitos por software — exportados de um editor de texto, impressos em PDF pelo navegador, gerados por um sistema de faturamento — tem camada de texto. Dá para conferir abrindo o arquivo e tentando selecionar uma frase com o cursor. Se o realce acompanhar as palavras, os caracteres estão realmente lá e qualquer ferramenta consegue lê-los.
Um PDF feito por um scanner ou pela câmera do celular é outra coisa. Cada página é uma imagem. Você vê as palavras porque quem faz o reconhecimento são os seus olhos, mas para o arquivo aquela página contém uma fotografia e nada mais. Selecionar não faz nada, buscar não encontra nada e extrair não devolve nada: não porque a ferramenta falhou, mas porque ali não há nada para devolver.
Transformar a imagem de palavras de volta em palavras é outro trabalho, chamado OCR, e é um problema de reconhecimento e não de leitura: o software adivinha cada forma e às vezes erra. Aqui não fazemos isso. O que fazemos é verificar cada página e dizer em qual categoria ela cai, antes de você baixar qualquer coisa. Uma ferramenta que te entrega um arquivo vazio, ou que troca para OCR em silêncio sem avisar, tira de você a chance de saber que tipo de documento tinha em mãos.
Essa verificação não é um palpite. Uma página com camada de texto devolve seus caracteres; uma sem ela não devolve nenhum. Não existe meio-termo em que dê para errar. Por isso o resultado aparece acima do texto, e não enterrado num aviso mais abaixo.
Como extrair o texto de um PDF
Nada para instalar e nada é enviado. Solte o arquivo, veja o que encontramos e leve o texto do jeito que você precisa.
Solte seu PDF
Escolha um arquivo ou arraste até a caixa. Quem lê é o seu próprio navegador: ele não é enviado a lugar nenhum, e não há limite de páginas ou tamanho além do que o seu dispositivo aguenta.
Leia o resumo primeiro
Antes de qualquer texto aparecer, você já sabe quantas páginas têm camada de texto, quais são digitalizadas, se o documento tem campos de formulário preenchidos e se um layout de duas colunas foi detectado e reordenado.
Ajuste a leitura, se precisar
Por padrão o texto segue a página como você a vê e as linhas soltas voltam a formar parágrafos. Os dois podem ser trocados: a ordem do documento preserva a sequência guardada no PDF, e manter cada linha como está preserva as quebras originais.
Copie ou salve
Copiar coloca o texto direto na área de transferência, que é o que a maioria quer ao colar num documento ou num assistente de IA. Baixar grava o mesmo conteúdo num arquivo .txt em UTF-8.
Relacionado: Se você só precisa do texto de algumas páginas, é mais rápido extrair essas páginas antes.
O que este conversor de PDF para texto faz de diferente
O jeito ingênuo de extrair é pegar a lista de pedaços que o pdf.js devolve e emendar tudo. É uma linha de código e produz algo que quase parece certo, e é por isso que tantas ferramentas fazem assim. Num formulário fiscal de duas páginas, essa abordagem cola palavras em setenta e seis quebras de linha. Em oito páginas de um artigo científico, duzentas e noventa e três. Saem coisas como «permission toreproduce» e «neural networksin particular», espalhadas pelo documento onde você não necessariamente vai notar antes de usar o texto.
O problema mais profundo é a ordem. Um PDF guarda o texto na ordem em que ele é pintado na página, que não é a ordem em que você lê. Num formulário, um campo de data pode sair como «MM DD YYYY/ /» porque os separadores são desenhados por último. Numa página de duas colunas, as duas colunas se intercalam linha a linha, que é exatamente o que acontece quando você seleciona uma página inteira num leitor de PDF e cola em outro lugar. Nós reconstruímos a ordem de leitura a partir de onde os caracteres realmente estão, o que devolve «MM / DD / YYYY» e mantém cada coluna inteira.
E há o que é fácil perder por completo. Se você preencheu um formulário PDF, nenhuma das suas respostas está no texto da página: elas ficam nos campos de formulário, e um extrator que só lê a página te entrega um modelo em branco com toda a cara de ter funcionado. Nós recolhemos essas respostas e as acrescentamos no fim. Além disso, alguns geradores de PDF emitem caracteres que parecem certos e não são: um documento em chinês pode sair cheio de radicais Kangxi, indistinguíveis na tela, invisíveis para uma busca e errados quando colados. Toda string que entregamos é normalizada para voltar aos caracteres que representa.
Para que as pessoas usam:
- Buscar de verdade dentro de um relatório longo, ou pular entre as seções
- Colar um documento num assistente de IA sem a mobília de página
- Citar um artigo sem arrastar a formatação junto
- Recuperar as respostas de um formulário que alguém preencheu e devolveu
- Arquivar um documento como texto puro que abre em qualquer lugar
- Ler um layout de várias colunas no celular, em uma coluna só
Funciona onde você já está
O trabalho acontece dentro do navegador, então não há nada para instalar nem conta para criar. Qualquer navegador atual, em qualquer sistema, serve.
Windows
Chrome, Edge ou Firefox. Sem leitor, sem assinatura do Acrobat, sem nada para baixar.
macOS
Safari, Chrome ou Firefox. Mais rápido do que abrir o arquivo no Visualização e selecionar página por página.
Linux
Qualquer navegador moderno. O mesmo resultado do comando pdftotext, sem sair da página.
iPhone e iPad
Safari ou Chrome. Útil quando um PDF chega por e-mail e você precisa do texto numa mensagem.
Android
Chrome, Firefox ou Samsung Internet. Prático para ler um documento de duas colunas em uma só.
Chromebook
Funciona totalmente offline depois que a página carrega, o que combina com um aparelho escolar gerenciado.
Por que copiar texto de um PDF quase sempre sai errado
Se você já selecionou uma página num leitor de PDF, colou e encontrou as frases embaralhadas, o motivo é este — e é o mesmo motivo pelo qual a maioria das ferramentas de conversão produz a mesma bagunça.
O que o PDF guarda
A ordem em que a página é pintada. O texto é colocado na sequência que convinha ao programa que produziu o arquivo: um título, depois um rodapé, depois o corpo, depois os separadores que caem entre os campos. Copiar segue essa sequência, então numa página de duas colunas você recebe uma linha da coluna da esquerda, uma da direita, e assim até o fim.
O que nós reconstruímos
A ordem em que você leria. Os caracteres são agrupados em linhas conforme a posição, as linhas em colunas, e as colunas são lidas uma após a outra. As quebras voltam, as colunas ficam inteiras e os separadores retornam ao meio dos campos a que pertencem.
Onde ainda há limites
A imagem de uma página não pode ser lida de jeito nenhum, e uma tabela deixa de ser tabela assim que vira texto puro: as linhas sobrevivem, a grade não. Uma linha que atravessa as duas colunas sem que nenhuma parte cruze o vão central, como uma fileira de nomes de autores, é indistinguível de uma linha de cada coluna, então um bloco de título pode sair numa ordem estranha. A própria comunidade da Adobe diz o mesmo sobre o Acrobat: com barras laterais e texto inserido, é «quase impossível» saber qual linha seguir. Quando a nossa leitura parecer errada, troque para a ordem do documento e compare.
Texto ou Word?
Texto puro é a resposta certa quando você quer as palavras e mais nada: buscar, citar, colar num assistente, arquivar. É a resposta errada quando você precisa do documento de volta como documento, com títulos, tabelas e imagens; isso é trabalho de uma conversão de PDF para Word, e nenhum .txt vai dar conta. Vale saber por qual das duas você veio antes de julgar o resultado.
Seu documento fica no seu dispositivo
Os arquivos que as pessoas levam a uma ferramenta assim raramente são banais. São contratos, notas fiscais, currículos, laudos médicos, formulários preenchidos: documentos em que a parte sensível é todo o conteúdo. Vale pensar nisso antes de enviar um deles para qualquer lugar.
Esta ferramenta não envia nada. Seu navegador abre o PDF, lê e monta o texto na sua própria máquina. Não há requisição carregando seu arquivo, nem fila em servidor, nem cache em lugar nenhum, nem cópia que alguém precise apagar depois. Feche a aba e acabou.
Isso também quer dizer que os limites de sempre não se aplicam. Sem teto de páginas, sem teto de tamanho, sem cota diária, porque não há conta de servidor por trás: só o que o seu próprio dispositivo aguenta com folga.
Sem envio
O PDF é lido onde já está. Ele nunca viaja.
Sem conta
Sem cadastro, sem e-mail, sem marca d'água no resultado.
Nada guardado
Do nosso lado não existe cópia para armazenar, registrar ou apagar.
Perguntas sobre extrair texto de PDF
Por que o texto extraído veio vazio?⌄
O que é uma camada de texto?⌄
Vocês fazem OCR em PDFs digitalizados?⌄
Por que copiar e colar de um PDF sai embaralhado?⌄
Por que a ordem ainda está errada no meu documento de duas colunas?⌄
Preenchi um formulário PDF — por que meu texto sumiu?⌄
As tabelas mantêm o layout?⌄
Devo converter para texto ou para Word?⌄
Meus arquivos são enviados?⌄
Existe limite de tamanho de arquivo?⌄
Funciona com PDFs em chinês, japonês, coreano ou árabe?⌄
Qual é a codificação do arquivo .txt?⌄
Tire o texto do seu PDF
Grátis, sem limites e processado inteiramente no seu navegador — com uma resposta honesta sobre o que existe de fato no seu arquivo.
Extrair texto de um PDFArtigos relacionados
Aprofunde seu conhecimento sobre a conversão de PDF para PNG com nossos guias e análises mais recentes
Como converter PDF para PNG online (métodos gratuitos e rápidos)
Guia completo para converter PDF para PNG online de graça. Compare os 5 melhores conversores, aprenda os processos passo a passo, dicas avançadas e solução de problemas.
Ler artigoComo transformar PDF em PNG no Windows, Mac e celular
Guia específico por plataforma para converter PDFs em PNG em qualquer dispositivo. Ferramentas nativas, recomendações de programas e apps móveis abordados.
Ler artigoPDF para PNG vs PDF para JPG: qual formato escolher?
Comparação detalhada dos formatos PNG e JPG para a conversão de PDF. Tamanhos de arquivo, diferenças de qualidade, casos de uso e guia de decisão.
Ler artigoFerramentas de conversão relacionadas
Explore mais ferramentas da nossa suíte completa de conversão de arquivos
Extrair páginas de PDF
Tire as páginas que precisa para um novo PDF, ou um arquivo por página. Seu original fica intacto. Sem envio.
Achatar PDF
Funde os campos de formulário preenchidos e os comentários na página. O texto continua texto, e o que não dá para fundir é avisado em vez de apagado.
Desbloquear um PDF
Remova uma senha que você já tem, ou tire os limites de impressão e cópia que não exigem senha nenhuma. Nada é enviado.