OCR PDF

Transforme um PDF digitalizado em um PDF onde dá para pesquisar. Tudo nesta aba, sem conta, sem enviar nada e sem limite de páginas.

Por que um PDF digitalizado precisa de OCR

Um PDF digitalizado é uma pilha de fotografias. Seus olhos leem numa boa, mas para o computador naquelas páginas só existem pontos coloridos. Ctrl+F não acha nada. Não dá para copiar uma linha. Nada indexa o arquivo, então ele não vai reaparecer em busca nenhuma depois.

O OCR — reconhecimento óptico de caracteres — é o passo que muda isso. Ele olha as formas de cada página, decide que letras são aquelas e grava essas letras no arquivo como uma camada invisível por baixo da imagem. Depois do OCR o PDF fica exatamente igual; a diferença é que agora tem texto embaixo.

O momento que importa costuma chegar meses depois. Um contrato que você digitalizou, uma fatura, um recibo, a página de um livro — você lembra de uma frase e de mais nada. Um PDF pesquisável devolve essa frase. Uma pilha de fotografias não.

Esta ferramenta de OCR para PDF roda inteiramente no seu navegador. O arquivo não é enviado, não há conta e não há teto de páginas. A página que está acima da nossa nesse termo processa seu arquivo de graça e aí pede cadastro antes de devolver.

Com uploadServidor deles?Esta ferramentaSeu aparelhoNada sai do seu aparelho, nenhuma cópia para apagar.
Outros conversores enviam seu arquivo para um servidor. Este desenha ele onde ele já está.

O que é OCR num PDF?

OCR num PDF é reconhecimento de caracteres aplicado às imagens de página que ele contém, com as palavras reconhecidas gravadas de volta no mesmo arquivo como uma camada de texto invisível — o documento continua igual aos olhos, mas passa a ser pesquisável, selecionável e copiável.

Dois tipos de PDF ficam idênticos na tela. Um saiu de um editor de texto e carrega texto de verdade; o outro veio de um scanner ou da câmera do celular e carrega imagens de texto. Só o segundo precisa de OCR.

Dá para distinguir rápido sem ferramenta nenhuma: tente selecionar uma linha com o mouse. Se um realce azul acompanhar as palavras, o texto já está ali. Se a página inteira for realçada como um bloco, ou se não acontecer nada, você tem um PDF digitalizado.

Esta ferramenta faz essa verificação para você antes de rodar qualquer coisa. Se o arquivo já tem camada de texto, ela avisa e sugere extrair o texto em vez disso, porque o OCR trocaria algo exato por algo aproximado — e depois você não teria como perceber, já que a página fica igual de um jeito ou de outro.

O texto que o OCR produz vai embaixo da imagem da página, não em cima. É por isso que um PDF pesquisável continua com cara de digitalização: você está sempre olhando a imagem original. A camada invisível existe só para a sua caixa de busca, o seu comando de copiar e para o que quer que indexe o arquivo.

Vale dizer com clareza o que é essa camada. É um chute — um chute muito bom em impressão limpa, um chute ruim num recibo amassado fotografado torto. A imagem que você vê está sempre certa. O texto embaixo dela pode não estar.

Só imagemInvoiceNo. 4471Total1,240.00+ camada texto
O OCR não muda a aparência da página. Ele põe uma camada de texto embaixo da imagem, e é isso que deixa o PDF pesquisável.

Como fazer OCR num PDF em quatro passos

Tudo acontece nesta aba do navegador. O arquivo não sai do seu aparelho, e ninguém vai pedir cadastro antes de deixar você baixar o resultado.

Lorem ipsumdolor sit ametconsecteturTem textoSem OCRLorem ipsumAlgumas simPular essasSó imagemRodar OCR
Nem todo PDF precisa de OCR. Esta ferramenta confere antes de rodar qualquer coisa, porque reler um texto que já está exato só piora.
1

Solte seu PDF digitalizado

Arraste o arquivo até a caixa acima, ou clique para procurar. Arquivos de até 100 MB estão de bom tamanho. Nada é mandado para lugar nenhum: quem abre o arquivo é esta página, no seu navegador.

2

Leia o diagnóstico

A ferramenta confere cada página em busca de camada de texto antes de trabalhar. Ela diz se o seu PDF precisa de OCR, se precisa só em algumas páginas, ou se não precisa. Se só algumas páginas forem digitalizações, o resto fica intacto por padrão.

3

Escolha o idioma do documento

A precisão depende disso mais do que de qualquer outra coisa que você possa ajustar. Escolha o idioma em que o documento está escrito, não o idioma desta interface. Os dados de idioma são baixados uma vez só — cerca de 5,2 MB para inglês, 1,7 MB para híndi — e depois ficam em cache. Selecionar vários idiomas funciona, mas deixa cada página mais lenta.

4

Rode e confira

As páginas são processadas uma de cada vez, com uma prévia da que está sendo lida, então dá para parar cedo se você soltou o arquivo errado. No fim, tente selecionar um texto na prévia. Depois baixe o PDF pesquisável — ou o texto simples, se era só isso que você queria.

Quer só as palavras? Se você quer o texto e não o PDF, e seu arquivo já tem camada de texto, existe um caminho mais rápido em que nada é chutado: extrair o texto direto do PDF.

O que esta ferramenta de OCR para PDF faz

Ela acrescenta uma camada de texto e não mexe em mais nada. Suas páginas originais ficam exatamente como estão — mesmas imagens, mesma resolução, mesmas molduras de página. As palavras reconhecidas são desenhadas por cima com opacidade zero, então dá para selecionar e pesquisar, mas nunca aparecem. Páginas que já tinham texto não são reescritas de jeito nenhum.

Ela renderiza as páginas a 150 DPI, e essa é uma decisão medida, não um valor padrão. Num documento de teste, a precisão a 100, 150, 200 e 300 DPI ficou igual dentro de meio ponto percentual, enquanto 300 DPI demorava quatro vezes mais. Abaixo de 100 DPI tem um precipício: a 72 DPI a precisão caiu de 95,6% para 79,3%. Digitalizar a 600 DPI não vai deixar o OCR mais preciso. Só mais lento.

Ela dá conta de mais de 100 idiomas, incluindo escritas que a maioria dos conversores pula. Uma das ferramentas de OCR online mais conhecidas lista 19 idiomas e nenhum deles é uma escrita do sul da Ásia. Híndi, tâmil e bengali estão aqui na lista, e lá em cima, porque é aí que está de fato a maioria de quem procura isso.

Ela conta o que não conseguiu fazer. Se uma página volta sem texto — folha em branco, fotografia, escrita à mão —, ela fica intacta no arquivo e é reportada. Nada é descartado em silêncio.

Ela nunca pede cadastro. Você pode processar um documento de 400 páginas e depois outro. Não há limite diário, porque nenhum servidor faz o trabalho e, portanto, não há o que racionar.

Para que as pessoas usam OCR em PDF:

  • Deixar contratos digitalizados pesquisáveis antes de arquivar
  • Achar uma linha num capítulo de livro fotografado página a página
  • Transformar uma pasta de notas fiscais digitalizadas em algo rastreável
  • Tirar o texto de um fax ou de uma cópia que chegou em PDF
  • Fazer registros digitalizados antigos serem achados por busca e não por memória
  • Preparar digitalizações para que um índice de busca ou outra ferramenta consiga ler
  • Copiar um parágrafo de uma digitalização em vez de redigitar

Funciona em qualquer aparelho

Não há nada para instalar. O OCR roda no navegador que você já tem, então a mesma ferramenta funciona em todo lugar e seu arquivo fica no aparelho em que começou.

§ 01

Windows

Chrome, Edge ou Firefox. Nada para baixar e nenhuma assinatura do Acrobat para deixar uma digitalização pesquisável.

§ 02

Mac

Safari ou Chrome. A Pré-Visualização mostra um PDF digitalizado, mas não sabe acrescentar uma camada de texto nele.

§ 03

iPhone e iPad

Funciona no Safari. Útil quando a digitalização é uma foto que você acabou de tirar — embora esse seja justamente o caso em que endireitar a página importa mais.

§ 04

Android

Funciona no Chrome. Documentos longos demoram e mantêm o celular ocupado, então coloque na tomada antes.

§ 05

Chromebook

Cai bem, porque tudo roda localmente no navegador em vez de precisar de um aplicativo instalado.

§ 06

Linux

Qualquer navegador moderno. Sem pacotes, sem linha de comando e sem fila.

O que o OCR acerta e o que ele erra

Toda ferramenta de OCR erra, e quase nenhuma conta como são esses erros. Aqui vai um resultado real: uma fatura limpa, gerada por computador, sem ruído, sem inclinação, com 95,6% de precisão por caractere no total. De doze palavras tiradas dela, cinco dava para achar pesquisando.

No arquivoO OCR leuNorthwindNorthwindSubtotalSubtotal1741.501741.502089.802089. 80INV-2026INV2026ReplacementRepl acenentPayment isPaymentis5 de 12 palavras pesquisáveis
De uma fatura de teste limpa, com 95,6% de precisão por caractere. O nome da empresa passou; o total não, porque o OCR enfiou um espaço no meio do número.
No documentoO OCR leuPor quê
NorthwindNorthwindTexto corrido numa fonte proporcional é o caso fácil.
2089.802089. 80Apareceu um espaço dentro do número, então pesquisar o total não acha nada.
INV-2026-04471INV2026-04471Um hífen sumiu. Números de referência são especialmente frágeis.
ReplacementRepl acenentUm m lido como n, mais um espaço que não existia ali.
Payment isPaymentisO erro contrário: um espaço de verdade foi removido.
1741.501741.50Mesma tabela, mesma fonte do total acima — e esse saiu certo. Os erros não são previsíveis.

O que estraga mesmo uma digitalização

Não é a compressão nem a resolução. Um JPEG em qualidade 60 ficou a uma fração de ponto de um render sem perdas. O que doeu foi a inclinação: uma página torta em dois graus não deu problema, mas a sete graus a precisão caiu nove pontos e meio e a confiança foi de 91 para 74. Se você vai digitalizar alguma coisa, ponha reto. Não adianta subir o DPI.

PDF pesquisável, texto simples ou um arquivo do Word?

Um PDF pesquisável é o que esta página faz: a digitalização que você tinha, mais uma camada de texto invisível, e continua sendo um PDF. Texto simples são as palavras sem a diagramação — útil quando você quer colar em outro lugar, e oferecido aqui como segundo download. Um documento do Word editável é outro trabalho, que envolve reconstruir a diagramação, e esta ferramenta não faz isso. Se o seu PDF já tem texto e você só quer as palavras, pule o OCR e extraia direto.

Sua digitalização não sai deste navegador

O PDF que você solta aqui é aberto por esta página, lido pelo seu próprio processador e gravado de volta pelo seu próprio navegador. Ele não é enviado, não entra em fila em servidor nenhum e não fica guardado em lugar algum por um prazo de retenção, porque não há servidor nenhum envolvido no trabalho.

Isso pesa mais no OCR do que na maioria das conversões. Os documentos que as pessoas precisam deixar pesquisáveis são contratos, prontuários, extratos bancários e documentos de identidade — exatamente as digitalizações que existem porque o original valia a pena guardar. Todo serviço grande de OCR online processa isso nas máquinas dele e apaga conforme um cronograma, normalmente de uma a oito horas depois.

Também quer dizer que não há o que racionar. Serviços que fazem o trabalho no próprio hardware precisam limitar o uso gratuito, e é por isso que te travam em duas tarefas por dia ou dez páginas por arquivo. Aqui o trabalho acontece no seu aparelho, então não há limite a impor nem cadastro a recolher.

§ 01

Nada é enviado

O arquivo é lido localmente. Nenhuma cópia dele é criada em servidor algum.

§ 02

Nunca uma conta

Ninguém pede cadastro para você baixar o resultado, que é o preço de sempre do OCR gratuito em outros lugares.

§ 03

Sem limite de páginas ou arquivos

Processe uma digitalização de 400 páginas e depois outra. Não há cota diária.

§ 04

Só dados de idioma

A única coisa baixada são os dados de reconhecimento do idioma que você escolher. Seu documento nunca faz parte dessa requisição.

Perguntas frequentes

Esta ferramenta de OCR para PDF é mesmo grátis e tem limite de páginas?
É grátis, sem limite de páginas e sem cota diária. O OCR roda no seu próprio aparelho em vez de num servidor, então não há custo por arquivo do nosso lado e não há o que racionar. Documentos grandes esbarram só na sua paciência e na sua bateria.
Preciso me cadastrar para baixar o resultado?
Não. Você pode soltar um arquivo, rodar o OCR e baixar o PDF pesquisável sem conta e sem e-mail. Vale conferir isso em qualquer site de OCR antes de enviar alguma coisa: é comum pedirem cadastro só na hora do download, depois que o trabalho já foi feito.
Como sei se meu PDF precisa mesmo de OCR?
Tente selecionar uma linha de texto com o mouse. Se o realce acompanhar as palavras, o arquivo já tem camada de texto e o OCR só pioraria. Esta ferramenta confere automaticamente quando você adiciona um arquivo e diz em qual dos três casos você está antes de rodar qualquer coisa.
Qual é a precisão do OCR?
Precisa o bastante para ser útil e não o bastante para confiar de olhos fechados. Numa fatura de teste limpa, gerada por computador, a precisão por caractere deu 95,6% — mas só 5 de 12 palavras tiradas dela dava para achar pesquisando, porque um espaço caiu no meio de um número ou um hífen sumiu. Impressão nítida vai bem. Tudo que está amassado, apagado ou torto vai pior.
Quais idiomas são aceitos?
Mais de 100, incluindo híndi, tâmil, bengali, tailandês, vietnamita e indonésio ao lado dos idiomas europeus de sempre. Escolha o idioma em que o documento está escrito, não o idioma desta página: isso afeta a precisão mais do que qualquer outro ajuste. Vale notar que escritas que remodelam seus caracteres, como a devanágari, podem perder uma palavra ou outra na hora de gravar na camada de texto do PDF, mesmo tendo sido reconhecidas certo.
Ele lê escrita à mão?
Parta do princípio que não. Este motor foi feito para caracteres impressos, e escrita à mão é outro problema, para o qual ele não foi treinado. Uma página manuscrita costuma voltar vazia ou quase. Se isso acontecer, a página fica no seu arquivo exatamente como estava e é reportada no resumo, em vez de ser descartada em silêncio.
O PDF vai ficar diferente depois?
Não, e é esse o ponto. As imagens das suas páginas ficam exatamente como estavam e o texto reconhecido é desenhado por cima com opacidade zero. Você continua olhando a digitalização original; a camada de texto existe só para a sua caixa de busca e o seu comando de copiar.
Digitalizar com DPI maior melhora o resultado do OCR?
Em geral não. Nos testes, a precisão a 100, 150, 200 e 300 DPI ficou idêntica dentro de meio ponto percentual, enquanto 300 DPI demorava quatro vezes mais. Existe um piso — a 72 DPI a precisão desabou para 79,3% —, mas acima de uns 150 DPI você está pagando tempo por nada. Endireitar a página ajuda muito mais.
Quanto tempo leva?
Cerca de um segundo por página num notebook comum, numa página A4 padrão, então um documento de 50 páginas fica perto de um minuto. Celulares são mais lentos. Selecionar vários idiomas multiplica o trabalho, então escolha só os que estão de fato no documento.
Meu arquivo é enviado para algum lugar?
Não. O PDF é aberto e processado dentro desta aba e nunca é mandado para um servidor. A única requisição de rede que a ferramenta faz é pelos dados de reconhecimento do idioma que você escolheu, que são o mesmo arquivo para todo mundo e não têm nada seu.
Qual a diferença entre isto e «PDF para texto»?
Esta página fabrica um PDF pesquisável a partir de uma digitalização, chutando os caracteres que estão nas imagens. «PDF para texto» puxa o texto que já está no arquivo, exato, sem chute nenhum. Se o seu PDF tem camada de texto, essa é a ferramenta que você quer: é mais rápida e não consegue cometer o tipo de erro que o OCR comete.
Dá para receber um documento do Word editável?
Desta ferramenta não. Virar uma digitalização em arquivo do Word significa reconstruir a diagramação — colunas, tabelas, títulos — e isso é outro trabalho, com as próprias formas de dar errado. O que você recebe aqui é o PDF original deixado pesquisável, mais um download em texto simples se quiser as palavras sozinhas.

Deixe seu PDF digitalizado pesquisável

Grátis, ilimitado e roda nesta aba. Sem envio, sem cadastro — e ele avisa se o seu arquivo não precisa de OCR.

Fazer OCR num PDF