OCR PDF
Transforme um PDF digitalizado em um PDF onde dá para pesquisar. Tudo nesta aba, sem conta, sem enviar nada e sem limite de páginas.
Solte um PDF digitalizado aqui, ou clique para escolher
Até 100 MB · nada é enviado
- 100% no seu navegador
- Sem envio
- Baixa sem cadastro
- Sem limite de páginas
Por que um PDF digitalizado precisa de OCR
Um PDF digitalizado é uma pilha de fotografias. Seus olhos leem numa boa, mas para o computador naquelas páginas só existem pontos coloridos. Ctrl+F não acha nada. Não dá para copiar uma linha. Nada indexa o arquivo, então ele não vai reaparecer em busca nenhuma depois.
O OCR — reconhecimento óptico de caracteres — é o passo que muda isso. Ele olha as formas de cada página, decide que letras são aquelas e grava essas letras no arquivo como uma camada invisível por baixo da imagem. Depois do OCR o PDF fica exatamente igual; a diferença é que agora tem texto embaixo.
O momento que importa costuma chegar meses depois. Um contrato que você digitalizou, uma fatura, um recibo, a página de um livro — você lembra de uma frase e de mais nada. Um PDF pesquisável devolve essa frase. Uma pilha de fotografias não.
Esta ferramenta de OCR para PDF roda inteiramente no seu navegador. O arquivo não é enviado, não há conta e não há teto de páginas. A página que está acima da nossa nesse termo processa seu arquivo de graça e aí pede cadastro antes de devolver.
O que é OCR num PDF?
OCR num PDF é reconhecimento de caracteres aplicado às imagens de página que ele contém, com as palavras reconhecidas gravadas de volta no mesmo arquivo como uma camada de texto invisível — o documento continua igual aos olhos, mas passa a ser pesquisável, selecionável e copiável.
Dois tipos de PDF ficam idênticos na tela. Um saiu de um editor de texto e carrega texto de verdade; o outro veio de um scanner ou da câmera do celular e carrega imagens de texto. Só o segundo precisa de OCR.
Dá para distinguir rápido sem ferramenta nenhuma: tente selecionar uma linha com o mouse. Se um realce azul acompanhar as palavras, o texto já está ali. Se a página inteira for realçada como um bloco, ou se não acontecer nada, você tem um PDF digitalizado.
Esta ferramenta faz essa verificação para você antes de rodar qualquer coisa. Se o arquivo já tem camada de texto, ela avisa e sugere extrair o texto em vez disso, porque o OCR trocaria algo exato por algo aproximado — e depois você não teria como perceber, já que a página fica igual de um jeito ou de outro.
O texto que o OCR produz vai embaixo da imagem da página, não em cima. É por isso que um PDF pesquisável continua com cara de digitalização: você está sempre olhando a imagem original. A camada invisível existe só para a sua caixa de busca, o seu comando de copiar e para o que quer que indexe o arquivo.
Vale dizer com clareza o que é essa camada. É um chute — um chute muito bom em impressão limpa, um chute ruim num recibo amassado fotografado torto. A imagem que você vê está sempre certa. O texto embaixo dela pode não estar.
Como fazer OCR num PDF em quatro passos
Tudo acontece nesta aba do navegador. O arquivo não sai do seu aparelho, e ninguém vai pedir cadastro antes de deixar você baixar o resultado.
Solte seu PDF digitalizado
Arraste o arquivo até a caixa acima, ou clique para procurar. Arquivos de até 100 MB estão de bom tamanho. Nada é mandado para lugar nenhum: quem abre o arquivo é esta página, no seu navegador.
Leia o diagnóstico
A ferramenta confere cada página em busca de camada de texto antes de trabalhar. Ela diz se o seu PDF precisa de OCR, se precisa só em algumas páginas, ou se não precisa. Se só algumas páginas forem digitalizações, o resto fica intacto por padrão.
Escolha o idioma do documento
A precisão depende disso mais do que de qualquer outra coisa que você possa ajustar. Escolha o idioma em que o documento está escrito, não o idioma desta interface. Os dados de idioma são baixados uma vez só — cerca de 5,2 MB para inglês, 1,7 MB para híndi — e depois ficam em cache. Selecionar vários idiomas funciona, mas deixa cada página mais lenta.
Rode e confira
As páginas são processadas uma de cada vez, com uma prévia da que está sendo lida, então dá para parar cedo se você soltou o arquivo errado. No fim, tente selecionar um texto na prévia. Depois baixe o PDF pesquisável — ou o texto simples, se era só isso que você queria.
Quer só as palavras? Se você quer o texto e não o PDF, e seu arquivo já tem camada de texto, existe um caminho mais rápido em que nada é chutado: extrair o texto direto do PDF.
O que esta ferramenta de OCR para PDF faz
Ela acrescenta uma camada de texto e não mexe em mais nada. Suas páginas originais ficam exatamente como estão — mesmas imagens, mesma resolução, mesmas molduras de página. As palavras reconhecidas são desenhadas por cima com opacidade zero, então dá para selecionar e pesquisar, mas nunca aparecem. Páginas que já tinham texto não são reescritas de jeito nenhum.
Ela renderiza as páginas a 150 DPI, e essa é uma decisão medida, não um valor padrão. Num documento de teste, a precisão a 100, 150, 200 e 300 DPI ficou igual dentro de meio ponto percentual, enquanto 300 DPI demorava quatro vezes mais. Abaixo de 100 DPI tem um precipício: a 72 DPI a precisão caiu de 95,6% para 79,3%. Digitalizar a 600 DPI não vai deixar o OCR mais preciso. Só mais lento.
Ela dá conta de mais de 100 idiomas, incluindo escritas que a maioria dos conversores pula. Uma das ferramentas de OCR online mais conhecidas lista 19 idiomas e nenhum deles é uma escrita do sul da Ásia. Híndi, tâmil e bengali estão aqui na lista, e lá em cima, porque é aí que está de fato a maioria de quem procura isso.
Ela conta o que não conseguiu fazer. Se uma página volta sem texto — folha em branco, fotografia, escrita à mão —, ela fica intacta no arquivo e é reportada. Nada é descartado em silêncio.
Ela nunca pede cadastro. Você pode processar um documento de 400 páginas e depois outro. Não há limite diário, porque nenhum servidor faz o trabalho e, portanto, não há o que racionar.
Para que as pessoas usam OCR em PDF:
- Deixar contratos digitalizados pesquisáveis antes de arquivar
- Achar uma linha num capítulo de livro fotografado página a página
- Transformar uma pasta de notas fiscais digitalizadas em algo rastreável
- Tirar o texto de um fax ou de uma cópia que chegou em PDF
- Fazer registros digitalizados antigos serem achados por busca e não por memória
- Preparar digitalizações para que um índice de busca ou outra ferramenta consiga ler
- Copiar um parágrafo de uma digitalização em vez de redigitar
Funciona em qualquer aparelho
Não há nada para instalar. O OCR roda no navegador que você já tem, então a mesma ferramenta funciona em todo lugar e seu arquivo fica no aparelho em que começou.
Windows
Chrome, Edge ou Firefox. Nada para baixar e nenhuma assinatura do Acrobat para deixar uma digitalização pesquisável.
Mac
Safari ou Chrome. A Pré-Visualização mostra um PDF digitalizado, mas não sabe acrescentar uma camada de texto nele.
iPhone e iPad
Funciona no Safari. Útil quando a digitalização é uma foto que você acabou de tirar — embora esse seja justamente o caso em que endireitar a página importa mais.
Android
Funciona no Chrome. Documentos longos demoram e mantêm o celular ocupado, então coloque na tomada antes.
Chromebook
Cai bem, porque tudo roda localmente no navegador em vez de precisar de um aplicativo instalado.
Linux
Qualquer navegador moderno. Sem pacotes, sem linha de comando e sem fila.
O que o OCR acerta e o que ele erra
Toda ferramenta de OCR erra, e quase nenhuma conta como são esses erros. Aqui vai um resultado real: uma fatura limpa, gerada por computador, sem ruído, sem inclinação, com 95,6% de precisão por caractere no total. De doze palavras tiradas dela, cinco dava para achar pesquisando.
| No documento | O OCR leu | Por quê |
|---|---|---|
| Northwind | Northwind | Texto corrido numa fonte proporcional é o caso fácil. |
| 2089.80 | 2089. 80 | Apareceu um espaço dentro do número, então pesquisar o total não acha nada. |
| INV-2026-04471 | INV2026-04471 | Um hífen sumiu. Números de referência são especialmente frágeis. |
| Replacement | Repl acenent | Um m lido como n, mais um espaço que não existia ali. |
| Payment is | Paymentis | O erro contrário: um espaço de verdade foi removido. |
| 1741.50 | 1741.50 | Mesma tabela, mesma fonte do total acima — e esse saiu certo. Os erros não são previsíveis. |
O que estraga mesmo uma digitalização
Não é a compressão nem a resolução. Um JPEG em qualidade 60 ficou a uma fração de ponto de um render sem perdas. O que doeu foi a inclinação: uma página torta em dois graus não deu problema, mas a sete graus a precisão caiu nove pontos e meio e a confiança foi de 91 para 74. Se você vai digitalizar alguma coisa, ponha reto. Não adianta subir o DPI.
PDF pesquisável, texto simples ou um arquivo do Word?
Um PDF pesquisável é o que esta página faz: a digitalização que você tinha, mais uma camada de texto invisível, e continua sendo um PDF. Texto simples são as palavras sem a diagramação — útil quando você quer colar em outro lugar, e oferecido aqui como segundo download. Um documento do Word editável é outro trabalho, que envolve reconstruir a diagramação, e esta ferramenta não faz isso. Se o seu PDF já tem texto e você só quer as palavras, pule o OCR e extraia direto.
Sua digitalização não sai deste navegador
O PDF que você solta aqui é aberto por esta página, lido pelo seu próprio processador e gravado de volta pelo seu próprio navegador. Ele não é enviado, não entra em fila em servidor nenhum e não fica guardado em lugar algum por um prazo de retenção, porque não há servidor nenhum envolvido no trabalho.
Isso pesa mais no OCR do que na maioria das conversões. Os documentos que as pessoas precisam deixar pesquisáveis são contratos, prontuários, extratos bancários e documentos de identidade — exatamente as digitalizações que existem porque o original valia a pena guardar. Todo serviço grande de OCR online processa isso nas máquinas dele e apaga conforme um cronograma, normalmente de uma a oito horas depois.
Também quer dizer que não há o que racionar. Serviços que fazem o trabalho no próprio hardware precisam limitar o uso gratuito, e é por isso que te travam em duas tarefas por dia ou dez páginas por arquivo. Aqui o trabalho acontece no seu aparelho, então não há limite a impor nem cadastro a recolher.
Nada é enviado
O arquivo é lido localmente. Nenhuma cópia dele é criada em servidor algum.
Nunca uma conta
Ninguém pede cadastro para você baixar o resultado, que é o preço de sempre do OCR gratuito em outros lugares.
Sem limite de páginas ou arquivos
Processe uma digitalização de 400 páginas e depois outra. Não há cota diária.
Só dados de idioma
A única coisa baixada são os dados de reconhecimento do idioma que você escolher. Seu documento nunca faz parte dessa requisição.
Perguntas frequentes
Esta ferramenta de OCR para PDF é mesmo grátis e tem limite de páginas?⌄
Preciso me cadastrar para baixar o resultado?⌄
Como sei se meu PDF precisa mesmo de OCR?⌄
Qual é a precisão do OCR?⌄
Quais idiomas são aceitos?⌄
Ele lê escrita à mão?⌄
O PDF vai ficar diferente depois?⌄
Digitalizar com DPI maior melhora o resultado do OCR?⌄
Quanto tempo leva?⌄
Meu arquivo é enviado para algum lugar?⌄
Qual a diferença entre isto e «PDF para texto»?⌄
Dá para receber um documento do Word editável?⌄
Deixe seu PDF digitalizado pesquisável
Grátis, ilimitado e roda nesta aba. Sem envio, sem cadastro — e ele avisa se o seu arquivo não precisa de OCR.
Fazer OCR num PDFFerramentas de conversão relacionadas
Explore mais ferramentas da nossa suíte completa de conversão de arquivos
PDF para texto
Extraia o texto, copie ou salve em .txt. Reconstrói a ordem de leitura, recolhe os campos de formulário preenchidos e avisa quando uma página é digitalizada.
PDF digitalizado em PNG
PNG privado e sem perdas a partir de documentos digitalizados
Comprimir PDF
Reduza o tamanho do PDF em até 80%