PDF OCR

把扫描件 PDF 变成能搜索的 PDF。全程在这个标签页里完成,不用账号,不上传,也没有页数限制。

扫描件 PDF 为什么需要 OCR

扫描件 PDF 就是一叠照片。你的眼睛读起来毫无障碍,但在计算机看来,那些页面上只有一堆彩色的点。Ctrl+F 什么也找不到,一行字也复制不出来。没有任何东西会索引它,所以以后搜什么都不会再翻出这份文件。

OCR —— 光学字符识别 —— 就是改变这件事的那一步。它看每一页上的形状,判断那是哪些字母,再把这些字母作为一层看不见的文字写进文件,压在图像下面。做完 OCR,PDF 看起来一模一样;区别是底下多了文字。

真正要紧的那一刻通常在几个月之后。你扫描过的一份合同、一张发票、一张收据、书里的某一页 —— 你只记得其中一句话,别的都忘了。可搜索的 PDF 能把那句话还给你,一叠照片不能。

这个 PDF OCR 工具完全在你的浏览器里运行。文件不上传,没有账号,也不限制页数。在这个关键词上排在我们前面的那个页面,免费把你的文件处理完,然后要求你登录才肯把它还给你。

要上传的工具他们的服务器?这个工具你的设备什么都不离开你的设备,没有副本需要删除。
别的转换器把你的文件上传到服务器。这个就在文件已经所在的地方画它。

PDF 上的 OCR 到底是什么?

PDF 上的 OCR,是对文件里的页面图像做字符识别,再把识别出的词作为一层看不见的文本层写回同一个文件 —— 文档看上去毫无变化,却变得可以搜索、可以选中、可以复制。

有两种 PDF 在屏幕上长得一模一样。一种是从文字处理软件导出的,带着真正的文字;另一种来自扫描仪或手机摄像头,带的是文字的图片。只有后者需要 OCR。

不用任何工具也能快速分辨:用鼠标试着选中一行。如果有蓝色高亮跟着字走,说明文字本来就在。如果整页被当成一整块选中,或者什么都没发生,那就是扫描件 PDF。

这个工具会在动手之前替你做这项检查。如果文件已经有文本层,它会直说,并建议你改为提取文字 —— 因为 OCR 会用近似的东西替换掉准确的东西,而事后你没有任何办法察觉,毕竟页面两种情况看起来都一样。

OCR 产生的文字放在页面图像下面,不是上面。所以可搜索的 PDF 看上去仍然是个扫描件:你看到的始终是原来那张图。那层看不见的文字只为你的搜索框、你的复制命令,以及任何会索引这个文件的东西而存在。

值得把这一层说清楚:它是猜出来的。在清晰的印刷体上猜得很准,在一张揉皱了、还拍歪了的收据上猜得很差。你看到的图像永远是对的,底下的文字未必。

只有图像InvoiceNo. 4471Total1,240.00+ 文本层
OCR 不会改变页面的样子。它在图像底下加了一层文字,正是这一层让 PDF 可以搜索。

四步给 PDF 做 OCR

一切都在这个浏览器标签页里完成。文件不会离开你的设备,也没人会在你下载结果之前要求你注册账号。

Lorem ipsumdolor sit ametconsectetur已有文字不必 OCRLorem ipsum部分有跳过那些只有图像该跑 OCR
不是每份 PDF 都需要 OCR。这个工具在动手之前先检查,因为把已经准确的文字重新猜一遍只会更差。
1

把扫描件 PDF 放进来

把文件拖到上面的方框里,或者点一下去选。100 MB 以内都没问题。什么都不会被送到别处 —— 文件是由这个页面在你的浏览器里打开的。

2

看它给出的判断

工具会在做任何事之前逐页检查有没有文本层,然后告诉你:这份 PDF 需不需要 OCR、是只有部分页需要、还是根本不需要。如果只有几页是扫描件,其余各页默认原样不动。

3

选文档的语言

准确率取决于这一项,比你能调的任何其他设置都更关键。选文档本身书写的语言,不是这个界面的语言。语言数据只下载一次 —— 英语约 5.2 MB,印地语约 1.7 MB —— 之后会缓存。可以同时选多种语言,但每一页都会因此变慢。

4

运行并检查结果

页面逐张处理,并显示当前正在识别那一页的预览,所以万一放错了文件,你可以早点停下。结束后,在预览里试着选中一段文字。然后下载可搜索的 PDF —— 或者只下载纯文本,如果你要的只是文字。

只想要文字? 如果你要的是文字而不是 PDF,而且你的文件本来就有文本层,那有一条更快、而且完全不用猜的路: 直接从 PDF 里提取文字.

这个 PDF OCR 工具做什么

它只加一层文字,别的什么都不改。你的原始页面保持原样 —— 同样的图像、同样的分辨率、同样的页面框。识别出的词以零不透明度画在上面,能选中、能搜索,但永远看不见。本来就有文字的页面,一个字节都不会被改写。

它按 150 DPI 渲染页面,这是量出来的结果,不是默认值。在一份测试文档上,100、150、200、300 DPI 的准确率相差不到半个百分点,而 300 DPI 要多花四倍时间。低于 100 DPI 则有一道悬崖:72 DPI 时准确率从 95.6% 跌到 79.3%。用 600 DPI 扫描不会让 OCR 更准,只会更慢。

它支持 100 多种语言,包括大多数转换器跳过的那些文字。一家颇有名气的在线 OCR 工具写明支持 19 种语言,其中没有一种是南亚文字。这里印地语、泰米尔语、孟加拉语都在列表里,而且靠前 —— 因为搜这个词的人大多就在那里。

它会把做不到的部分数出来。如果某一页返回的是空的 —— 空白纸、照片、手写内容 —— 这一页会原样留在文件里,并被报出来。没有任何东西被悄悄丢掉。

它从不要求你注册。你可以跑一份 400 页的文档,然后接着再跑一份。没有每日额度,因为没有服务器在干这个活,也就没有什么需要配给。

人们用 PDF OCR 来做这些事:

  • 把扫描的合同变成可搜索的,再归档
  • 在一页页拍下来的书籍章节里找到某一行
  • 把一整个文件夹的扫描发票变成能检索的东西
  • 从以 PDF 形式收到的传真或复印件里取出文字
  • 让旧的扫描档案靠搜索而不是靠记忆被找到
  • 把扫描件处理成搜索索引或别的程序能读的样子
  • 从扫描件里复制一段话,而不是重新打一遍

什么设备都能用

没有任何东西需要安装。OCR 跑在你本来就有的浏览器里,所以同一个工具到哪儿都能用,而你的文件始终留在它出发的那台设备上。

§ 01

Windows

Chrome、Edge 或 Firefox。不用下载任何东西,也不需要 Acrobat 订阅就能把扫描件变成可搜索的。

§ 02

Mac

Safari 或 Chrome。「预览」能把扫描件 PDF 显示给你看,但没法给它加上一层文字。

§ 03

iPhone 和 iPad

在 Safari 里可用。扫描件是刚拍的照片时特别方便 —— 不过那也正是「把页面放正」最要紧的场合。

§ 04

Android

在 Chrome 里可用。长文档要花些时间,而且会一直占着手机,所以先插上电源。

§ 05

Chromebook

很合适,因为一切都在浏览器里本地运行,不需要装任何应用程序。

§ 06

Linux

任何现代浏览器都行。不用装包,不用命令行,也不用排队。

OCR 能做对什么,又会错在哪里

所有 OCR 工具都会出错,而几乎没有哪一家会告诉你这些错误长什么样。这是一次真实的结果:一份干净的、由计算机生成的发票,没有噪点,没有倾斜,整体逐字准确率 95.6%。从里面抽出的十二个词,有五个能靠搜索找到。

文件里是OCR 读成NorthwindNorthwindSubtotalSubtotal1741.501741.502089.802089. 80INV-2026INV2026ReplacementRepl acenentPayment isPaymentis12 个词里 5 个搜得到
来自一份干净的测试发票,逐字准确率 95.6%。公司名过来了,金额没有 —— OCR 在数字中间塞进了一个空格。
文档里是OCR 读成为什么
NorthwindNorthwind比例字体里的普通正文,是最容易的情况。
2089.802089. 80数字中间冒出一个空格,于是搜金额什么也搜不到。
INV-2026-04471INV2026-04471掉了一个连字符。编号这类字符串格外脆弱。
ReplacementRepl acenentm 被读成了 n,还多出一个本不存在的空格。
Payment isPaymentis反过来的错误:一个真实存在的空格被抹掉了。
1741.501741.50同一张表、同一种字体、和上面那个金额同样的格式 —— 这个却是对的。错误并不可预测。

真正毁掉一份扫描件的是什么

不是压缩,也不是分辨率。质量 60 的 JPEG 与无损渲染的差距不到一个百分点的零头。真正造成伤害的是倾斜:歪两度没什么影响,歪到七度,准确率掉了九个半百分点,置信度从 91 降到 74。如果你要扫描什么东西,先把它放正。把 DPI 调高不值得。

可搜索的 PDF、纯文本,还是 Word 文件?

可搜索的 PDF 就是这个页面做出来的东西:你原来那份扫描件,加上一层看不见的文字,仍然是 PDF。纯文本是抛掉排版之后的文字 —— 想粘到别处时好用,这里作为第二个下载项提供。可编辑的 Word 文档是另一件事,要重建排版,这个工具不做。如果你的 PDF 本来就有文字、而你只想要那些字,那就别做 OCR,直接提取。

你的扫描件不会离开这个浏览器

你放进来的 PDF,由这个页面打开、由你自己的处理器读取、再由你自己的浏览器写回去。它不会被上传,不会在服务器上排队,也不会在任何地方被保留一段时间 —— 因为这件事里压根没有服务器参与。

这一点在 OCR 上比在大多数转换上更重要。人们需要变成可搜索的,往往是合同、病历、银行流水和身份证件 —— 正是因为原件值得留着,才会有这些扫描件。所有大型在线 OCR 服务都在自己的机器上处理它们,然后按计划删除,通常是一到八小时之后。

这也意味着没有什么需要配给。在自己硬件上干活的服务必须限制免费用量,所以它们会把你卡在每天两次任务或每个文件十页。这里活是在你的设备上干的,所以既没有限额要执行,也没有注册信息要收集。

§ 01

什么都不上传

文件在本地读取,任何服务器上都不会产生它的副本。

§ 02

永远不要账号

下载结果不需要注册 —— 而在别处,这恰恰是免费 OCR 的通常代价。

§ 03

不限页数、不限文件数

跑完一份 400 页的扫描件,接着再跑一份。没有每日配额。

§ 04

只下载语言数据

唯一会下载的是你所选语言的识别数据。你的文档从不参与这个请求。

常见问题

这个 PDF OCR 工具真的免费吗?有页数限制吗?
免费,不限页数,也没有每日配额。OCR 跑在你自己的设备上而不是服务器上,所以我们这边没有按文件计算的成本,也就没有什么需要配给。大文档的上限只有你的耐心和电量。
下载结果需要注册吗?
不需要。你可以放进文件、运行 OCR、下载可搜索的 PDF,全程不用账号也不用邮箱。这件事值得在任何 OCR 网站上传文件之前先确认一下:很常见的做法是等活干完了、到下载那一步才向你要账号。
我怎么知道我的 PDF 到底需不需要 OCR?
用鼠标试着选中一行文字。如果高亮跟着字走,说明文件已经有文本层,做 OCR 只会让它变差。你添加文件时这个工具会自动检查,并在动手之前告诉你属于三种情况中的哪一种。
OCR 的准确率如何?
准到够用,但不足以让你闭着眼睛信。在一份干净的、由计算机生成的测试发票上,逐字准确率是 95.6% —— 但从中抽查的 12 个词里,真正能靠搜索找到的只有 5 个,因为有的空格落进了数字中间,有的连字符不见了。清晰的印刷体表现不错,褶皱的、发虚的、歪斜的都会更差。
支持哪些语言?
100 多种,除了常见的欧洲语言,还包括印地语、泰米尔语、孟加拉语、泰语、越南语和印尼语。请选文档本身书写的语言,而不是这个页面的语言 —— 它对准确率的影响超过其他任何设置。另外要说明:像天城文这类会重塑字形的文字,即便识别正确,在写进 PDF 文本层时仍可能丢掉个别词。
能识别手写吗?
请假定不能。这个引擎是为印刷体做的,手写是另一个问题,它没有为此训练过。手写页面通常会返回空的或接近空的结果。真出现这种情况时,这一页会原样留在你的文件里,并在汇总里报出来,而不是被悄悄丢掉。
做完之后 PDF 看起来会不一样吗?
不会,这正是关键。你的页面图像保持原样,识别出的文字以零不透明度画在上面。你看到的依然是原来那份扫描件;那层文字只为你的搜索框和复制命令而存在。
扫描时 DPI 调高会让 OCR 结果更好吗?
通常不会。测试中 100、150、200、300 DPI 的准确率相差不到半个百分点,而 300 DPI 要多花四倍时间。确实有一道下限 —— 72 DPI 时准确率崩到 79.3% —— 但超过大约 150 DPI 之后,你花掉的时间换不来任何东西。把页面放正的帮助要大得多。
要花多长时间?
普通笔记本上,标准 A4 页面大约每页一秒,所以 50 页的文档大致在一分钟上下。手机会慢一些。同时选多种语言会成倍增加工作量,所以只选文档里真正出现的那几种。
我的文件会被上传到什么地方吗?
不会。PDF 在这个标签页里打开和处理,从不发送到服务器。这个工具唯一的网络请求,是去取你所选语言的识别数据 —— 那对所有人都是同一个文件,里面没有任何属于你的东西。
这个和「PDF 转文字」有什么区别?
这个页面是靠猜图像里的字符,从扫描件造出一份可搜索的 PDF。「PDF 转文字」取的是文件里本来就有的文字,准确,完全不用猜。如果你的 PDF 有文本层,那才是你要的工具:它更快,而且根本不会犯 OCR 会犯的那类错误。
能改成给我一个可编辑的 Word 文档吗?
这个工具不行。把扫描件变成 Word 文件意味着重建排版 —— 分栏、表格、标题 —— 那是另一件事,有它自己的出错方式。这里给你的是变成可搜索的原 PDF,另外如果你只想要文字,还可以下载纯文本。

让你的扫描件 PDF 可以搜索

免费、不限量,就在这个标签页里跑完。不上传、不注册 —— 而且如果你的文件根本不需要 OCR,它会告诉你。

给 PDF 做 OCR