PDF OCR
把扫描件 PDF 变成能搜索的 PDF。全程在这个标签页里完成,不用账号,不上传,也没有页数限制。
把扫描件 PDF 拖到这里,或点击选择
最大 100 MB · 不会上传任何东西
- 100% 在你的浏览器里
- 不上传
- 下载不用注册
- 不限页数
扫描件 PDF 为什么需要 OCR
扫描件 PDF 就是一叠照片。你的眼睛读起来毫无障碍,但在计算机看来,那些页面上只有一堆彩色的点。Ctrl+F 什么也找不到,一行字也复制不出来。没有任何东西会索引它,所以以后搜什么都不会再翻出这份文件。
OCR —— 光学字符识别 —— 就是改变这件事的那一步。它看每一页上的形状,判断那是哪些字母,再把这些字母作为一层看不见的文字写进文件,压在图像下面。做完 OCR,PDF 看起来一模一样;区别是底下多了文字。
真正要紧的那一刻通常在几个月之后。你扫描过的一份合同、一张发票、一张收据、书里的某一页 —— 你只记得其中一句话,别的都忘了。可搜索的 PDF 能把那句话还给你,一叠照片不能。
这个 PDF OCR 工具完全在你的浏览器里运行。文件不上传,没有账号,也不限制页数。在这个关键词上排在我们前面的那个页面,免费把你的文件处理完,然后要求你登录才肯把它还给你。
PDF 上的 OCR 到底是什么?
PDF 上的 OCR,是对文件里的页面图像做字符识别,再把识别出的词作为一层看不见的文本层写回同一个文件 —— 文档看上去毫无变化,却变得可以搜索、可以选中、可以复制。
有两种 PDF 在屏幕上长得一模一样。一种是从文字处理软件导出的,带着真正的文字;另一种来自扫描仪或手机摄像头,带的是文字的图片。只有后者需要 OCR。
不用任何工具也能快速分辨:用鼠标试着选中一行。如果有蓝色高亮跟着字走,说明文字本来就在。如果整页被当成一整块选中,或者什么都没发生,那就是扫描件 PDF。
这个工具会在动手之前替你做这项检查。如果文件已经有文本层,它会直说,并建议你改为提取文字 —— 因为 OCR 会用近似的东西替换掉准确的东西,而事后你没有任何办法察觉,毕竟页面两种情况看起来都一样。
OCR 产生的文字放在页面图像下面,不是上面。所以可搜索的 PDF 看上去仍然是个扫描件:你看到的始终是原来那张图。那层看不见的文字只为你的搜索框、你的复制命令,以及任何会索引这个文件的东西而存在。
值得把这一层说清楚:它是猜出来的。在清晰的印刷体上猜得很准,在一张揉皱了、还拍歪了的收据上猜得很差。你看到的图像永远是对的,底下的文字未必。
四步给 PDF 做 OCR
一切都在这个浏览器标签页里完成。文件不会离开你的设备,也没人会在你下载结果之前要求你注册账号。
把扫描件 PDF 放进来
把文件拖到上面的方框里,或者点一下去选。100 MB 以内都没问题。什么都不会被送到别处 —— 文件是由这个页面在你的浏览器里打开的。
看它给出的判断
工具会在做任何事之前逐页检查有没有文本层,然后告诉你:这份 PDF 需不需要 OCR、是只有部分页需要、还是根本不需要。如果只有几页是扫描件,其余各页默认原样不动。
选文档的语言
准确率取决于这一项,比你能调的任何其他设置都更关键。选文档本身书写的语言,不是这个界面的语言。语言数据只下载一次 —— 英语约 5.2 MB,印地语约 1.7 MB —— 之后会缓存。可以同时选多种语言,但每一页都会因此变慢。
运行并检查结果
页面逐张处理,并显示当前正在识别那一页的预览,所以万一放错了文件,你可以早点停下。结束后,在预览里试着选中一段文字。然后下载可搜索的 PDF —— 或者只下载纯文本,如果你要的只是文字。
只想要文字? 如果你要的是文字而不是 PDF,而且你的文件本来就有文本层,那有一条更快、而且完全不用猜的路: 直接从 PDF 里提取文字.
这个 PDF OCR 工具做什么
它只加一层文字,别的什么都不改。你的原始页面保持原样 —— 同样的图像、同样的分辨率、同样的页面框。识别出的词以零不透明度画在上面,能选中、能搜索,但永远看不见。本来就有文字的页面,一个字节都不会被改写。
它按 150 DPI 渲染页面,这是量出来的结果,不是默认值。在一份测试文档上,100、150、200、300 DPI 的准确率相差不到半个百分点,而 300 DPI 要多花四倍时间。低于 100 DPI 则有一道悬崖:72 DPI 时准确率从 95.6% 跌到 79.3%。用 600 DPI 扫描不会让 OCR 更准,只会更慢。
它支持 100 多种语言,包括大多数转换器跳过的那些文字。一家颇有名气的在线 OCR 工具写明支持 19 种语言,其中没有一种是南亚文字。这里印地语、泰米尔语、孟加拉语都在列表里,而且靠前 —— 因为搜这个词的人大多就在那里。
它会把做不到的部分数出来。如果某一页返回的是空的 —— 空白纸、照片、手写内容 —— 这一页会原样留在文件里,并被报出来。没有任何东西被悄悄丢掉。
它从不要求你注册。你可以跑一份 400 页的文档,然后接着再跑一份。没有每日额度,因为没有服务器在干这个活,也就没有什么需要配给。
人们用 PDF OCR 来做这些事:
- 把扫描的合同变成可搜索的,再归档
- 在一页页拍下来的书籍章节里找到某一行
- 把一整个文件夹的扫描发票变成能检索的东西
- 从以 PDF 形式收到的传真或复印件里取出文字
- 让旧的扫描档案靠搜索而不是靠记忆被找到
- 把扫描件处理成搜索索引或别的程序能读的样子
- 从扫描件里复制一段话,而不是重新打一遍
什么设备都能用
没有任何东西需要安装。OCR 跑在你本来就有的浏览器里,所以同一个工具到哪儿都能用,而你的文件始终留在它出发的那台设备上。
Windows
Chrome、Edge 或 Firefox。不用下载任何东西,也不需要 Acrobat 订阅就能把扫描件变成可搜索的。
Mac
Safari 或 Chrome。「预览」能把扫描件 PDF 显示给你看,但没法给它加上一层文字。
iPhone 和 iPad
在 Safari 里可用。扫描件是刚拍的照片时特别方便 —— 不过那也正是「把页面放正」最要紧的场合。
Android
在 Chrome 里可用。长文档要花些时间,而且会一直占着手机,所以先插上电源。
Chromebook
很合适,因为一切都在浏览器里本地运行,不需要装任何应用程序。
Linux
任何现代浏览器都行。不用装包,不用命令行,也不用排队。
OCR 能做对什么,又会错在哪里
所有 OCR 工具都会出错,而几乎没有哪一家会告诉你这些错误长什么样。这是一次真实的结果:一份干净的、由计算机生成的发票,没有噪点,没有倾斜,整体逐字准确率 95.6%。从里面抽出的十二个词,有五个能靠搜索找到。
| 文档里是 | OCR 读成 | 为什么 |
|---|---|---|
| Northwind | Northwind | 比例字体里的普通正文,是最容易的情况。 |
| 2089.80 | 2089. 80 | 数字中间冒出一个空格,于是搜金额什么也搜不到。 |
| INV-2026-04471 | INV2026-04471 | 掉了一个连字符。编号这类字符串格外脆弱。 |
| Replacement | Repl acenent | m 被读成了 n,还多出一个本不存在的空格。 |
| Payment is | Paymentis | 反过来的错误:一个真实存在的空格被抹掉了。 |
| 1741.50 | 1741.50 | 同一张表、同一种字体、和上面那个金额同样的格式 —— 这个却是对的。错误并不可预测。 |
真正毁掉一份扫描件的是什么
不是压缩,也不是分辨率。质量 60 的 JPEG 与无损渲染的差距不到一个百分点的零头。真正造成伤害的是倾斜:歪两度没什么影响,歪到七度,准确率掉了九个半百分点,置信度从 91 降到 74。如果你要扫描什么东西,先把它放正。把 DPI 调高不值得。
可搜索的 PDF、纯文本,还是 Word 文件?
可搜索的 PDF 就是这个页面做出来的东西:你原来那份扫描件,加上一层看不见的文字,仍然是 PDF。纯文本是抛掉排版之后的文字 —— 想粘到别处时好用,这里作为第二个下载项提供。可编辑的 Word 文档是另一件事,要重建排版,这个工具不做。如果你的 PDF 本来就有文字、而你只想要那些字,那就别做 OCR,直接提取。
你的扫描件不会离开这个浏览器
你放进来的 PDF,由这个页面打开、由你自己的处理器读取、再由你自己的浏览器写回去。它不会被上传,不会在服务器上排队,也不会在任何地方被保留一段时间 —— 因为这件事里压根没有服务器参与。
这一点在 OCR 上比在大多数转换上更重要。人们需要变成可搜索的,往往是合同、病历、银行流水和身份证件 —— 正是因为原件值得留着,才会有这些扫描件。所有大型在线 OCR 服务都在自己的机器上处理它们,然后按计划删除,通常是一到八小时之后。
这也意味着没有什么需要配给。在自己硬件上干活的服务必须限制免费用量,所以它们会把你卡在每天两次任务或每个文件十页。这里活是在你的设备上干的,所以既没有限额要执行,也没有注册信息要收集。
什么都不上传
文件在本地读取,任何服务器上都不会产生它的副本。
永远不要账号
下载结果不需要注册 —— 而在别处,这恰恰是免费 OCR 的通常代价。
不限页数、不限文件数
跑完一份 400 页的扫描件,接着再跑一份。没有每日配额。
只下载语言数据
唯一会下载的是你所选语言的识别数据。你的文档从不参与这个请求。