PDF 转文字

把 PDF 里的文字提取出来,复制走或存成 .txt 文件。全程在你的浏览器里完成,文件不上传。

  • 100% 在浏览器内
  • 不上传、免注册
  • 不限页数与大小
  • 文件不离开你的设备

如果你的 PDF 是扫描件,里面根本没有可提取的文字。我们会逐页检查,在你下载任何东西之前就告诉你。

人们为什么要把 PDF 里的文字取出来

PDF 描述的是一张打印出来的页面。它知道每个字符落在哪里、多大字号、由哪个字体绘制——但它并不知道这些字符组成的是一个句子、一个标题还是一个段落。你只想读这一页时,这没什么问题;可一旦你想拿这些内容做别的事,问题就来了。

于是人们转向纯文本。有人手上是一份很长的报告,想真正搜索它,或者在章节之间跳转,而不是翻九十页;有人要把一段话引用进邮件,不想让字体、断行和看不见的格式一起被带过去;有人要把文档粘进 AI 助手,对方要的是文字,不是版面装饰;有人要归档一份合同,希望二十年后不依赖任何特定软件也能打开。

还有无障碍阅读这一类需求,比看上去更常见。多栏排版在手机上很难读,屏幕阅读器如果按错误的顺序念,两栏页面听起来就是一堆胡话。把文档剥到只剩按正确顺序排列的文字,能让它在原本排版下做不到的场景里可用。

上传型工具他们的服务器?本工具你的设备没有东西离开你的设备,所以也没有副本需要删除。
别的转换器会上传你的文档。这个就地读取它。

两类 PDF,只有一类里面真有文字

从 PDF 里提取文字,指的是读取文件内部存着的字符。这在 PDF 带「文本层」时才成立——文本层就是真正的字母,和绘制它们的指令一起存在文件里。扫描件没有文本层:它是一张页面的图片,里面一个字符也没有。

大多数由软件生成的 PDF——从文字处理软件导出的、从浏览器打印成 PDF 的、由开票系统生成的——都带文本层。判断方法很简单:打开文件,用光标去选一句话。如果高亮跟着文字走,那些字符就是真的在那里,任何工具都能读到。

扫描仪或手机相机生成的 PDF 不一样。每一页就是一张图片。你能看见那些字,是因为识别工作由你的眼睛完成了;但对文件来说,这一页装的是一张照片,别无他物。选不中文字,搜不到内容,提取也返回不了东西——不是工具失败了,而是那里本来就没有东西可返回。

把一张文字的图片重新变回文字,是另一件事,叫 OCR。它是识别问题而不是读取问题:软件对每个形状做猜测,有时会猜错。我们这里不做这件事。我们做的是逐页检查,在你下载任何东西之前告诉你它属于哪一类。一个把空文件递给你、或者不打招呼就偷偷换成 OCR 的工具,等于让你无从知道自己手上到底是哪种文档。

这项检查不是猜的。有文本层的页会报出它的字符,没有的页什么也报不出来,中间不存在可以判错的灰色地带。所以结果出现在文字上方,而不是埋在某个角落的提示里。

Invoice 2026Total 1,240.00Due 30 days真的文字只是像素
两份 PDF 在屏幕上看起来一样:一份装的是字符,另一份只是它们的图片——放大再多次,图片也变不回文字。

怎样从 PDF 里提取文字

不用安装,也不上传。把文件拖进来,看看我们发现了什么,然后按你需要的方式把文字带走。

拖入 PDF查看判定复制或保存
拖入文件,看我们发现了什么,然后复制或保存文字。
1

把 PDF 拖进来

选择文件,或直接拖到框里。它由你自己的浏览器读取——不会被发送到任何地方,除了你设备能承载的限度之外,没有页数和大小限制。

2

先看那份判定

在文字出现之前,你会先知道有多少页带文本层、哪些页是扫描件、文档里有没有填好的表单域,以及是否检测到双栏排版并已重排。

3

需要的话调整读法

默认按你看到的版面走,并把零散的断行重新合并成段落。两者都可以切换:文档顺序保留 PDF 内部存储的次序,原样保留每一行则保留原始断行。

4

复制或保存

「复制」直接把文字放进剪贴板——粘进文档或 AI 助手时多数人要的就是这个。「下载」写出一个 UTF-8 编码的 .txt 文件,内容相同。

相关: 如果你只需要其中几页的文字,更快的做法是 先把那几页提取出来.

这个 PDF 转文字工具有什么不一样

最省事的提取方式,是把 pdf.js 交回来的文字片段直接拼在一起。一行代码,结果看起来也几乎是对的——所以很多工具就是这么做的。在一份两页的报税表上,这种做法在 76 处断行把词粘成了一个;在一篇论文的八页里,是 293 处。你会得到「permission toreproduce」和「neural networksin particular」这样的东西,散落在文档各处,而你不一定会在用之前发现。

更深的问题是顺序。PDF 按绘制到页面上的顺序存储文字,而那不是你阅读的顺序。在表单上,一个日期栏可能被输出成「MM DD YYYY/ /」,因为分隔符是最后画上去的。在双栏页面上,两栏会一行一行地交错——你在 PDF 阅读器里全选一页再粘出来,得到的正是这个结果。我们根据字符实际所在的位置重建阅读顺序,于是「MM / DD / YYYY」回来了,每一栏也保持完整。

还有一些东西是最容易被整个漏掉的。如果你填过一份 PDF 表单,你的答案一个字都不在页面正文里——它们存在表单域上,只读页面的提取器会把一份空白模板递给你,而且看起来一切正常。我们会把它们收集起来附在末尾。另外,某些 PDF 生成器会输出看着对、实际不对的字符:一份中文文档可能满是康熙部首,屏幕上分辨不出,搜索也搜不到,粘贴出来是错字。我们交出的每一个字符串都会做规范化,把它们折回本来该是的那个字。

人们拿它来做这些事:

  • 真正搜索一份长报告,或者在它的章节之间跳转
  • 把文档粘进 AI 助手,不带一堆版面杂物
  • 引用论文里的段落,不把格式一起拖过来
  • 把别人填好交回来的表单内容重新取出来
  • 把文档归档成到哪儿都打得开的纯文本
  • 在手机上以单栏读完一份多栏排版的文档

你在哪儿用都行

处理发生在你的浏览器里,所以不用安装,也不用注册账号。任何系统上的现代浏览器都可以。

§ 01

Windows

Chrome、Edge 或 Firefox。不需要阅读器,不需要 Acrobat 订阅,也没有东西要下载。

§ 02

macOS

Safari、Chrome 或 Firefox。比在「预览」里打开文件再一页页选要快。

§ 03

Linux

任何现代浏览器。结果和命令行的 pdftotext 一样,但不用离开这个页面。

§ 04

iPhone 与 iPad

Safari 或 Chrome。当 PDF 从邮件里过来、而你需要把文字发进聊天时很有用。

§ 05

Android

Chrome、Firefox 或三星浏览器。用来把双栏文档读成一栏很顺手。

§ 06

Chromebook

页面加载完成后可完全离线使用,适合学校统一管理的设备。

为什么从 PDF 里复制文字通常是乱的

如果你在 PDF 阅读器里全选过一页、粘出来发现句子全错位了,原因就在这里——大多数转换工具产出同样一团乱,也是同一个原因。

绘制顺序阅读顺序
PDF 按绘制顺序存储文字。我们重建的是你阅读的顺序。

PDF 里存的是什么

是这一页被绘制的顺序。文字按生成这个文件的程序方便的次序落下:先标题,再页脚,然后正文,最后才是落在各字段之间的分隔符。复制会跟着这个次序走,所以在双栏页面上你会拿到左栏一行、右栏一行,一路交错下去。

我们重建的是什么

是你会去读的顺序。字符按所在位置聚成行,行聚成栏,栏一个接一个地读下来。断行回来了,栏保持完整,分隔符也回到了它们本该待的字段中间。

它仍然做不到的地方

一张页面的图片根本无法读取;表格一旦变成纯文本就不再是表格——行还在,网格没了。一整行横跨两栏、却没有任何一部分穿过中缝的情况(比如一排作者名),在几何上与「左右栏各一行」无法区分,所以标题区可能顺序古怪。Adobe 自家社区对 Acrobat 也是这么说的:遇到边栏和嵌在正文里的文字,「几乎不可能」判断该跟着哪一行走。当我们的读法看起来不对时,切到文档顺序对照一下。

要文本还是要 Word?

当你只要文字本身时,纯文本是对的答案——搜索、引用、粘进 AI 助手、归档。当你需要把文档作为文档拿回来、连同标题、表格和图片时,它就是错的答案;那是 PDF 转 Word 的活,任何 .txt 都办不到。在评判结果之前,先弄清你要的是哪一个。

你的文档留在你的设备上

人们拿到这类工具面前的文件,很少是无关紧要的。合同、发票、简历、体检报告、填好的申请表——这些文档的敏感之处恰恰就是它的全部内容。在把这样一份文件上传到任何地方之前,这一点值得想一想。

这个工具什么都不上传。你的浏览器打开 PDF、读取它,并在你自己的机器上把文字组装出来。没有携带你文件的请求,没有服务器上的队列,任何地方都没有缓存,也没有一份留给谁将来去删除的副本。关掉标签页,它就没了。

这也意味着通常那些限制不适用。没有页数上限,没有文件大小上限,也没有每日配额——因为这背后没有服务器账单,只有你自己的设备能从容承载多少。

§ 01

不上传

PDF 在它原本所在的地方被读取,从不出发。

§ 02

不注册

不用注册、不留邮箱,结果上也没有水印。

§ 03

不留存

我们这边没有副本可以存储、记录或删除。

关于从 PDF 提取文字的常见问题

为什么我提取出来是空的?
几乎可以肯定是因为这份 PDF 是扫描件。扫描页是一张图片,里面没有字符可读——提取返回空,是因为那里本来就没有东西。打开文件试着选一句话:如果没有高亮出现,就是这个原因。我们会告诉你哪些页受影响,而不是把一个空文件递给你。
什么是「文本层」?
就是存在 PDF 内部的那些字符,和把它们画到屏幕上的指令放在一起。由软件导出的 PDF 有文本层;扫描仪或相机生成的 PDF 没有,因为它装的是一张页面的照片。关于提取文字的一切,都取决于你手上是这两者中的哪一个。
你们对扫描件做 OCR 吗?
不做。OCR 是识别形状、猜测字符,是另一件事,有另一套出错方式,我们不想假装它们是一回事。如果你的页面是扫描件,我们会直说,并指给你把它们转成图片的路径,之后你可以用任何你信任的 OCR 工具去处理。我们不会做的是:悄悄用一个猜测替换掉你要的东西。
为什么从 PDF 复制粘贴出来是乱的?
因为 PDF 按绘制顺序存储文字,而不是你阅读的顺序。复制跟着存储顺序走,所以双栏页面出来是两栏一行一行交错,绘制次序古怪的字段也会错位。这个工具根据字符在页面上的位置重建顺序,所以在直接复制会出错的地方,结果通常是通顺的。
为什么我的双栏文档顺序还是不对?
分栏检测依据的是页面中间那道竖直空隙,而有些版式给不出干净的答案——一张跨栏的图、一个边栏,或者横铺整页的一排名字。如果某一页顺序不对,把阅读顺序切到「按文档顺序」:那会给你 PDF 里存储的原始次序,未经改动,有时反而是更有用的那一个。
我填在表单里的内容为什么不见了?
因为你输入的东西不属于页面本身。表单值存在表单域上,与文档创建时就有的正文分开存放,所以只读页面的工具会给你一份空白模板,而且不作任何提示。我们连表单域一起读,把答案附在文字末尾、单列一节。如果你只想要页面本身,可以把它关掉。
表格会保持原来的排布吗?
不会,任何纯文本工具都不该做这个承诺。.txt 文件里不存在「表格」这个概念——单元格会按阅读顺序、一行一行地变成文字,网格不在了。列的边界通常会以空格的形式留下来,足够看出一个字段在哪儿结束、下一个从哪儿开始;但如果你需要真正的表格,该去要表格文件或 Word 转换。
我该转成文本还是 Word?
要文字就选文本:搜索、引用、粘进 AI 助手、归档一份到哪儿都能打开的东西。要把文档作为文档拿回来、连同标题、表格、图片和样式,就选 Word。这确实是两件不同的事,而一个丢掉了格式的 .txt 文件,正是在做它该做的事。
我的文件会被上传吗?
不会。PDF 由你自己的浏览器打开和读取,文字在你的设备上组装。没有任何东西被送到服务器,所以任何地方都没有副本可供谁保留或删除。对一个典型输入是合同、简历或填好的表单的工具来说,这一点很值得有。
有文件大小限制吗?
我们不设限制,因为这里没有服务器参与。实际的上限是你自己的设备:一份非常大的文档在读取期间会占用内存,一台老手机会吃力,而笔记本轻松搞定。页面是一页一页处理的,所以大文档的进度会持续推进。
支持中文、日文、韩文或阿拉伯文的 PDF 吗?
支持。PDF 里带的任何文字,无论哪种文种,都以同样方式提取,输出是 UTF-8。关于中日韩文档有一个细节值得知道:某些 PDF 生成器会用康熙部首代替普通汉字——它们看起来一模一样,但搜索普通字符是搜不到的。我们会在把文字交给你之前把它们规范化回来,这件事多数工具并不做。
.txt 文件是什么编码?
UTF-8,不带字节顺序标记(BOM)。任何现代编辑器、终端或编程语言都按这个预期工作,也能完整保留带重音符号的文字以及西里尔文、希腊文和中日韩文字。如果你习惯命令行的 pdftotext,输出约定与它一致。

把你 PDF 里的文字取出来

免费、不限量,全程在你的浏览器里完成——并且会诚实告诉你,文件里到底有什么。

从 PDF 提取文字