PDF をテキストに変換

PDF から文字を取り出して、コピーするか .txt ファイルとして保存できます。すべてブラウザ内で完結し、ファイルはアップロードされません。

  • 100% ブラウザ内で完結
  • アップロード不要・登録不要
  • ページ数・サイズ制限なし
  • ファイルは端末から出ません

お客様の PDF がスキャンの場合、中に抽出できる文字はありません。1 ページずつ確認し、ダウンロードの前にお知らせします。

PDF から文字を取り出したくなる理由

PDF は印刷されたページの記述です。どの文字がどこに置かれ、何ポイントで、どのフォントで描かれるかは知っていますが、その文字の並びが文であるのか、見出しなのか、段落なのかは知りません。そのページを読むだけなら問題になりませんが、書かれている内容で何かをしようとした瞬間に問題になります。

そこでプレーンテキストの出番です。長い報告書をきちんと検索したい、あるいは 90 ページをスクロールせずに章の間を行き来したい。段落をメールに引用したいが、フォントや改行や見えない書式まで一緒に付いてきてほしくない。文書を AI アシスタントに貼りたいが、相手が必要としているのは文字であってページの装飾ではない。契約書を、20 年後も特定のソフトなしで開ける形式で保管しておきたい。

アクセシビリティの事情もあり、これは見た目より多くあります。多段組みはスマートフォンでは読みづらく、スクリーンリーダーが順序を誤ると 2 段組みのページは意味をなさない音声になります。文書を正しい順序の文字だけに落とすと、元のレイアウトでは不可能だった使い方ができるようになります。

アップロード型相手のサーバー?このツールお客様の端末端末から何も出ないので、削除すべき控えもありません。
ほかの変換ツールは文書をアップロードします。これは今ある場所で読み取ります。

PDF は 2 種類あり、文字が入っているのは片方だけ

PDF から文字を抽出するとは、ファイルの中に保存されている文字を読み取ることです。これは PDF にテキストレイヤー(描画命令と一緒に保存された実際の文字)がある場合に成り立ちます。スキャンされた PDF にテキストレイヤーはありません。それはページの画像であり、中に文字は 1 つもないからです。

ソフトウェアが作った PDF——ワープロから書き出したもの、ブラウザから PDF として印刷したもの、請求システムが生成したもの——のほとんどにはテキストレイヤーがあります。見分け方は簡単で、ファイルを開いてカーソルで一文を選んでみることです。ハイライトが文字に沿って付くなら、その文字は本当にそこにあり、どのツールでも読み取れます。

スキャナーやスマートフォンのカメラが作った PDF は違います。各ページが 1 枚の画像です。お客様に文字が見えるのは、認識をお客様の目が行っているからで、ファイルにとってそのページに入っているのは写真だけです。文字は選択できず、検索しても見つからず、抽出しても何も返りません。ツールが失敗したのではなく、返すものが最初から存在しないのです。

文字の画像を文字に戻すのは OCR と呼ばれる別の仕事で、読み取りではなく認識の問題です。ソフトが形ごとに推測し、時には間違えます。当サイトはこれを行いません。代わりに行うのは 1 ページずつ確認し、ダウンロードの前にどちらの種類かをお伝えすることです。空のファイルを渡すツールや、黙って OCR に切り替えるツールは、お客様が自分の文書がどちらだったのかを知る手立てを奪っています。

この判定は推測ではありません。テキストレイヤーのあるページは文字を返し、ないページは何も返しません。判断を誤りうる中間はありません。だからこの結果は、どこかの注意書きの中ではなく、テキストの上に表示されます。

Invoice 2026Total 1,240.00Due 30 days本物の文字ただの画素
画面では同じに見える 2 つの PDF。片方は文字が入っていて、もう片方はその画像が入っているだけ — どれだけ拡大しても、画像は文字に戻りません。

PDF から文字を抽出する手順

インストールもアップロードもありません。ファイルをドロップし、何が見つかったかを確認し、必要な形でテキストを持ち出してください。

PDF を置く判定を見るコピー/保存
ファイルをドロップし、判定を読み、テキストをコピーまたは保存。
1

PDF をドロップする

ファイルを選ぶか、枠にドラッグします。読み取るのはお客様自身のブラウザで、どこにも送信されません。ページ数やサイズの上限も、端末が扱える範囲を超えては設けていません。

2

まず判定を読む

テキストが表示される前に、テキストレイヤーのあるページ数、スキャンのページ、入力済みフォームフィールドの有無、2 段組みを検出して並べ替えたかどうかがわかります。

3

必要なら読み方を変える

既定では見たままのレイアウトをたどり、ばらけた行を段落に戻します。どちらも切り替えられます。文書の内部順は PDF が保存している並びをそのまま残し、行をそのまま残す設定は元の改行を保ちます。

4

コピーするか保存する

コピーはテキストを直接クリップボードに載せます。文書や AI アシスタントに貼る場合はたいていこれで十分です。ダウンロードは同じ内容を UTF-8 の .txt ファイルとして書き出します。

関連: 一部のページの文字だけが必要なら、先に そのページを抜き出す.

この PDF テキスト変換ツールが違うところ

最も素朴な抽出方法は、pdf.js が返す断片をそのままつなげることです。1 行で書けて、結果もほとんど正しく見えます。だから多くのツールがそうしています。2 ページの税務フォームでは、その方法は 76 か所の改行で単語をつなげてしまいました。論文 8 ページでは 293 か所です。「permission toreproduce」「neural networksin particular」のようなものが文書の各所に散らばり、使う前に気づけるとは限りません。

より根が深いのは順序です。PDF は文字をページに描く順で保存しますが、それは読む順序ではありません。フォームでは、区切り記号が最後に描かれるために日付欄が「MM DD YYYY/ /」として出てくることがあります。2 段組みのページでは左右の段が 1 行ずつ交互になります。PDF リーダーで 1 ページ全選択して貼り付けたときに起こるのが、まさにこれです。当サイトは文字が実際に置かれている位置から読む順序を組み直します。だから「MM / DD / YYYY」が戻り、各段もひとまとまりのまま残ります。

そして、まるごと見落とされがちなものがあります。PDF フォームに記入した場合、その答えはページの本文には 1 文字も入っていません。フォームフィールドの側にあるため、ページしか読まない抽出ツールは白紙のひな形を渡しながら、うまくいったように見えてしまいます。当サイトはそれも集めて末尾に加えます。また、一部の PDF 生成ソフトは正しく見えて実は違う文字を出力します。中国語の文書が康熙部首だらけになることがあり、画面では見分けがつかず、検索にもかかりません。お渡しする文字列はすべて正規化し、本来の文字に戻しています。

こんな場面で使われています:

  • 長い報告書をきちんと検索する、章の間を行き来する
  • ページの装飾を持ち込まずに文書を AI アシスタントへ貼る
  • 書式を引きずらずに論文から引用する
  • 記入して返送されたフォームの中身を取り出す
  • どこでも開けるプレーンテキストとして文書を保管する
  • 多段組みのレイアウトをスマートフォンで 1 段として読む

お使いの環境でそのまま動きます

処理はブラウザの中で行われるため、インストールもアカウント作成も不要です。どの OS でも、最近のブラウザであれば動きます。

§ 01

Windows

Chrome、Edge、Firefox。リーダーも Acrobat の契約も、ダウンロードするものも要りません。

§ 02

macOS

Safari、Chrome、Firefox。プレビューで開いて 1 ページずつ選ぶより速く済みます。

§ 03

Linux

最近のブラウザなら何でも。コマンドラインの pdftotext と同じ結果を、このページを離れずに。

§ 04

iPhone・iPad

Safari または Chrome。メールで届いた PDF の文字をメッセージに入れたいときに便利です。

§ 05

Android

Chrome、Firefox、Samsung Internet。2 段組みの文書を 1 段で読むのに向いています。

§ 06

Chromebook

ページの読み込み後は完全にオフラインで動くので、学校の管理端末にも適しています。

PDF から文字をコピーすると、たいてい崩れる理由

PDF リーダーでページを選択して貼り付け、文がばらばらになった経験があるなら、その理由がこれです。多くの変換ツールが同じ結果になるのも、同じ理由です。

描画の順序読む順序
PDF は文字を描いた順で保存します。当サイトは読む順序に組み直します。

PDF が保存しているもの

ページが描かれる順序です。文字は、そのファイルを作ったソフトにとって都合のよい順に置かれます。見出し、次にフッター、それから本文、最後に各項目の間に落ちる区切り記号。コピーはその順序をたどるので、2 段組みのページでは左段が 1 行、右段が 1 行と、下まで交互に並びます。

当サイトが組み直すもの

お客様が読むであろう順序です。文字は位置によって行にまとめられ、行は段にまとめられ、段は 1 つずつ順に読まれます。改行が戻り、段はひとまとまりのまま残り、区切り記号も本来属する項目の間へ戻ります。

それでも限界があるところ

ページの画像はそもそも読めません。表はプレーンテキストになった時点で表ではなくなります。行は残りますが、罫線は残りません。どの部分も中央を横切らないまま両段にまたがる 1 行(たとえば著者名の並び)は、各段 1 行ずつと幾何的に区別できないため、タイトル部分の順序が不自然になることがあります。Adobe 自身のコミュニティも Acrobat について同じことを述べています。サイドバーや本文中に差し込まれた文字があると、どの行を追うべきかを判断するのは「ほとんど不可能」だと。当サイトの読み方がおかしいと感じたら、文書の内部順に切り替えて見比べてください。

テキストか、Word か

文字だけが必要なとき——検索、引用、AI アシスタントへの貼り付け、保管——にはプレーンテキストが正解です。見出しや表や画像を含めて文書を文書のまま取り戻したいときには不正解で、それは PDF から Word への変換の仕事であり、.txt では代われません。結果を評価する前に、自分がどちらを求めて来たのかを確かめる価値があります。

文書はお客様の端末に留まります

この種のツールに持ち込まれるファイルが、どうでもいい内容であることはまずありません。契約書、請求書、履歴書、診断書、記入済みの申込書——中身そのものが機微だという文書です。どこかにアップロードする前に、その点は考えておく価値があります。

このツールは何もアップロードしません。お客様のブラウザが PDF を開いて読み取り、テキストをお客様自身の端末で組み立てます。ファイルを運ぶ通信もなく、サーバー上の順番待ちもなく、どこにもキャッシュは残らず、あとから誰かが削除するための控えも存在しません。タブを閉じれば、それで終わりです。

そのため、よくある制限も当てはまりません。ページ数の上限も、ファイルサイズの上限も、1 日あたりの回数制限もありません。背後にサーバー費用が存在せず、お客様の端末が無理なく扱える範囲がすべてだからです。

§ 01

アップロードなし

PDF は今ある場所で読み取られ、移動しません。

§ 02

アカウント不要

登録もメールアドレスも不要で、結果に透かしも入りません。

§ 03

保存なし

当サイト側に、保存・記録・削除すべき控えがそもそもありません。

PDF からの文字抽出についてのよくある質問

抽出したテキストが空なのはなぜですか?
ほぼ間違いなく、その PDF がスキャンだからです。スキャンされたページは画像で、中に読み取れる文字がありません。抽出が何も返さないのは、返すものがないからです。ファイルを開いて一文を選んでみてください。ハイライトが付かなければ、それが理由です。当サイトは空のファイルを渡すのではなく、どのページが該当するかをお伝えします。
テキストレイヤーとは何ですか?
PDF の内部に、画面に描くための命令と一緒に保存されている文字のことです。ソフトウェアから書き出した PDF にはありますが、スキャナーやカメラが作った PDF にはありません。代わりにページの写真が入っているからです。文字の抽出に関することはすべて、この 2 つのどちらであるかで決まります。
スキャンした PDF に OCR をかけますか?
かけません。OCR は形を認識して文字を推測するもので、別の仕事であり、別の失敗の仕方をします。それを同じものであるかのように装いたくありません。ページがスキャンであればその旨をお伝えし、画像に変換する道筋をご案内します。その後はお好みの OCR ツールをお使いください。当サイトがしないのは、お求めのものを黙って推測に差し替えることです。
PDF からコピー&ペーストすると崩れるのはなぜですか?
PDF が文字を、読む順ではなく描く順で保存しているからです。コピーは保存順をたどるため、2 段組みのページは左右が 1 行ずつ交互になり、描画の順序が変わった項目もばらばらになります。このツールはページ上の文字の位置から順序を組み直すので、単純なコピーでは崩れる場面でもたいてい読める形になります。
2 段組みの文書で順序がまだおかしいのはなぜですか?
段の検出はページ中央を縦に走る空きを手がかりにしますが、レイアウトによってはきれいな答えが出ません。幅の広い図、サイドバー、ページいっぱいに並んだ名前などです。あるページの順序がおかしければ、読み取り順序を「文書の内部順」に切り替えてください。PDF に保存されている並びがそのまま得られ、そちらの方が役に立つこともあります。
PDF フォームに記入した内容が出てこないのはなぜですか?
入力した内容はページの一部ではないからです。フォームの値は、文書の作成時からある本文とは別に、フォームフィールドの側に保存されます。そのためページしか読まないツールは、何の警告もなく白紙のひな形を返します。当サイトはフォームフィールドも読み、答えをテキストの末尾に見出し付きで加えます。ページ本文だけが必要なら、この機能はオフにできます。
表のレイアウトは保たれますか?
保たれませんし、プレーンテキストのツールがそれを約束すべきではありません。.txt に「表」という概念はなく、セルは読む順に 1 行ずつ文字として並び、罫線は残りません。列の区切りはたいてい空白として残るので、どの項目がどこで終わり次がどこから始まるかは見て取れます。本当の表が必要なら、表計算や Word への変換をお使いください。
テキストと Word のどちらに変換すべきですか?
文字が欲しいならテキストです。検索、引用、AI アシスタントへの貼り付け、どこでも開ける形での保管。見出し・表・画像・体裁を含めて文書を文書として取り戻したいなら Word です。これは本当に別々の仕事であり、体裁を捨てた .txt は本来の役目を果たしているだけです。
ファイルはアップロードされますか?
されません。PDF はお客様自身のブラウザで開いて読み取られ、テキストも端末上で組み立てられます。サーバーには何も送られないため、誰かが保管したり削除したりする控えがどこにも存在しません。契約書・履歴書・記入済みフォームが典型的な入力であるツールにとって、これは意味のある違いです。
ファイルサイズの制限はありますか?
当サイトが設けている制限はありません。サーバーが関与しないからです。実際の上限はお客様の端末です。非常に大きな文書は読み取り中にメモリを使い、古いスマートフォンでは苦しくなる一方、ノート PC なら余裕で処理できます。ページは 1 枚ずつ処理されるため、大きな文書でも進捗は進み続けます。
中国語・日本語・韓国語・アラビア語の PDF にも対応していますか?
対応しています。PDF が持つ文字であれば、どの文字体系でも同じように抽出し、出力は UTF-8 です。東アジアの文書について 1 つ知っておく価値があるのは、一部の PDF 生成ソフトが通常の漢字の代わりに康熙部首を出力することです。見た目は同じですが、通常の文字で検索しても見つかりません。当サイトはお渡しする前にそれを元に戻します。多くのツールが行っていない処理です。
.txt ファイルの文字コードは何ですか?
BOM なしの UTF-8 です。最近のエディタ、ターミナル、プログラミング言語はこれを前提としており、アクセント付きの文字、キリル文字、ギリシャ文字、中日韓の文字もそのまま保たれます。コマンドラインの pdftotext をお使いの方には、同じ出力の作法です。

PDF から文字を取り出す

無料、無制限、すべてブラウザ内で完結。そしてファイルに実際に何が入っているかを、正直にお伝えします。

PDF から文字を抽出する