PDF をテキストに変換
PDF から文字を取り出して、コピーするか .txt ファイルとして保存できます。すべてブラウザ内で完結し、ファイルはアップロードされません。
テキストを抽出する PDF をここにドロップ
またはクリックしてファイルを選択
- 100% ブラウザ内で完結
- アップロード不要・登録不要
- ページ数・サイズ制限なし
- ファイルは端末から出ません
お客様の PDF がスキャンの場合、中に抽出できる文字はありません。1 ページずつ確認し、ダウンロードの前にお知らせします。
PDF から文字を取り出したくなる理由
PDF は印刷されたページの記述です。どの文字がどこに置かれ、何ポイントで、どのフォントで描かれるかは知っていますが、その文字の並びが文であるのか、見出しなのか、段落なのかは知りません。そのページを読むだけなら問題になりませんが、書かれている内容で何かをしようとした瞬間に問題になります。
そこでプレーンテキストの出番です。長い報告書をきちんと検索したい、あるいは 90 ページをスクロールせずに章の間を行き来したい。段落をメールに引用したいが、フォントや改行や見えない書式まで一緒に付いてきてほしくない。文書を AI アシスタントに貼りたいが、相手が必要としているのは文字であってページの装飾ではない。契約書を、20 年後も特定のソフトなしで開ける形式で保管しておきたい。
アクセシビリティの事情もあり、これは見た目より多くあります。多段組みはスマートフォンでは読みづらく、スクリーンリーダーが順序を誤ると 2 段組みのページは意味をなさない音声になります。文書を正しい順序の文字だけに落とすと、元のレイアウトでは不可能だった使い方ができるようになります。
PDF は 2 種類あり、文字が入っているのは片方だけ
PDF から文字を抽出するとは、ファイルの中に保存されている文字を読み取ることです。これは PDF にテキストレイヤー(描画命令と一緒に保存された実際の文字)がある場合に成り立ちます。スキャンされた PDF にテキストレイヤーはありません。それはページの画像であり、中に文字は 1 つもないからです。
ソフトウェアが作った PDF——ワープロから書き出したもの、ブラウザから PDF として印刷したもの、請求システムが生成したもの——のほとんどにはテキストレイヤーがあります。見分け方は簡単で、ファイルを開いてカーソルで一文を選んでみることです。ハイライトが文字に沿って付くなら、その文字は本当にそこにあり、どのツールでも読み取れます。
スキャナーやスマートフォンのカメラが作った PDF は違います。各ページが 1 枚の画像です。お客様に文字が見えるのは、認識をお客様の目が行っているからで、ファイルにとってそのページに入っているのは写真だけです。文字は選択できず、検索しても見つからず、抽出しても何も返りません。ツールが失敗したのではなく、返すものが最初から存在しないのです。
文字の画像を文字に戻すのは OCR と呼ばれる別の仕事で、読み取りではなく認識の問題です。ソフトが形ごとに推測し、時には間違えます。当サイトはこれを行いません。代わりに行うのは 1 ページずつ確認し、ダウンロードの前にどちらの種類かをお伝えすることです。空のファイルを渡すツールや、黙って OCR に切り替えるツールは、お客様が自分の文書がどちらだったのかを知る手立てを奪っています。
この判定は推測ではありません。テキストレイヤーのあるページは文字を返し、ないページは何も返しません。判断を誤りうる中間はありません。だからこの結果は、どこかの注意書きの中ではなく、テキストの上に表示されます。
PDF から文字を抽出する手順
インストールもアップロードもありません。ファイルをドロップし、何が見つかったかを確認し、必要な形でテキストを持ち出してください。
PDF をドロップする
ファイルを選ぶか、枠にドラッグします。読み取るのはお客様自身のブラウザで、どこにも送信されません。ページ数やサイズの上限も、端末が扱える範囲を超えては設けていません。
まず判定を読む
テキストが表示される前に、テキストレイヤーのあるページ数、スキャンのページ、入力済みフォームフィールドの有無、2 段組みを検出して並べ替えたかどうかがわかります。
必要なら読み方を変える
既定では見たままのレイアウトをたどり、ばらけた行を段落に戻します。どちらも切り替えられます。文書の内部順は PDF が保存している並びをそのまま残し、行をそのまま残す設定は元の改行を保ちます。
コピーするか保存する
コピーはテキストを直接クリップボードに載せます。文書や AI アシスタントに貼る場合はたいていこれで十分です。ダウンロードは同じ内容を UTF-8 の .txt ファイルとして書き出します。
関連: 一部のページの文字だけが必要なら、先に そのページを抜き出す.
この PDF テキスト変換ツールが違うところ
最も素朴な抽出方法は、pdf.js が返す断片をそのままつなげることです。1 行で書けて、結果もほとんど正しく見えます。だから多くのツールがそうしています。2 ページの税務フォームでは、その方法は 76 か所の改行で単語をつなげてしまいました。論文 8 ページでは 293 か所です。「permission toreproduce」「neural networksin particular」のようなものが文書の各所に散らばり、使う前に気づけるとは限りません。
より根が深いのは順序です。PDF は文字をページに描く順で保存しますが、それは読む順序ではありません。フォームでは、区切り記号が最後に描かれるために日付欄が「MM DD YYYY/ /」として出てくることがあります。2 段組みのページでは左右の段が 1 行ずつ交互になります。PDF リーダーで 1 ページ全選択して貼り付けたときに起こるのが、まさにこれです。当サイトは文字が実際に置かれている位置から読む順序を組み直します。だから「MM / DD / YYYY」が戻り、各段もひとまとまりのまま残ります。
そして、まるごと見落とされがちなものがあります。PDF フォームに記入した場合、その答えはページの本文には 1 文字も入っていません。フォームフィールドの側にあるため、ページしか読まない抽出ツールは白紙のひな形を渡しながら、うまくいったように見えてしまいます。当サイトはそれも集めて末尾に加えます。また、一部の PDF 生成ソフトは正しく見えて実は違う文字を出力します。中国語の文書が康熙部首だらけになることがあり、画面では見分けがつかず、検索にもかかりません。お渡しする文字列はすべて正規化し、本来の文字に戻しています。
こんな場面で使われています:
- 長い報告書をきちんと検索する、章の間を行き来する
- ページの装飾を持ち込まずに文書を AI アシスタントへ貼る
- 書式を引きずらずに論文から引用する
- 記入して返送されたフォームの中身を取り出す
- どこでも開けるプレーンテキストとして文書を保管する
- 多段組みのレイアウトをスマートフォンで 1 段として読む
お使いの環境でそのまま動きます
処理はブラウザの中で行われるため、インストールもアカウント作成も不要です。どの OS でも、最近のブラウザであれば動きます。
Windows
Chrome、Edge、Firefox。リーダーも Acrobat の契約も、ダウンロードするものも要りません。
macOS
Safari、Chrome、Firefox。プレビューで開いて 1 ページずつ選ぶより速く済みます。
Linux
最近のブラウザなら何でも。コマンドラインの pdftotext と同じ結果を、このページを離れずに。
iPhone・iPad
Safari または Chrome。メールで届いた PDF の文字をメッセージに入れたいときに便利です。
Android
Chrome、Firefox、Samsung Internet。2 段組みの文書を 1 段で読むのに向いています。
Chromebook
ページの読み込み後は完全にオフラインで動くので、学校の管理端末にも適しています。
PDF から文字をコピーすると、たいてい崩れる理由
PDF リーダーでページを選択して貼り付け、文がばらばらになった経験があるなら、その理由がこれです。多くの変換ツールが同じ結果になるのも、同じ理由です。
PDF が保存しているもの
ページが描かれる順序です。文字は、そのファイルを作ったソフトにとって都合のよい順に置かれます。見出し、次にフッター、それから本文、最後に各項目の間に落ちる区切り記号。コピーはその順序をたどるので、2 段組みのページでは左段が 1 行、右段が 1 行と、下まで交互に並びます。
当サイトが組み直すもの
お客様が読むであろう順序です。文字は位置によって行にまとめられ、行は段にまとめられ、段は 1 つずつ順に読まれます。改行が戻り、段はひとまとまりのまま残り、区切り記号も本来属する項目の間へ戻ります。
それでも限界があるところ
ページの画像はそもそも読めません。表はプレーンテキストになった時点で表ではなくなります。行は残りますが、罫線は残りません。どの部分も中央を横切らないまま両段にまたがる 1 行(たとえば著者名の並び)は、各段 1 行ずつと幾何的に区別できないため、タイトル部分の順序が不自然になることがあります。Adobe 自身のコミュニティも Acrobat について同じことを述べています。サイドバーや本文中に差し込まれた文字があると、どの行を追うべきかを判断するのは「ほとんど不可能」だと。当サイトの読み方がおかしいと感じたら、文書の内部順に切り替えて見比べてください。
テキストか、Word か
文字だけが必要なとき——検索、引用、AI アシスタントへの貼り付け、保管——にはプレーンテキストが正解です。見出しや表や画像を含めて文書を文書のまま取り戻したいときには不正解で、それは PDF から Word への変換の仕事であり、.txt では代われません。結果を評価する前に、自分がどちらを求めて来たのかを確かめる価値があります。
文書はお客様の端末に留まります
この種のツールに持ち込まれるファイルが、どうでもいい内容であることはまずありません。契約書、請求書、履歴書、診断書、記入済みの申込書——中身そのものが機微だという文書です。どこかにアップロードする前に、その点は考えておく価値があります。
このツールは何もアップロードしません。お客様のブラウザが PDF を開いて読み取り、テキストをお客様自身の端末で組み立てます。ファイルを運ぶ通信もなく、サーバー上の順番待ちもなく、どこにもキャッシュは残らず、あとから誰かが削除するための控えも存在しません。タブを閉じれば、それで終わりです。
そのため、よくある制限も当てはまりません。ページ数の上限も、ファイルサイズの上限も、1 日あたりの回数制限もありません。背後にサーバー費用が存在せず、お客様の端末が無理なく扱える範囲がすべてだからです。
アップロードなし
PDF は今ある場所で読み取られ、移動しません。
アカウント不要
登録もメールアドレスも不要で、結果に透かしも入りません。
保存なし
当サイト側に、保存・記録・削除すべき控えがそもそもありません。
PDF からの文字抽出についてのよくある質問
抽出したテキストが空なのはなぜですか?⌄
テキストレイヤーとは何ですか?⌄
スキャンした PDF に OCR をかけますか?⌄
PDF からコピー&ペーストすると崩れるのはなぜですか?⌄
2 段組みの文書で順序がまだおかしいのはなぜですか?⌄
PDF フォームに記入した内容が出てこないのはなぜですか?⌄
表のレイアウトは保たれますか?⌄
テキストと Word のどちらに変換すべきですか?⌄
ファイルはアップロードされますか?⌄
ファイルサイズの制限はありますか?⌄
中国語・日本語・韓国語・アラビア語の PDF にも対応していますか?⌄
.txt ファイルの文字コードは何ですか?⌄
関連記事
最新のガイドやレビューで、PDF から PNG への変換への理解を深めましょう
PDF を PNG にオンライン変換する方法(無料・高速な方法)
PDF を PNG に無料でオンライン変換する完全ガイド。おすすめ変換ツール 5 選を比較し、手順、上級者向けのヒント、トラブルシューティングを解説します。
記事を読むWindows・Mac・モバイルで PDF を PNG に変える方法
あらゆる端末で PDF を PNG に変換するプラットフォーム別ガイド。標準ツール、ソフトのおすすめ、モバイルアプリを網羅します。
記事を読むPDF → PNG と PDF → JPG:どちらの形式を選ぶべきか?
PDF 変換における PNG と JPG 形式の詳細比較。ファイルサイズ、画質の違い、用途、選択のためのガイド。
記事を読む