PDF OCR

スキャンした PDF を、検索できる PDF に変えます。このタブの中だけで完結し、アカウントもアップロードもページ数の上限もありません。

スキャンした PDF に OCR が必要な理由

スキャンした PDF は写真の束です。人の目には問題なく読めますが、コンピューターから見れば、そのページにあるのは色のついた点だけです。Ctrl+F では何も見つかりません。一行もコピーできません。索引にも載らないので、あとでどう検索しても出てきません。

OCR(光学文字認識)は、それを変える工程です。各ページの形を見て、それがどの文字かを判断し、その文字を画像の下に置かれた見えない層としてファイルに書き込みます。OCR をかけた PDF は見た目がまったく同じで、違いは下に文字があることだけです。

効いてくるのはたいてい数か月後です。スキャンした契約書、請求書、レシート、本の 1 ページ。覚えているのは一文だけで、あとは忘れている。検索できる PDF はその一文を返してくれます。写真の束は返してくれません。

この PDF OCR ツールはすべてブラウザ内で動きます。ファイルはアップロードされず、アカウントもなく、ページ数の上限もありません。この検索語でお客様より上位にあるページは、無料で処理したうえで、返す前にサインインを求めてきます。

アップロード型相手のサーバー?このツールあなたの端末端末から何も出ないので、消すべき控えもありません。
他の変換ツールはファイルをサーバーに送ります。これはファイルがすでにある場所で描きます。

PDF の OCR とは何か

PDF の OCR とは、その中にあるページ画像に文字認識をかけ、認識された語を見えないテキストレイヤーとして同じファイルに書き戻すことです。文書の見た目は変わらないまま、検索・選択・コピーができるようになります。

画面上では見分けのつかない 2 種類の PDF があります。ひとつはワープロから書き出されたもので本物の文字を持ち、もうひとつはスキャナーやスマートフォンのカメラから来たもので文字の画像を持ちます。OCR が必要なのは後者だけです。

ツールを使わずに見分ける早道があります。マウスで一行を選択してみてください。青い選択範囲が文字に沿って伸びれば、文字はすでにそこにあります。ページ全体がひとつの塊として選択される、あるいは何も起きないなら、それはスキャンした PDF です。

このツールは、何かを実行する前にその確認を代わりに行います。すでにテキストレイヤーがあれば、そう伝えたうえでテキストの抽出をお勧めします。OCR は正確なものをおおよそのものに置き換えてしまい、しかもページの見た目はどちらでも同じなので、あとから気づく手立てがないからです。

OCR が作る文字はページ画像の下に置かれ、上ではありません。だから検索できる PDF は依然としてスキャンのように見えます。見ているのは常に元の画像です。見えない層は、検索欄とコピー操作、そしてファイルを索引するものだけのために存在します。

その層が何であるかは、はっきり述べておく価値があります。それは推測です。きれいな印刷ならとても良い推測、しわの寄ったレシートを斜めから撮ったものなら悪い推測になります。見えている画像は常に正しく、その下の文字はそうとは限りません。

画像のみInvoiceNo. 4471Total1,240.00+ テキスト層
OCR はページの見た目を変えません。画像の下にテキストレイヤーを加え、それが PDF を検索できるものにします。

PDF に OCR をかける 4 つの手順

すべてこのブラウザタブの中で行われます。ファイルは端末から出ず、結果をダウンロードする前にアカウントを求められることもありません。

Lorem ipsumdolor sit ametconsectetur文字ありOCR 不要Lorem ipsum一部のみそこは飛ばす画像のみOCR の出番
すべての PDF に OCR が要るわけではありません。このツールは実行前に確認します。すでに正確な文字を読み直しても、悪くなるだけだからです。
1

スキャンした PDF を入れる

上の枠にファイルをドラッグするか、クリックして選びます。100 MB までなら問題ありません。どこにも送信されません。ファイルを開くのは、お客様のブラウザ上にあるこのページです。

2

判定を読む

ツールは作業前に各ページを調べ、テキストレイヤーの有無を確認します。そのうえで、この PDF に OCR が必要か、一部のページだけ必要か、まったく不要かをお伝えします。一部のページだけがスキャンの場合、残りは既定でそのまま手を触れません。

3

文書の言語を選ぶ

精度はこの選択に最も強く左右されます。この画面の言語ではなく、文書が書かれている言語を選んでください。言語データのダウンロードは一度だけで、英語は約 5.2 MB、ヒンディー語は約 1.7 MB、その後はキャッシュされます。複数選択もできますが、1 ページごとに遅くなります。

4

実行して結果を確かめる

ページは 1 枚ずつ処理され、読み取り中のページのプレビューが表示されるので、取り違えていたら早い段階で止められます。終わったらプレビューで文字を選択してみてください。そのうえで検索できる PDF を、文字だけでよければテキストをダウンロードします。

文字だけが必要な場合 PDF ではなく文字が欲しくて、ファイルにすでにテキストレイヤーがあるなら、推測を一切挟まない速い方法があります。 PDF から直接テキストを抽出する.

この PDF OCR ツールができること

テキストレイヤーを足すだけで、ほかは何も変えません。元のページはそのまま残ります。画像も解像度もページ枠も同じです。認識された語は不透明度ゼロで上に描かれるため、選択も検索もできますが、目には見えません。元から文字があったページは一切書き換えません。

ページの描画は 150 DPI で行います。これは既定値ではなく、測った結果です。あるテスト文書では、100・150・200・300 DPI の精度は 0.5 ポイント以内で並び、300 DPI は 4 倍の時間がかかりました。100 DPI を下回ると崖があり、72 DPI では精度が 95.6% から 79.3% に落ちました。600 DPI でスキャンしても OCR は正確になりません。遅くなるだけです。

100 を超える言語に対応し、多くの変換ツールが飛ばす文字体系も含みます。よく知られたオンライン OCR ツールのひとつは 19 言語を挙げていますが、その中に南アジアの文字はひとつもありません。ここではヒンディー語・タミル語・ベンガル語が一覧にあり、しかも上のほうにあります。この語を検索する人の多くが実際にそこにいるからです。

できなかったことを数えます。あるページが文字なしで返ってきた場合(白紙、写真、手書きなど)、そのページは手つかずのままファイルに残り、その旨が報告されます。黙って捨てられるものはありません。

サインインを求めることは一度もありません。400 ページの文書を処理し、続けてもう 1 本処理できます。1 日あたりの上限はありません。作業をしているサーバーが存在せず、したがって配給すべきものがないからです。

PDF の OCR はこんなときに使われます。

  • スキャンした契約書を保管する前に検索できるようにする
  • 1 ページずつ撮影した本の章から、目当ての一行を探し出す
  • スキャンした請求書のフォルダーを、ひと通り検索できるものに変える
  • PDF で届いた FAX やコピーから文字を取り出す
  • 古いスキャン資料を、記憶ではなく検索で見つけられるようにする
  • 検索インデックスや別のツールが読めるようスキャンを整える
  • スキャンから段落を打ち直さずにコピーする

どの端末でも使えます

インストールするものはありません。OCR はもともとお使いのブラウザで動くので、同じツールがどこでも使え、ファイルは始まった端末から動きません。

§ 01

Windows

Chrome、Edge、Firefox で動きます。ダウンロードは不要で、スキャンを検索可能にするために Acrobat の契約も要りません。

§ 02

Mac

Safari または Chrome。プレビューはスキャン PDF を表示できますが、テキストレイヤーを足すことはできません。

§ 03

iPhone・iPad

Safari で動きます。撮ったばかりの写真がスキャン代わりのときに便利ですが、まさにその場合こそページをまっすぐにすることが効きます。

§ 04

Android

Chrome で動きます。長い文書は時間がかかり端末を使い続けるので、先に電源につないでください。

§ 05

Chromebook

相性が良い環境です。インストール型のアプリではなく、すべてブラウザ内でローカルに動くためです。

§ 06

Linux

最近のブラウザであれば動きます。パッケージもコマンドラインも順番待ちもありません。

OCR が当たるところ、外すところ

どの OCR ツールも間違えますが、その間違いがどんな形をしているかを教えてくれるものはほとんどありません。実際の結果をお見せします。コンピューターで生成したきれいな請求書、ノイズも傾きもなし、全体の文字単位精度は 95.6%。そこから抜き出した 12 語のうち、検索で見つかったのは 5 語でした。

ファイルではOCR の読みNorthwindNorthwindSubtotalSubtotal1741.501741.502089.802089. 80INV-2026INV2026ReplacementRepl acenentPayment isPaymentis12 語中 5 語が検索可能
きれいなテスト用請求書から。文字単位の精度は 95.6%。会社名は通りましたが、合計は通りませんでした。OCR が数字の途中に空白を入れたためです。
文書ではOCR の読み理由
NorthwindNorthwindプロポーショナル書体の普通の文章は、いちばん易しい場合です。
2089.802089. 80数字の途中に空白が入り、合計を検索しても見つかりません。
INV-2026-04471INV2026-04471ハイフンがひとつ落ちました。参照番号はとりわけ壊れやすい部類です。
ReplacementRepl acenentm が n と読まれ、さらに存在しない空白が入りました。
Payment isPaymentis逆向きの失敗で、本物の空白が消えました。
1741.501741.50上の合計と同じ表、同じ書体、同じ形式なのに、こちらは正しく読めました。誤りは予測できません。

スキャンを本当に台無しにするもの

圧縮でも解像度でもありません。品質 60 の JPEG は、可逆の描画とコンマ以下の差しかありませんでした。効いたのは傾きです。2 度傾いたページは問題ありませんでしたが、7 度では精度が 9.5 ポイント下がり、確信度は 91 から 74 に落ちました。何かをスキャンするなら、まっすぐ置いてください。DPI を上げる手間は要りません。

検索できる PDF、テキスト、それとも Word ファイル?

検索できる PDF は、このページが作るものです。元のスキャンに見えないテキストレイヤーが加わり、PDF のままです。テキストはレイアウトを捨てた語だけで、どこかに貼りたいときに便利なので、2 つ目のダウンロードとして用意しています。編集できる Word 文書はレイアウトを組み直す別の仕事で、このツールは行いません。PDF にすでに文字があり、語だけが必要なら、OCR は飛ばして直接抽出してください。

スキャンはこのブラウザから出ません

ここに置かれた PDF は、このページが開き、お客様自身のプロセッサが読み、お客様自身のブラウザが書き戻します。アップロードされず、サーバーの待ち行列にも入らず、保持期間のあいだどこかに置かれることもありません。そもそも作業にサーバーが関与していないからです。

これは多くの変換よりも OCR で重みを持ちます。検索できるようにしたい文書は、契約書、診療記録、取引明細、身分証明書といったもの、つまり原本を残す価値があったからこそ存在するスキャンです。主要なオンライン OCR サービスはいずれも自社の機械で処理し、通常 1 〜 8 時間後に予定どおり削除します。

配給すべきものがない、という意味でもあります。自社のハードウェアで処理するサービスは無料利用を制限せざるを得ず、だからこそ 1 日 2 件、1 ファイル 10 ページといった上限が置かれます。ここでは作業がお客様の端末で行われるため、課すべき上限も、集めるべき登録情報もありません。

§ 01

アップロードはありません

ファイルはローカルで読まれます。どのサーバーにも複製は作られません。

§ 02

アカウントは不要です

結果をダウンロードするのにサインインは求められません。よそでは、それが無料 OCR の通常の代価です。

§ 03

ページ数・ファイル数の制限なし

400 ページのスキャンを処理し、続けてもう 1 本。1 日の割り当てはありません。

§ 04

言語データだけ

ダウンロードされるのは、選んだ言語の認識データだけです。お客様の文書がその通信に含まれることはありません。

よくある質問

この PDF OCR ツールは本当に無料ですか。ページ数の上限はありますか。
無料で、ページ数の上限も 1 日の割り当てもありません。OCR はサーバーではなくお客様の端末で動くため、こちらにファイルごとの費用が発生せず、配給すべきものもないからです。大きな文書を制限するのは、お客様の忍耐と電池だけです。
結果をダウンロードするのに登録が必要ですか。
必要ありません。ファイルを置き、OCR を実行し、検索できる PDF をダウンロードするまで、アカウントもメールアドレスも不要です。これはどの OCR サイトでもアップロード前に確かめる価値があります。作業が済んだダウンロードの段階になって初めてアカウントを求められるのは、よくあることだからです。
自分の PDF に OCR が必要かどうか、どう見分けますか。
マウスで一行を選択してみてください。選択範囲が文字に沿って伸びるなら、そのファイルにはすでにテキストレイヤーがあり、OCR は悪くするだけです。このツールはファイルを追加した時点で自動的に確認し、3 つの状態のどれに当たるかを実行前にお伝えします。
OCR の精度はどのくらいですか。
役に立つ程度には正確で、鵜呑みにできるほどではありません。コンピューターで生成したきれいなテスト請求書では、文字単位の精度は 95.6% でした。ただし抜き出した 12 語のうち実際に検索で見つかったのは 5 語です。空白が数字の中に入り込んだり、ハイフンが消えたりしたためです。くっきりした印刷はよく通ります。しわ、かすれ、傾きがあるものは落ちます。
対応している言語は。
100 以上で、通常の欧州言語に加えてヒンディー語、タミル語、ベンガル語、タイ語、ベトナム語、インドネシア語も含みます。この画面の言語ではなく、文書が書かれている言語を選んでください。他のどの設定よりも精度に効きます。なお、デーヴァナーガリーのように文字の形を組み替える文字体系では、正しく認識されていても PDF のテキストレイヤーに書き込む際に語が失われることがあります。
手書きは読めますか。
読めないとお考えください。このエンジンは印刷された文字のために作られており、手書きはそのために訓練されていない別の問題です。手書きのページはたいてい空か、それに近い形で返ってきます。その場合、ページは元のままファイルに残り、黙って捨てられるのではなく要約に報告されます。
処理後に PDF の見た目は変わりますか。
変わりません。そこが肝心な点です。ページ画像は元のまま保たれ、認識された文字は不透明度ゼロで上に描かれます。見ているのは引き続き元のスキャンで、テキストレイヤーは検索欄とコピー操作のためだけに存在します。
DPI を上げてスキャンすると OCR の結果は良くなりますか。
たいていは良くなりません。試験では 100・150・200・300 DPI の精度が 0.5 ポイント以内で並び、300 DPI は 4 倍の時間がかかりました。下限はあり、72 DPI では精度が 79.3% まで落ちましたが、およそ 150 DPI を超えると時間を払って何も得られません。ページをまっすぐにするほうがはるかに効きます。
どのくらい時間がかかりますか。
標準的な A4 ページなら、一般的なノートパソコンで 1 ページあたり約 1 秒です。50 ページの文書で 1 分前後になります。スマートフォンはこれより遅くなります。複数言語を選ぶと作業量が倍増するので、実際に文書にある言語だけを選んでください。
ファイルはどこかにアップロードされますか。
されません。PDF はこのタブの中で開かれ処理され、サーバーに送られることはありません。このツールが行う唯一の通信は、選んだ言語の認識データの取得です。それは全員に同じファイルで、お客様のものは何も含みません。
「PDF テキスト変換」との違いは何ですか。
このページは画像の中の文字を推測して、スキャンから検索できる PDF を作ります。「PDF テキスト変換」はファイルにすでにある文字を、推測せずそのまま取り出します。PDF にテキストレイヤーがあるなら、そちらが目的に合っています。速いうえに、OCR が犯す種類の誤りをそもそも起こしません。
編集できる Word 文書にできますか。
このツールではできません。スキャンを Word ファイルにするには、段組み・表・見出しといったレイアウトを組み直す必要があり、それは固有の失敗の仕方を持つ別の仕事です。ここで得られるのは検索できるようにした元の PDF と、語だけが必要な場合のテキストのダウンロードです。

スキャンした PDF を検索できるように

無料、無制限、このタブの中で完結します。アップロードも登録もなく、そもそも OCR が不要なファイルならそう教えてくれます。

PDF に OCR をかける