PDF OCR
スキャンした PDF を、検索できる PDF に変えます。このタブの中だけで完結し、アカウントもアップロードもページ数の上限もありません。
スキャンした PDF をここにドロップ、またはクリックして選択
100 MB まで · アップロードは一切ありません
- 100% ブラウザ内
- アップロードなし
- 登録なしでダウンロード
- ページ数の制限なし
スキャンした PDF に OCR が必要な理由
スキャンした PDF は写真の束です。人の目には問題なく読めますが、コンピューターから見れば、そのページにあるのは色のついた点だけです。Ctrl+F では何も見つかりません。一行もコピーできません。索引にも載らないので、あとでどう検索しても出てきません。
OCR(光学文字認識)は、それを変える工程です。各ページの形を見て、それがどの文字かを判断し、その文字を画像の下に置かれた見えない層としてファイルに書き込みます。OCR をかけた PDF は見た目がまったく同じで、違いは下に文字があることだけです。
効いてくるのはたいてい数か月後です。スキャンした契約書、請求書、レシート、本の 1 ページ。覚えているのは一文だけで、あとは忘れている。検索できる PDF はその一文を返してくれます。写真の束は返してくれません。
この PDF OCR ツールはすべてブラウザ内で動きます。ファイルはアップロードされず、アカウントもなく、ページ数の上限もありません。この検索語でお客様より上位にあるページは、無料で処理したうえで、返す前にサインインを求めてきます。
PDF の OCR とは何か
PDF の OCR とは、その中にあるページ画像に文字認識をかけ、認識された語を見えないテキストレイヤーとして同じファイルに書き戻すことです。文書の見た目は変わらないまま、検索・選択・コピーができるようになります。
画面上では見分けのつかない 2 種類の PDF があります。ひとつはワープロから書き出されたもので本物の文字を持ち、もうひとつはスキャナーやスマートフォンのカメラから来たもので文字の画像を持ちます。OCR が必要なのは後者だけです。
ツールを使わずに見分ける早道があります。マウスで一行を選択してみてください。青い選択範囲が文字に沿って伸びれば、文字はすでにそこにあります。ページ全体がひとつの塊として選択される、あるいは何も起きないなら、それはスキャンした PDF です。
このツールは、何かを実行する前にその確認を代わりに行います。すでにテキストレイヤーがあれば、そう伝えたうえでテキストの抽出をお勧めします。OCR は正確なものをおおよそのものに置き換えてしまい、しかもページの見た目はどちらでも同じなので、あとから気づく手立てがないからです。
OCR が作る文字はページ画像の下に置かれ、上ではありません。だから検索できる PDF は依然としてスキャンのように見えます。見ているのは常に元の画像です。見えない層は、検索欄とコピー操作、そしてファイルを索引するものだけのために存在します。
その層が何であるかは、はっきり述べておく価値があります。それは推測です。きれいな印刷ならとても良い推測、しわの寄ったレシートを斜めから撮ったものなら悪い推測になります。見えている画像は常に正しく、その下の文字はそうとは限りません。
PDF に OCR をかける 4 つの手順
すべてこのブラウザタブの中で行われます。ファイルは端末から出ず、結果をダウンロードする前にアカウントを求められることもありません。
スキャンした PDF を入れる
上の枠にファイルをドラッグするか、クリックして選びます。100 MB までなら問題ありません。どこにも送信されません。ファイルを開くのは、お客様のブラウザ上にあるこのページです。
判定を読む
ツールは作業前に各ページを調べ、テキストレイヤーの有無を確認します。そのうえで、この PDF に OCR が必要か、一部のページだけ必要か、まったく不要かをお伝えします。一部のページだけがスキャンの場合、残りは既定でそのまま手を触れません。
文書の言語を選ぶ
精度はこの選択に最も強く左右されます。この画面の言語ではなく、文書が書かれている言語を選んでください。言語データのダウンロードは一度だけで、英語は約 5.2 MB、ヒンディー語は約 1.7 MB、その後はキャッシュされます。複数選択もできますが、1 ページごとに遅くなります。
実行して結果を確かめる
ページは 1 枚ずつ処理され、読み取り中のページのプレビューが表示されるので、取り違えていたら早い段階で止められます。終わったらプレビューで文字を選択してみてください。そのうえで検索できる PDF を、文字だけでよければテキストをダウンロードします。
文字だけが必要な場合 PDF ではなく文字が欲しくて、ファイルにすでにテキストレイヤーがあるなら、推測を一切挟まない速い方法があります。 PDF から直接テキストを抽出する.
この PDF OCR ツールができること
テキストレイヤーを足すだけで、ほかは何も変えません。元のページはそのまま残ります。画像も解像度もページ枠も同じです。認識された語は不透明度ゼロで上に描かれるため、選択も検索もできますが、目には見えません。元から文字があったページは一切書き換えません。
ページの描画は 150 DPI で行います。これは既定値ではなく、測った結果です。あるテスト文書では、100・150・200・300 DPI の精度は 0.5 ポイント以内で並び、300 DPI は 4 倍の時間がかかりました。100 DPI を下回ると崖があり、72 DPI では精度が 95.6% から 79.3% に落ちました。600 DPI でスキャンしても OCR は正確になりません。遅くなるだけです。
100 を超える言語に対応し、多くの変換ツールが飛ばす文字体系も含みます。よく知られたオンライン OCR ツールのひとつは 19 言語を挙げていますが、その中に南アジアの文字はひとつもありません。ここではヒンディー語・タミル語・ベンガル語が一覧にあり、しかも上のほうにあります。この語を検索する人の多くが実際にそこにいるからです。
できなかったことを数えます。あるページが文字なしで返ってきた場合(白紙、写真、手書きなど)、そのページは手つかずのままファイルに残り、その旨が報告されます。黙って捨てられるものはありません。
サインインを求めることは一度もありません。400 ページの文書を処理し、続けてもう 1 本処理できます。1 日あたりの上限はありません。作業をしているサーバーが存在せず、したがって配給すべきものがないからです。
PDF の OCR はこんなときに使われます。
- スキャンした契約書を保管する前に検索できるようにする
- 1 ページずつ撮影した本の章から、目当ての一行を探し出す
- スキャンした請求書のフォルダーを、ひと通り検索できるものに変える
- PDF で届いた FAX やコピーから文字を取り出す
- 古いスキャン資料を、記憶ではなく検索で見つけられるようにする
- 検索インデックスや別のツールが読めるようスキャンを整える
- スキャンから段落を打ち直さずにコピーする
どの端末でも使えます
インストールするものはありません。OCR はもともとお使いのブラウザで動くので、同じツールがどこでも使え、ファイルは始まった端末から動きません。
Windows
Chrome、Edge、Firefox で動きます。ダウンロードは不要で、スキャンを検索可能にするために Acrobat の契約も要りません。
Mac
Safari または Chrome。プレビューはスキャン PDF を表示できますが、テキストレイヤーを足すことはできません。
iPhone・iPad
Safari で動きます。撮ったばかりの写真がスキャン代わりのときに便利ですが、まさにその場合こそページをまっすぐにすることが効きます。
Android
Chrome で動きます。長い文書は時間がかかり端末を使い続けるので、先に電源につないでください。
Chromebook
相性が良い環境です。インストール型のアプリではなく、すべてブラウザ内でローカルに動くためです。
Linux
最近のブラウザであれば動きます。パッケージもコマンドラインも順番待ちもありません。
OCR が当たるところ、外すところ
どの OCR ツールも間違えますが、その間違いがどんな形をしているかを教えてくれるものはほとんどありません。実際の結果をお見せします。コンピューターで生成したきれいな請求書、ノイズも傾きもなし、全体の文字単位精度は 95.6%。そこから抜き出した 12 語のうち、検索で見つかったのは 5 語でした。
| 文書では | OCR の読み | 理由 |
|---|---|---|
| Northwind | Northwind | プロポーショナル書体の普通の文章は、いちばん易しい場合です。 |
| 2089.80 | 2089. 80 | 数字の途中に空白が入り、合計を検索しても見つかりません。 |
| INV-2026-04471 | INV2026-04471 | ハイフンがひとつ落ちました。参照番号はとりわけ壊れやすい部類です。 |
| Replacement | Repl acenent | m が n と読まれ、さらに存在しない空白が入りました。 |
| Payment is | Paymentis | 逆向きの失敗で、本物の空白が消えました。 |
| 1741.50 | 1741.50 | 上の合計と同じ表、同じ書体、同じ形式なのに、こちらは正しく読めました。誤りは予測できません。 |
スキャンを本当に台無しにするもの
圧縮でも解像度でもありません。品質 60 の JPEG は、可逆の描画とコンマ以下の差しかありませんでした。効いたのは傾きです。2 度傾いたページは問題ありませんでしたが、7 度では精度が 9.5 ポイント下がり、確信度は 91 から 74 に落ちました。何かをスキャンするなら、まっすぐ置いてください。DPI を上げる手間は要りません。
検索できる PDF、テキスト、それとも Word ファイル?
検索できる PDF は、このページが作るものです。元のスキャンに見えないテキストレイヤーが加わり、PDF のままです。テキストはレイアウトを捨てた語だけで、どこかに貼りたいときに便利なので、2 つ目のダウンロードとして用意しています。編集できる Word 文書はレイアウトを組み直す別の仕事で、このツールは行いません。PDF にすでに文字があり、語だけが必要なら、OCR は飛ばして直接抽出してください。
スキャンはこのブラウザから出ません
ここに置かれた PDF は、このページが開き、お客様自身のプロセッサが読み、お客様自身のブラウザが書き戻します。アップロードされず、サーバーの待ち行列にも入らず、保持期間のあいだどこかに置かれることもありません。そもそも作業にサーバーが関与していないからです。
これは多くの変換よりも OCR で重みを持ちます。検索できるようにしたい文書は、契約書、診療記録、取引明細、身分証明書といったもの、つまり原本を残す価値があったからこそ存在するスキャンです。主要なオンライン OCR サービスはいずれも自社の機械で処理し、通常 1 〜 8 時間後に予定どおり削除します。
配給すべきものがない、という意味でもあります。自社のハードウェアで処理するサービスは無料利用を制限せざるを得ず、だからこそ 1 日 2 件、1 ファイル 10 ページといった上限が置かれます。ここでは作業がお客様の端末で行われるため、課すべき上限も、集めるべき登録情報もありません。
アップロードはありません
ファイルはローカルで読まれます。どのサーバーにも複製は作られません。
アカウントは不要です
結果をダウンロードするのにサインインは求められません。よそでは、それが無料 OCR の通常の代価です。
ページ数・ファイル数の制限なし
400 ページのスキャンを処理し、続けてもう 1 本。1 日の割り当てはありません。
言語データだけ
ダウンロードされるのは、選んだ言語の認識データだけです。お客様の文書がその通信に含まれることはありません。