Allin PDF PDF万能王
技術解説 · 7 分

OCRの仕組み:画像やスキャンPDFからテキストを抽出する方法(2026年ガイド)

OCR(光学文字認識)技術が画像やスキャン文書を編集可能なテキストに変換する仕組みを解説。AI OCRエンジンと従来のTesseractベースのローカル処理を精度と適用シーンの観点から比較。

要点

  • ✓OCRとは:光学文字認識はテキストの画像(写真、スキャン)を機械可読で編集可能なテキストデータに変換する技術。
  • ✓デュアルエンジン:Allin PDFは最高精度のAIクラウドOCR(Gemini/GPT-4o/Claude)を使用し、オフライン/プライバシー用途にはローカルTesseract.jsに自動フォールバック。
  • ✓言語サポート:日本語、中国語、韓国語、英語、ヨーロッパ言語など100以上の言語を同時認識可能。
  • ✓精度:AIエンジンは印刷テキストで95%以上の精度;ローカルエンジンは高解像度スキャンで85-90%。

OCR(光学文字認識)とは?

OCRはテキストを含む画像(写真、スキャン文書、スクリーンショット、PDF)を分析し、視覚的なテキストを機械可読な文字データに変換する技術です。出力は編集可能なテキストで、コピー、検索、他のソフトウェアで処理が可能です。OCRなしではスキャン文書はただの画像;OCRがあれば使用可能なデジタルテキストになります。

光学文字認識(OCR)
パターン認識と機械学習を使用して画像内のテキスト文字を識別し、テキストの視覚的表現をエンコードされたデジタルテキストに変換する技術。最新のOCRは複数のフォント、言語、レイアウトを同時に処理し、ソース品質に応じて90-99%の精度を達成。

OCR処理の流れ:ステップバイステップ

  1. 画像前処理:グレースケール変換、コントラスト調整、ノイズ除去、傾き/回転補正、二値化(純粋な白黒に変換)。
  2. レイアウト分析:テキスト領域の検出、段組み・段落・テキスト行の識別。テキストを画像、表、装飾要素から分離。
  3. 文字分割:テキスト行を個々の文字または文字グループに分解。連結文字と可変間隔を処理。
  4. 文字認識:各文字をトレーニング済みパターン/モデルと比較。AI OCRはニューラルネットワークを使用;従来のOCRはテンプレートマッチングを使用。
  5. 後処理:言語モデルと辞書を適用して認識エラーを修正。よくある誤認識(0 vs O、1 vs lなど)を修正。
  6. 出力生成:編集可能なテキストを生成。オプションで検索可能PDFや構造化文書出力のために位置データを保持。

AI OCR vs 従来のOCR比較

観点AI OCR(Gemini/GPT-4)従来のOCR(Tesseract)
印刷テキスト精度95-99%85-95%
手書きテキスト70-85%(文脈認識)40-60%(限定的)
多言語混在優秀(自動検出)良好(言語選択が必要)
複雑なレイアウト表、段組み、帳票に対応非線形レイアウトに弱い
処理場所クラウド(インターネット必要)ローカル(ブラウザ、オフライン可能)
速度2-5秒/ページ(ネットワーク依存)1-3秒/ページ(CPU依存)
プライバシー画像をクラウドサーバーに送信完全にデバイス上で処理
コストAPIコスト(Proに含む)無料(オープンソース)
重要な違い:AI OCR(Gemini/GPT-4o/Claudeなど)は文脈を理解します——スキャンがぼやけていても「田中先生」を正しく読み取れます。「田中」が名前で「先生」が敬称であることを理解しているからです。従来のOCRはピクセルパターンだけを見るため、同じぼやけたテキストでは間違いやすいです。

Allin PDFのデュアルエンジンOCR戦略

Allin PDFはスマートなデュアルエンジン戦略を採用:

  1. メイン:AIクラウドエンジン(Gemini/GPT-4o/Claude)——インターネット接続時に使用。スキャンページをGeminiのマルチモーダルAPIに送信し、文脈を理解した「読解」を実行。手書き、低品質スキャン、複雑なレイアウトに最適。
  2. フォールバック:ローカルエンジン(Tesseract.js)——クラウドが利用不可の場合に自動起動。WebAssemblyを介してブラウザ内で完全に実行。プライバシーが重要な文書やオフライン使用に最適。初回使用時のみ言語パックのダウンロードが必要。

最良のOCR精度を得るためのコツ

よくある質問

OCRは手書き文字を認識できますか?

AIエンジン(Gemini)は読みやすい手書きを70-85%の精度で認識できます。ローカルTesseractエンジンは主に印刷テキスト向けに設計されており、手書きサポートは非常に限定的(40-60%)です。最良の手書き認識にはAIエンジンをご使用ください。

OCRは元のフォーマットを保持しますか?

OCRはテキストコンテンツを抽出しますが、フォーマットは保持しません。出力はプレーンテキスト(またはシンプルな段落)です。視覚的レイアウトを保持したい場合は、代わりにPDF→Word変換をご使用ください。OCRは生のテキストコンテンツだけが必要な場合に最適です。

なぜローカルエンジンは言語パックのダウンロードが必要ですか?

Tesseractの各言語のトレーニング済みモデルは1-15MBのサイズです。アプリの初回ロードを高速に保つため、言語パックは最初に言語を選択した時にオンデマンドでダウンロードされます。一度ダウンロードするとキャッシュされ、以降はオフラインでも利用可能です。

関連ツール

OCR文字認識

画像やスキャンPDFからテキストを抽出。

PDF→Word変換

フォーマットを保持してPDFを編集可能なWordに。

AI文書復元

スキャン文書から手書きを除去。