PDFの中には、文字を選択できるものと、紙をスキャンした画像として保存されているものがあります。画像の文字を検索へ使うには、OCRなどで文字を抽出する工程が必要になります。たとえばGoogleのDocument AIには、文書から文字やレイアウトを取り出すOCR機能があります。Google CloudのOCR解説
ただし、文字が抽出できたことと、業務の意味が正しく検索できることは別です。表、脚注、読み取り順を確認してから使います。
最初にPDFの状態を分ける
一冊全体で判断せず、文字と画像が混在していないかも見ます。文字を選択できても、読み取る順序や文字コードが崩れている場合は、抽出結果の確認が必要です。
| 状態 | 先に確かめること |
|---|---|
| 通常の文章中心 | 段落と見出しの順序 |
| 二段組 | 左右の文章が交互に混ざらないか |
| 料金・条件の表 | 行、列、見出し、単位が対応するか |
| 注記が多い | 本文と例外条件の関係 |
| かすれ・傾きがある画像 | 再取得できる原本があるか |
手元のPDFで、文字を選択・検索・コピーする
OCRは、画像に写った文字を文字データへ変換する処理です。先にPDFを閲覧ソフトで開き、本文・表・スキャンした別紙をそれぞれ一か所ずつ試します。
- 本文の一文をマウスで選択する。
- 文書内検索(Ctrl+F、MacではCommand+F)で、目で確認できる単語を探す。
- 選択した一文をテキストエディタへ貼り付け、文字と順序を読む。
選択・検索・コピーができるページは、既存の文字情報を取り出して確認するところから始められます。画像だけのページはOCRを検討します。選択できても文字化けや検索漏れがある場合は、埋め込まれた文字情報、検索ソフト、表記の違いなどを調べます。検索に一度失敗しただけでPDFの破損とは断定できません。
閲覧ソフトが自動で文字認識する場合や、コピー権限が制限されたPDFもあります。別の閲覧方法での確認、作成元のファイルの有無、利用できる権限を確かめます。一部のページに文字があるだけで、文書全体を「OCR不要」と扱わないことがポイントです。
スキャンのかすれ、傾き、影が強いときは、読み取りを繰り返す前に、鮮明な原本や元の文書を入手できるか確認してください。
表と注記は原本と並べて照合する
架空の表に「標準:10件まで」「追加:別途相談」とある場合、文字だけを並べて「標準10件追加別途相談」とすると、どの条件がどの項目に対応するか曖昧になります。
表を文章や構造化したデータへ直す場合は、元の行列を保持し、単位や注記を付けます。AIが分かりやすく補った説明が、原本にない条件になっていないかを確かめます。
OCRの結果に数字が並んでいても、表の列や注記が崩れていれば誤った回答につながります。架空の料金表で「10」が読み取れても、単位が千円なのか万円なのか、税込なのか税抜なのかで意味が変わります。
| 原稿の特徴 | 照合する箇所 | 保留する例 |
|---|---|---|
| 表が複数ページに続く | 列名と続きの行、繰り返し見出し | 金額の列を特定できない |
| 欄外に注記がある | 適用条件と注記の参照記号 | 例外条件の文字が欠ける |
| 斜めのスキャンや薄い文字 | マイナス、桁、小数点 | 符号が判断できない |
| 旧版と新版が混在する | 文書名、版、適用日 | どちらが有効か不明 |
抽出結果には、元ファイルとページ番号を対応させます。数字・条件・否定表現を元画像と照合し、判読できない箇所は検索対象からの保留や再取り込みを検討します。OCRの認識率だけで運用可否を決めず、実際の質問への回答と根拠表示まで確認します。
検索用の質問で確認する
全文を目視で読むだけでなく、実際に聞きたい質問を作ります。「標準に含まれる件数は」「条件の例外は」「この数値の適用期間は」といった質問です。
答えが原本のどこにあるかを先に決め、検索結果と回答を照合します。OCRで文字が誤ったのか、検索で該当箇所が出ないのか、生成された回答で条件が落ちたのかを分けます。
修正候補を整理する指示
あなたはOCR結果の照合担当です。抽出文と原本の該当箇所を比べてください。
出力:資料名・ページ/原本の表記/抽出文/差分/確認する項目
固有名詞、数字、単位、表の見出し、注記を優先して並べます。
原本を確認できない箇所と読取不能は未確認として残し、推測で文字を埋めないでください。
利用するAIが原本の画像を扱えるかは環境によります。対応していない場合は、人が原本を確認し、必要な箇所を整理して渡します。
原本への戻り方を残す
抽出データには資料名、版、ページ、管理者を結び付けます。文章の並べ替えでページ情報が失われると、利用者が正しさを確かめにくくなります。
PDFを更新したときは、抽出データと検索先も更新し、旧版が残らないか確認します。OCRだけを一度実行して終えるのではなく、原本から回答までの関係を維持してください。資料採用の基本は社内検索の準備ガイドで確認できます。
PDFの取り込みから相談する場合は、社外共有できるサンプルと、答えを探したい質問を用意して社内資料の検索準備を相談できます。