業務文書の意味は、文章だけでなく、表の行と列、図と本文の対応、数式の記号の並びの中にあります。視覚的文書理解は、ページを「見る」ことで、その構造ごと知識として取り出す技術です。
文字を取り出しても、意味は取り出せない
設計資料、試験報告書、仕様書、論文。企業の技術文書には、表、グラフ、図面、数式、注記が同じ紙面に混在しています。重要な条件や結論は、文章よりも「この値はどの列の、どの条件の行にあるか」「この注記はどの図を指しているか」といった配置と対応関係の中に書かれていることが少なくありません。
従来の方法には、それぞれ限界があります。
| 従来の方法 | できること | 取りこぼすもの |
|---|---|---|
| PDFからのテキスト抽出 | 埋め込まれた文字列を高速に取り出す | 読み順、表のセル構造、数式の意味。PDFは見た目を再現する形式で、数式などの意味情報が失われやすいことが指摘されています(Blecher et al., 2023) |
| 従来型OCR | 画像の文字を一文字ずつ認識する | 表や図との対応関係。認識後に、ルール作りや人による確認が必要になる |
| ルールベースの帳票抽出 | 決まった様式から決まった項目を取る | 様式が変わると作り直しになる。自由なレイアウトの技術文書には向かない |
この状態で文書をRAG(社内文書を検索してAIが回答する仕組み)に入れると、表が一続きの文字列として分割され、「どの数値がどの条件の値か」が分からなくなります。検索では見つかっても、正しく答えられない原因になります。
仕組み
視覚的文書理解では、ページを画像として捉え、文字・位置・見た目の情報をあわせて解析します。研究分野では「ドキュメントAI」とも呼ばれ、文字と画像を一つのモデルで学習するLayoutLMv3(Huang et al., 2022)や、OCRを使わずに画像から直接内容を読み取るDonut(Kim et al., 2022)などの手法が知られています。
Technica AIでは、画像と文章をあわせて理解する生成AI(VLM)の柔軟さと、画像処理・レイアウト解析の安定性を組み合わせて、次の流れで処理します。
- レイアウト解析:ページを、見出し、本文、表、図、数式、キャプション、脚注などの領域に分けます。レイアウト解析は高品質な文書変換の前提とされ、約8万ページに11種類の領域を付与したDocLayNet(Pfitzmann et al., 2022)のような公開データセットも整備されています。
- 読み順と階層の復元:複数カラムやページをまたぐ段落をつなぎ、章・節・リストの階層を保ったまま並べ直します。
- 要素ごとの構造化:表はセル結合を含めてセル単位に、数式は記号の関係として(LaTeX形式でも)、図は本文中の参照やキャプションと対応づけて取り出します。
- 出典情報の保持:取り出したすべての要素に、元の文書・ページ・位置を記録します。
- ナレッジへの変換:RAGやナレッジグラフで使える単位に分割します。表や図が途中で切れないように分割します。
導入効果
-
検索して、正しく答えられる
表の値が、行と列の条件とセットで保持されるため、「条件Aのときの値は」という質問に、根拠となるセルを示して答えられます。
-
根拠をたどれる
回答に使った情報が、どの文書のどのページのどこにあるかを確認できます。専門家によるレビューや監査がしやすくなります。
-
後処理と手作業が減る
様式ごとの抽出ルールを作り込む手間や、OCR結果を人が整形し直す作業を減らせます。
-
過去の資料も使える
スキャンされた古い資料から最新のデジタル文書まで、同じ流れで知識にできます。
適用にあたって
- 手書きの図面や、解像度の低いスキャンでは、読み取り精度が下がることがあります。重要な数値は、出典位置を使って人が確認できる運用を推奨します。
- 業界特有の記号や表記がある場合は、評価用の文書で事前に精度を確認し、必要に応じて調整します。
関連する製品
-
AIKNOW Capture
視覚的文書理解を中核にした文書解析基盤(ドキュメントインテリジェンス)。
-
AIKNOW
取り込んだ文書ナレッジを検索・回答に使うナレッジ基盤。
参考文献
- Huang, Y. et al. (2022). LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking. arXiv:2204.08387. https://arxiv.org/abs/2204.08387
- Kim, G. et al. (2022). OCR-free Document Understanding Transformer (Donut). ECCV 2022. arXiv:2111.15664. https://arxiv.org/abs/2111.15664
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis. KDD 2022. arXiv:2206.01062. https://arxiv.org/abs/2206.01062
- Blecher, L. et al. (2023). Nougat: Neural Optical Understanding for Academic Documents. arXiv:2308.13418. https://arxiv.org/abs/2308.13418