Perception · Visual Document Understanding

視覚的文書理解

図・表・数式まで、構造として読む。

業務文書の意味は、文章だけでなく、表の行と列、図と本文の対応、数式の記号の並びの中にあります。視覚的文書理解は、ページを「見る」ことで、その構造ごと知識として取り出す技術です。

Why It Matters

文字を取り出しても、意味は取り出せない

設計資料、試験報告書、仕様書、論文。企業の技術文書には、表、グラフ、図面、数式、注記が同じ紙面に混在しています。重要な条件や結論は、文章よりも「この値はどの列の、どの条件の行にあるか」「この注記はどの図を指しているか」といった配置と対応関係の中に書かれていることが少なくありません。

従来の方法には、それぞれ限界があります。

従来の方法できること取りこぼすもの
PDFからのテキスト抽出埋め込まれた文字列を高速に取り出す読み順、表のセル構造、数式の意味。PDFは見た目を再現する形式で、数式などの意味情報が失われやすいことが指摘されています(Blecher et al., 2023)
従来型OCR画像の文字を一文字ずつ認識する表や図との対応関係。認識後に、ルール作りや人による確認が必要になる
ルールベースの帳票抽出決まった様式から決まった項目を取る様式が変わると作り直しになる。自由なレイアウトの技術文書には向かない

この状態で文書をRAG(社内文書を検索してAIが回答する仕組み)に入れると、表が一続きの文字列として分割され、「どの数値がどの条件の値か」が分からなくなります。検索では見つかっても、正しく答えられない原因になります。

How It Works

仕組み

視覚的文書理解では、ページを画像として捉え、文字・位置・見た目の情報をあわせて解析します。研究分野では「ドキュメントAI」とも呼ばれ、文字と画像を一つのモデルで学習するLayoutLMv3(Huang et al., 2022)や、OCRを使わずに画像から直接内容を読み取るDonut(Kim et al., 2022)などの手法が知られています。

従来のテキスト抽出やOCRは、PDFや画像を一続きの文字列にするため、表や数式の構造が失われる。視覚的文書理解は、ページを画像として捉えてレイアウトを解析し、表・数式・図を要素ごとに構造化して、出典つきのナレッジにする。CONVENTIONALテキスト抽出・従来型OCRPDF・画像文字を取り出す一続きの文字列表・数式の構造が消える検索・回答条件と値の対応が不明VISUAL DOCUMENT UNDERSTANDINGページを「見て」構造ごと読むページ画像レイアウト解析見出し・表・図・数式要素ごとに構造化セル・LaTeX・図の対応出典つきナレッジページと位置を保持
テキスト抽出・従来型OCRと、視覚的文書理解の違い(概念図)

Technica AIでは、画像と文章をあわせて理解する生成AI(VLM)の柔軟さと、画像処理・レイアウト解析の安定性を組み合わせて、次の流れで処理します。

  1. レイアウト解析:ページを、見出し、本文、表、図、数式、キャプション、脚注などの領域に分けます。レイアウト解析は高品質な文書変換の前提とされ、約8万ページに11種類の領域を付与したDocLayNet(Pfitzmann et al., 2022)のような公開データセットも整備されています。
  2. 読み順と階層の復元:複数カラムやページをまたぐ段落をつなぎ、章・節・リストの階層を保ったまま並べ直します。
  3. 要素ごとの構造化:表はセル結合を含めてセル単位に、数式は記号の関係として(LaTeX形式でも)、図は本文中の参照やキャプションと対応づけて取り出します。
  4. 出典情報の保持:取り出したすべての要素に、元の文書・ページ・位置を記録します。
  5. ナレッジへの変換:RAGやナレッジグラフで使える単位に分割します。表や図が途中で切れないように分割します。
Benefits

導入効果

  • 検索して、正しく答えられる

    表の値が、行と列の条件とセットで保持されるため、「条件Aのときの値は」という質問に、根拠となるセルを示して答えられます。

  • 根拠をたどれる

    回答に使った情報が、どの文書のどのページのどこにあるかを確認できます。専門家によるレビューや監査がしやすくなります。

  • 後処理と手作業が減る

    様式ごとの抽出ルールを作り込む手間や、OCR結果を人が整形し直す作業を減らせます。

  • 過去の資料も使える

    スキャンされた古い資料から最新のデジタル文書まで、同じ流れで知識にできます。

Considerations

適用にあたって

  • 手書きの図面や、解像度の低いスキャンでは、読み取り精度が下がることがあります。重要な数値は、出典位置を使って人が確認できる運用を推奨します。
  • 業界特有の記号や表記がある場合は、評価用の文書で事前に精度を確認し、必要に応じて調整します。
Related Products

関連する製品

  • AIKNOW Capture

    視覚的文書理解を中核にした文書解析基盤(ドキュメントインテリジェンス)。

  • AIKNOW

    取り込んだ文書ナレッジを検索・回答に使うナレッジ基盤。

References

参考文献

Let's Talk

技術の詳細について、
エンジニアが直接お答えします。

評価用の検証環境、ベンチマークの条件、オンプレミス構成の要件。
導入前に確認したい技術的な論点があれば、ご相談ください。