DOCUMENT INTELLIGENCE

技術文書を、
「読む」から「理解する」へ。

複雑な技術文書を、AIが使えるナレッジへ変換する文書解析基盤(ドキュメントインテリジェンス)

表・グラフ・設計図・数式まで含む技術文書を、画像と文章をあわせて理解する生成AI(VLM)と、画像処理・レイアウト解析を組み合わせて解析します。文字の読み取りにとどまらず、意味を持つナレッジへ変換します。

Challenges

技術文書は、「文字」だけでは理解できない。

設計資料、技術レポート、論文、仕様書などには、文章以外にも重要な情報が含まれています。

01

表・グラフ・数式に意味が埋め込まれている

重要な結論や条件が、文章ではなく、表の構造、グラフの変化、数式、図中の関係として表現されていることがあります。

テキスト抽出だけでは、その意味を正しく捉えることはできません。

02

従来OCRでは、複雑な文書理解が難しい

従来のOCRは「文字を認識する」ことを中心に設計されています。

複雑なレイアウトや複数の情報形式を持つ技術資料では、認識後に追加のルール処理や人による確認が必要になります。

03

デジタル化しても、ナレッジにはならない

PDFや画像をテキスト化しただけでは、文書構造や情報同士の関係が失われます。

そのままではRAGや生成AIから正確に利用することが困難です。

技術知識が大量の文書に埋もれ、エンジニアが必要な情報を手作業で探している。文書管理システム(DMS)も、ファイルの保管とキーワード検索にとどまっている。こうした状況も、よく見られる課題です。

Complex Document Understanding

複雑な技術文書を、ページ全体の「意味」まで理解

技術文書は、文字の集まりではありません。
ページの構造と、要素どうしの関係まで理解して初めて、そこに含まれる知識を正しく活用できます。
AIKNOW Captureは、ページ全体を一つの文書として統合的に解析します。

Complex Layout

複雑なレイアウトを理解

報告書や学術文書の見出し、複数カラム、注釈などを認識します。

単純に文字を並べるのではなく、ページ本来の読み順と情報構造を捉えます。

Cross-Page Context

ページをまたぐ論理のつながりを保持

複数カラムや複数ページに分断された文章でも、前後の関係を保持しながら読み取ります。

ページ単位ではなく、文書全体の文脈として理解します。

Document Structure

文書構造を認識

章・節・リスト・引用・脚注などを把握し、それぞれの階層関係を保持したままデータを整理します。

Tables & Formulas

複雑な表・数式まで解析

セル結合やチェックボックスを含む複雑な表を理解します。

数学・物理・化学などの数式を抽出し、LaTeX形式でも出力できます。

Multimodal Content

テキストだけでなく、図・画像・設計図まで

文章以外に含まれる情報も、同じページの一部として解析します。

かすれや傾きのある画像内の文字についても、OCR処理と組み合わせて認識します。

Multiple File Formats

多様なファイル形式に対応

PDF、Word、Excelなど、多様な形式の文書に対応します。

過去に蓄積された資料から最新のデジタル文書まで、企業内の情報資産を活用できます。

Document Intelligence

文字を読むOCRから、
文書を理解するドキュメントインテリジェンスへ。

従来のOCRが目指すのは、文字の読み取りです。AIKNOW Captureが目指すのは、文書をナレッジに変えることです。

Conventional OCR

文字を読む

文書 文字認識 テキスト

文字を読み取ることがゴールです。

一文字ずつ正確に読めても、表の行と列の関係、グラフが示す傾向、図と本文の対応、ページをまたぐ文脈は失われます。

失われた意味の復元は、後工程のルール作成や人による確認に委ねられます。

AIKNOW Capture

文書を理解する

文書 視覚理解 構造理解 意味解釈 ナレッジ

文字・表・図の意味と、要素どうしの関係までを読み取ります。

GenAI

VLMの理解力

画像と言葉を同時に扱い、テンプレートや個別ルールに頼らず、多様な文書を読み解きます。

Engineering

文書処理技術

画像補正・レイアウト調整などの前処理と、照合・補正・信頼度評価などの後処理で、VLMだけでは安定しない数値・固有名詞・整合性を補います。

Processing Pipeline

文書を、そのままAIが使えるナレッジへ

前処理から構造化までの5つの工程で、精度・速度・安定性を確保します。

AIKNOW Capture の文書処理パイプライン。Document / PDF / Scan(技術文書の入力)→ Image & Layout Preprocessing(画像補正・レイアウト調整・OCR最適化)→ Multimodal Understanding(テキスト・表・グラフ・画像を統合的に処理)→ Semantic Interpretation(章立ての識別、重要情報の抽出、文書の意味理解)→ Validation & Correction(ルールと参照データによる検証・補正)→ Confidence & Structuring(信頼度の評価と構造化)→ AI-Ready Knowledge。出力は RAG、Knowledge Graph、AI Agent、Enterprise Search へ接続されます。

← 横にスクロールできます →

Core Capabilities

複雑な文書を理解するための技術

Multimodal Document Understanding

テキスト以外の情報も理解

文章以外の形で表現された情報も、文書の一部として統合的に解析します。

VLM-Powered Recognition

生成AIによる柔軟な文書理解

固定テンプレートなしで、形式の異なる文書を解析します。

Japanese Document Processing

日本語文書に対応

日本語の文書を前提に、OCR・VLM・前後処理を組み合わせて認識の仕組みを組んでいます。

日本語の業務資料や技術資料をナレッジとして活用できる形へ変換します。

Pre & Post Processing

VLMだけに頼らず、精度を高める前後処理

画像補正・位置調整から、照合・信頼度評価までを行います。

High-Speed Processing

GPUによる高速な文書処理

認識処理をGPU上で実行し、前処理や照合、信頼度算出などの処理をCPU側で並行して実行します。

文書処理全体のスループットを高めます。

AI-Ready Structuring

RAGで使える形に構造化

単なるOCRテキストではなく、文書の構造と意味を保持したデータへ変換します。

RAG、ナレッジグラフ、生成AIなどのナレッジ基盤へ接続できます。

Technology Performance

より少ないインフラで、より大量の文書をナレッジへ。

VLMとGPUを組み合わせた処理構成により、当社の検証では、参照方式と比べてサーバー1台あたりの処理性能が約30倍になりました(条件は下記)。

Reference Benchmark pages / sec / server
参照方式 Conventional
0.051
AIKNOW Capture Technology GenAI + GPU
1.539

約30倍 の処理スループット

1台あたりのページ処理性能での比較値です。

※当社検証環境における参考値です。両方式では実行多重度などの条件が異なるため、比較可能な指標は主に1台あたりのページ処理性能です。認識サーバー構成についても、参照方式の36台に対し、検証構成では4台という結果が示されています。

Use Cases

企業に蓄積された技術文書を、活用できるナレッジへ

Engineering Knowledge

設計・技術資料

過去の設計資料、仕様書、検証レポートなどを解析し、エンジニアが必要な技術情報を検索・再利用できるナレッジベースを構築します。

Technical Papers

論文・研究資料

図表や数式を多く含む学術・技術文書を解析します。

研究結果や技術情報を横断的に活用できます。

Manuals & Specifications

マニュアル・仕様書

複雑な章構造、表、図を含む製品マニュアルや仕様書を構造化します。

RAGやAIアシスタントから利用できるナレッジへ変換します。

Legacy Documents

過去文書・スキャン資料

紙文書やスキャンされた過去資料を単にデジタル化するのではなく、その内容を検索・分析・再利用できる企業ナレッジへ変えます。

From Document to Knowledge

文書は、保存するデータから、
AIが理解できるナレッジへ。

AIKNOW Captureが、複雑な文書に埋め込まれた情報を読み取り、理解し、構造化します。
企業の文書を、検索・分析・推論・再利用できるナレッジへ。

AIKNOW Captureについて相談する