申込書、点検記録、現場のメモ。紙と手書きは、今も多くの業務の入り口です。手書きAI-OCRは、文字の形だけでなく、記入欄の意味と前後の文脈を手がかりに、崩れた文字まで読み取ります。
日本語の手書きは、OCRにとって最も難しい領域の一つ
日本語の文章は、ひらがな、カタカナ、漢字、英数字が混在します。漢字だけでも、一般の社会生活で使う目安とされる常用漢字が2,136字あります(文化庁「常用漢字表」2010年)。人名や地名まで含めると、さらに多くの字種を扱う必要があります。加えて、手書きには次のような難しさがあります。
- 続け字や崩し方に、書き手ごとの大きな個人差がある
- 記入欄からのはみ出し、かすれ、訂正線、押印との重なりがある
- 「力」と「カ」、「口」と「ロ」のように、形だけでは区別できない文字がある
従来型のOCRは、文字を一つずつ切り出して、形の特徴から候補を選ぶ方式が中心でした。この方式では、続け字で文字の切れ目を誤ると、以降の認識が連鎖的に崩れます。形の区別がつかない文字は、前後の文脈がなければ判断できません。
視覚と言語をあわせて扱う最新のAIモデルでも、日本語、とりわけ漢字の認識は依然として大きな課題とされています(Maeda & Okazaki, 2026)。一方、認識結果を言語モデルで補正すると、帳票上の会社名の読み取り精度が85.4%から94.8%に向上したという報告もあります(Fujitake, 2024)。形の認識と文脈の理解を組み合わせることが、実用精度への鍵になります。
仕組み
手書きAI-OCRは、文字を一つずつ認識するのではなく、VLM(画像と文章をあわせて理解するAIモデル)で、行や記入欄の単位で前後の文脈ごと読み取ります。
- 帳票の構造を理解する:記入欄の位置と項目名(氏名、住所、日付、数量など)を読み取り、「この欄には何が書かれるはずか」を把握します。
- 文脈ごと読み取る:文字列を一続きで読み、崩れた文字や区別しにくい文字を、周囲の文字や項目の意味から推定します。
- 項目ごとに検証する:日付や数値の形式、郵便番号と住所の対応、マスタとの照合など、項目の性質に合わせて結果を検証します。
- 確信度を付けて返す:読み取り結果ごとに確信度を出し、低いものだけを人の確認に回します。
- 処理量に合わせて動かす:実運用の処理量を想定して、処理速度とコストを設計します。
導入効果
-
入力作業を減らせる
手入力やダブルチェックの工数を、確認が必要な箇所だけに絞り込めます。
-
様式が変わっても使える
記入欄の意味をAIが理解するため、帳票ごとに読み取り位置を細かく設定し直す手間を減らせます。
-
紙の情報を知識にできる
点検記録や現場メモなど、これまで検索できなかった手書きの記録を、データとしてRAGや分析に使えます。
適用にあたって
- 手書き認識の精度は、書き手、紙の状態、記入欄の設計に大きく左右されます。導入前に、貴社の実際の帳票で精度を評価することを推奨します。
- 誤りが許されない項目(金額、口座番号など)は、確信度にもとづく人の確認と組み合わせた運用を前提とします。
関連する製品
-
AIKNOW Capture
手書きを含む文書を、構造を保ったままナレッジに変換します。
参考文献
- 文化庁(2010)「常用漢字表」(平成22年内閣告示第2号). https://www.bunka.go.jp/kokugo_nihongo/sisaku/joho/joho/kijun/naikaku/pdf/joyokanjihyo_20101130.pdf
- Maeda, K. & Okazaki, N. (2026). JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding. arXiv:2603.27942. https://arxiv.org/abs/2603.27942
- Fujitake, M. (2024). JaPOC: Japanese Post-OCR Correction Benchmark using Vouchers. arXiv:2409.19948. https://arxiv.org/abs/2409.19948
- Kim, G. et al. (2022). OCR-free Document Understanding Transformer. arXiv:2111.15664. https://arxiv.org/abs/2111.15664