Perception · Speech Intelligence

音声インテリジェンス

会話を、文脈ごと構造化する。

誰が、どの話題について、どんな温度で話したのか。音声インテリジェンスは、文字起こしの先にある会話の流れそのものを、知識として引ける形に整えます。

Why It Matters

文字起こしだけでは、会話は使えない

音声認識の精度は、この数年で大きく向上しました。68万時間の多言語音声で学習したWhisper(Radford et al., 2022)のように、さまざまな環境で頑健に動くモデルも公開されています。それでも、文字起こしの結果を業務で使おうとすると、次の壁に当たります。

  • 誰の発言か分からない:顧客とオペレーター、会議の参加者ごとの発言が一続きになり、「誰が約束したのか」が追えません。
  • 長すぎて使えない:1時間の会議は数万字になります。そのままでは読めず、RAGで検索しても関係のない部分まで拾います。
  • 日本語特有の誤認識が残る:同音異義語、専門用語、固有名詞、数字は、音だけでは判断できず、文脈がないと誤りやすくなります。
  • 温度感が消える:同じ「分かりました」でも、納得なのか不満なのかは、文字だけでは分かりません。
  • 個人情報が含まれる:氏名、電話番号、住所などが含まれたままでは、社内で安全に共有できません。
How It Works

仕組み

音声インテリジェンスは、次の処理を一続きのパイプラインとして実行し、通話や会議を「検索できる単位」に分解します。

従来の音声認識は音声を一続きの文字起こしにするため、誰が何を話したかが分からない。音声インテリジェンスは、文脈を踏まえた文字起こし、話者と話題による分割、要約・感情の推定・個人情報のマスキングを一続きで処理し、検索できる会話データにする。SPEECH TO TEXT音を文字にするだけ音声文字起こし長い一続きのテキスト誰が・何を、が不明SPEECH INTELLIGENCE会話の流れを構造にする音声文脈を踏まえた文字起こし話者・話題で分割要約・感情・マスキング検索できる会話データ
文字起こしと、音声インテリジェンスの違い(概念図)
  1. 文脈を踏まえた文字起こし:長い会話の文脈を保持したまま音声を文字にし、生成AIで同音異義語や専門用語の誤りを補正します。フィラー(「えー」「あのー」)も整理します。
  2. 話者分離:「誰が、いつ話したか」を推定し、発話ごとに話者を割り当てます。話者分離は音声処理の中でも研究の進んだ分野で、深層学習によって大きく進歩しています(Park et al., 2022)。
  3. 話題の切り替わりの検出:固定の文字数ではなく、話題や意味のまとまりで会話を区切ります。
  4. 要約と要点の抽出:話題ごとに要約し、決定事項、アクションアイテム、担当者、期限などを取り出します。
  5. 感情の推定:言葉の内容と、声の調子などの音響的な手がかりを組み合わせて、発話の感情を推定します。会話の感情認識では、テキストだけでなく音声などの複数の手がかりを使うことが重要とされています(Wu et al., 2025)。
  6. 個人情報のマスキング:住所、電話番号、カード番号などを検出し、マスキングします。

各処理の結果は、話者、時刻、話題、感情のラベルが付いたデータとして保存され、RAG、ナレッジグラフ、会話分析にそのまま使えます。

Benefits

導入効果

  • 会話を検索できる

    「先月、解約理由として価格を挙げた通話」のように、話題や話者、感情で絞り込んで過去の会話を探せます。

  • 記録と共有の手間が減る

    議事録や応対記録の作成、要点の共有にかかる時間を減らせます。

  • 応対品質を振り返れる

    感情の変化や話題の流れから、クレームの兆候や、うまくいった応対のパターンを見つけられます。

  • 安全に共有できる

    個人情報をマスキングした状態で、社内のナレッジとして活用できます。

Considerations

適用にあたって

  • 録音の品質(マイク、雑音、話者の重なり)は精度に直結します。とくに複数の人が同時に話す区間は、話者分離の誤りが起きやすくなります。
  • 感情の推定は、判断材料の一つとして扱います。人事評価など、個人に不利益が生じうる用途には使わない運用を推奨します。
  • 通話や会議の録音・利用については、事前の告知や同意など、社内規程と法令に沿った運用が必要です。
Related Products

関連する製品

  • AIKNOW Voice

    音声インテリジェンスを中核にした、音声のナレッジ化基盤。

  • AIKNOW Answer

    通話ログから、SOPに書かれていない応対パターンを抽出して改善に使います。

References

参考文献

  • Radford, A. et al. (2022). Robust Speech Recognition via Large-Scale Weak Supervision (Whisper). arXiv:2212.04356. https://arxiv.org/abs/2212.04356
  • Park, T. J. et al. (2022). A Review of Speaker Diarization: Recent Advances with Deep Learning. Computer Speech & Language, 72. arXiv:2101.09624. https://arxiv.org/abs/2101.09624
  • Wu, C. et al. (2025). Multimodal Emotion Recognition in Conversations: A Survey of Methods, Trends, Challenges and Prospects. Findings of EMNLP 2025. arXiv:2505.20511. https://arxiv.org/abs/2505.20511
Let's Talk

技術の詳細について、
エンジニアが直接お答えします。

評価用の検証環境、ベンチマークの条件、オンプレミス構成の要件。
導入前に確認したい技術的な論点があれば、ご相談ください。