音声がテキストになる。音声認識は、話し言葉を文字に書き起こし、アクセント、背景雑音、連続音声にも対応する。音声アシスタント、音声入力ツール、自動コールセンターなどの基盤となっている。
従来のシステムでは、手作業で作成した音響特徴量を用いた隠れマルコフモデルが使用されていました。現代のシステムでは、音声とテキストのペアでエンドツーエンドで学習されたニューラルネットワークを使用し、音響パターンと言語パターンを同時に学習します。
一般的な音声認識タスク
- 音声入力と文字起こし
- 音声コマンドと音声アシスタント
- リアルタイム字幕
- コールセンター分析
- 会議の要約
静かな環境下での明瞭な音声に対する認識精度は高い。しかし、強い訛り、複数の話者が同時に話す場合、あるいは騒がしい環境では精度が低下する。ベンチマークテストにおける単語誤り率は、必ずしも実際の現場でのパフォーマンスを予測するものではない。
Comments
No comments yet. Be the first to share a thought.
Leave a comment