소리가 텍스트로 변환됩니다. 음성 인식은 억양, 배경 소음, 연속적인 음성 등을 처리하여 음성을 문자 형태로 변환합니다. 이는 음성 비서, 받아쓰기 도구, 자동화된 콜센터 등에 사용됩니다.
기존 시스템은 수작업으로 추출한 음향 특징을 사용하는 은닉 마르코프 모델을 활용했습니다. 최신 시스템은 오디오와 텍스트 쌍을 기반으로 엔드 투 엔드 방식으로 학습되는 신경망을 사용하여 음향 및 언어 패턴을 함께 학습합니다.
일반적인 음성 인식 작업
- 받아쓰기 및 전사
- 음성 명령 및 음성 비서
- 실시간 자막
- 콜센터 분석
- 회의 요약
조용한 환경에서 또렷한 발음을 인식할 경우 정확도가 높습니다. 하지만 강한 억양, 여러 화자의 말이 겹치는 경우, 또는 시끄러운 환경에서는 정확도가 떨어집니다. 벤치마크 테스트에서 나타나는 단어 오류율이 실제 사용 환경에서의 성능을 항상 예측하는 것은 아닙니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment