Dźwięk staje się tekstem. Rozpoznawanie mowy transkrybuje mowę mówioną na formę pisemną, uwzględniając akcenty, hałas w tle i ciągłą mowę. Obsługuje asystentów głosowych, narzędzia do dyktowania i automatyczne centra telefoniczne.
Klasyczne systemy wykorzystywały ukryte modele Markowa z ręcznie opracowanymi cechami akustycznymi. Nowoczesne systemy wykorzystują sieci neuronowe trenowane kompleksowo na sparowanych sygnałach audio i tekstowych, które wspólnie uczą się wzorców akustycznych i językowych.
Typowe zadania rozpoznawania mowy
- Dyktowanie i transkrypcja
- Polecenia głosowe i asystenci
- Napisy w czasie rzeczywistym
- Analityka call center
- Podsumowanie spotkania
Dokładność jest wysoka w przypadku wyraźnej mowy w cichych warunkach. Spada ona jednak w przypadku silnych akcentów, nakładających się głosów lub hałaśliwego otoczenia. Wskaźniki błędów w słowach w testach porównawczych nie zawsze pozwalają przewidzieć wydajność w terenie.
Comments
No comments yet. Be the first to share a thought.
Leave a comment