El sonido se convierte en texto. El reconocimiento de voz transcribe el lenguaje hablado a texto, teniendo en cuenta acentos, ruido de fondo y habla continua. Es la base de asistentes de voz, herramientas de dictado y centros de llamadas automatizados.
Los sistemas clásicos utilizaban modelos ocultos de Markov con características acústicas diseñadas manualmente. Los sistemas modernos utilizan redes neuronales entrenadas de extremo a extremo con pares de audio y texto, aprendiendo patrones acústicos y lingüísticos de forma conjunta.
Tareas comunes de reconocimiento de voz
- Dictado y transcripción
- Comandos de voz y asistentes
- Subtitulado en tiempo real
- Análisis de centros de llamadas
- Resumen de la reunión
La precisión es alta para el habla clara en condiciones de silencio. Disminuye con acentos marcados, voces superpuestas o entornos ruidosos. Las tasas de error de palabras en las pruebas de referencia no siempre predicen el rendimiento en la práctica.
Comments
No comments yet. Be the first to share a thought.
Leave a comment