Suara menjadi teks. Pengenalan suara mentranskripsikan bahasa lisan ke dalam bentuk tulisan, menangani aksen, kebisingan latar belakang, dan ucapan berkelanjutan. Teknologi ini mendukung asisten suara, alat dikte, dan pusat panggilan otomatis.
Sistem klasik menggunakan model Markov tersembunyi dengan fitur akustik yang dibuat secara manual. Sistem modern menggunakan jaringan saraf yang dilatih secara menyeluruh pada pasangan audio dan teks, mempelajari pola akustik dan bahasa secara bersamaan.
Tugas pengenalan ucapan umum
- Dikte dan transkripsi
- Perintah dan asisten suara
- Teks terjemahan waktu nyata
- Analisis pusat panggilan
- Ringkasan rapat
Akurasi tinggi untuk ucapan yang jelas dalam kondisi tenang. Akurasi menurun dengan aksen yang kental, pembicara yang berbicara tumpang tindih, atau lingkungan yang bising. Tingkat kesalahan kata pada tolok ukur tidak selalu memprediksi kinerja di lapangan.
Comments
No comments yet. Be the first to share a thought.
Leave a comment