Pereiti prie turinio
2026 m. spalio 4 d., sekmadienis
Tenesys AI News
Prenumerata

Voice AI

Speech-to-Text, Text-to-Speech, realaus laiko modeliai ir Voice AI agentai.

Voice AI· Svarbu· 🧪 Verta testuoti

NVIDIA paskelbė Nemotron modelio pritaikymo dialektams metodiką kalbos atpažinimui

NVIDIA pristatė detalią darbo eigą, kaip pritaikyti daugiakalbį srautinį ASR modelį Nemotron 3.5 Saudo Arabijos dialektams (Najdi ir Hijazi). Naudojant minimalų duomenų kuravimą, „replay mixing“ su FLEURS duomenimis, trukme pagrįstą grupavimą ir dalinį enkoderio atšaldymą, žodžių klaidų dažnis (WER) tiksliniuose dialektuose sumažintas nuo 55,05% iki 29,96%, kartu šiek tiek pagerinant anglų ir kitų arabų dialektų atpažinimą. Straipsnyje taip pat aptariami dekodavimo pakeitimai ir kalbėtojų diarizacijos plėtiniai keliems kalbėtojams.

NVIDIA Developer