NVIDIA paskelbė Nemotron modelio pritaikymo dialektams metodiką kalbos atpažinimui
NVIDIA pristatė detalią darbo eigą, kaip pritaikyti daugiakalbį srautinį ASR modelį Nemotron 3.5 Saudo Arabijos dialektams (Najdi ir Hijazi). Naudojant minimalų duomenų kuravimą, „replay mixing“ su FLEURS duomenimis, trukme pagrįstą grupavimą ir dalinį enkoderio atšaldymą, žodžių klaidų dažnis (WER) tiksliniuose dialektuose sumažintas nuo 55,05% iki 29,96%, kartu šiek tiek pagerinant anglų ir kitų arabų dialektų atpažinimą. Straipsnyje taip pat aptariami dekodavimo pakeitimai ir kalbėtojų diarizacijos plėtiniai keliems kalbėtojams.



