NVIDIA paskelbė Nemotron modelio pritaikymo dialektams metodiką kalbos atpažinimui
Trumpai: NVIDIA pristatė detalią darbo eigą, kaip pritaikyti daugiakalbį srautinį ASR modelį Nemotron 3.5 Saudo Arabijos dialektams (Najdi ir Hijazi). Naudojant minimalų duomenų kuravimą, „replay mixing“ su FLEURS duomenimis, trukme pagrįstą grupavimą ir dalinį enkoderio atšaldymą, žodžių klaidų dažnis (WER) tiksliniuose dialektuose sumažintas nuo 55,05% iki 29,96%, kartu šiek tiek pagerinant anglų ir kitų arabų dialektų atpažinimą. Straipsnyje taip pat aptariami dekodavimo pakeitimai ir kalbėtojų diarizacijos plėtiniai keliems kalbėtojams.
Šią santrauką automatiškai parengė dirbtinis intelektas pagal „NVIDIA Developer“ publikaciją. Tai mūsų tekstas, ne originalo kopija — faktai, skaičiai ir citatos priklauso šaltiniui, kurio nuoroda pateikta viršuje ir apačioje.
Kas pasikeitė?
- 1Apmokymas su 133,7 val. Najdi/Hijazi kalbos duomenų (82,5% iš kuruoto korpuso) sumažino WER nuo 55,05% iki 29,96% tiksliniuose dialektuose
- 2Anglų kalbos WER pagerėjo nuo 11,04% iki 10,42%, arabų – nuo 12,67% iki 11,41%, t.y. kitų kalbų gebėjimai nesunyko
- 3„Replay mixing“ naudojo 90% tikslinio dialekto duomenų, 7% anglų FLEURS, 3% arabų FLEURS ankstesnėms kalbinėms žinioms išlaikyti
- 4Atšaldžius viršutinius 8 iš 24 enkoderio sluoksnių (230,4 mln. apmokomų parametrų) pasiektas balansas tarp tikslumo ir mokymo kaštų
- 5Didesnis dėmesio kontekstas (13 žvilgsnio į priekį kadrų) ir beam-8 MALSD dekodavimas sumažino WER 2,71 punkto, pridedant ~800 ms vėlinimą, tinkamą paketiniam (ne realaus laiko) apdorojimui
- 6Nemotron 3 Diarization praplečia procesą iki kalbėtojų atpažinimo iki 8 dalyvių pokalbiuose
| Parametras | Buvo | Dabar |
|---|---|---|
| WER (Najdi+Hijazi testas) | 55.05% | 29.96% |
| CER (Najdi+Hijazi testas) | 31.63% | 12.18% |
| Pilnas SADA WER | 58.84% | 35.61% |
| FLEURS anglų kalbos WER | 11.04% | 10.42% |
| FLEURS arabų kalbos WER | 12.67% | 11.41% |
| Apmokomi parametrai (atlaisvinti viršutiniai 8 sluoksniai) | Nenurodyta | 230.4M iš 638M viso |
| Kalbų aprėptis | 40 kalbų-lokalių (bazinis modelis) | Tas pats, plius specializuoti Najdi/Hijazi dialektai |
Kodėl tai svarbu?
Tai suteikia kūrėjams, kuriantiems daugiakalbes balso sistemas, patikrintą, atkartojamą metodą pritaikyti srautinį ASR modelį menkiau atstovaujamam dialektui ar akcentui, neprarandant tikslumo kitomis anksčiau palaikytomis kalbomis – dažna problema kontaktų centrų ir balso agentų diegimuose, aptarnaujančiuose daugiakalbę auditoriją.
Ką tai reiškia AI agentams ir kontaktų centrams?
Jūsų įmonė galėtų pritaikyti tą pačią metodiką (minimalus kuravimas, replay mixing, dalinis enkoderio atšaldymas, grupavimas pagal trukmę), kad pritaikytų Nemotron ar panašius NeMo pagrindu veikiančius ASR modelius lietuvių kalbai ar regioniniams akcentams, pagerinant transkripcijos tikslumą skambučių analitikai ir balso agentams, neprarandant kitų kalbų palaikymo daugiakalbėse diegimuose.
🧪 Verta testuoti
Metodika konkreti, atkartojama ir atvira (NeMo karkasas, nurodytas viešas notebook'as), todėl ją praktiška išbandyti siekiant pagerinti STT tikslumą lietuvių kalbai ar kitoms menkiau atstovaujamoms kalboms/dialektams, aktualiems jūsų įmonės balso agentų sprendimams.
NVIDIA NeMo ASR fine-tuning recipe (replay mixing + partial encoder unfreezing + bucketing)· Nauja
Šaltiniai
- NVIDIA DeveloperOficialusPirminis šaltinisOriginalus straipsnis →„Fine-Tuning NVIDIA Nemotron for Saudi Arabic Dialects, with a Path to Other Languages“2026-10-01 08:00
- Šaltinio publikavimo data
- 2026-10-01 08:00
- Mūsų sistema rado
- 2026-10-02 19:51
- Santrauka sugeneruota
- 2026-10-02 20:07
Straipsnį pagal originalų šaltinį parašė AI. Faktai, skaičiai ir kainos — iš šaltinio; trūkstamos reikšmės pažymėtos „Nėra oficialių duomenų“. Teisinė informacija, autorių teisės ir privatumas