Pereiti prie turinio
2026 m. spalio 4 d., sekmadienis
Tenesys AI News
Prenumerata
Voice AI· Svarbu· 🧪 Verta testuoti

NVIDIA paskelbė Nemotron modelio pritaikymo dialektams metodiką kalbos atpažinimui

Trumpai: NVIDIA pristatė detalią darbo eigą, kaip pritaikyti daugiakalbį srautinį ASR modelį Nemotron 3.5 Saudo Arabijos dialektams (Najdi ir Hijazi). Naudojant minimalų duomenų kuravimą, „replay mixing“ su FLEURS duomenimis, trukme pagrįstą grupavimą ir dalinį enkoderio atšaldymą, žodžių klaidų dažnis (WER) tiksliniuose dialektuose sumažintas nuo 55,05% iki 29,96%, kartu šiek tiek pagerinant anglų ir kitų arabų dialektų atpažinimą. Straipsnyje taip pat aptariami dekodavimo pakeitimai ir kalbėtojų diarizacijos plėtiniai keliems kalbėtojams.

Šaltinis: NVIDIA DeveloperNVIDIANemotron 3.5 ASROriginalus straipsnis ↗

Šią santrauką automatiškai parengė dirbtinis intelektas pagal „NVIDIA Developer“ publikaciją. Tai mūsų tekstas, ne originalo kopija — faktai, skaičiai ir citatos priklauso šaltiniui, kurio nuoroda pateikta viršuje ir apačioje.

Kas pasikeitė?

  • 1Apmokymas su 133,7 val. Najdi/Hijazi kalbos duomenų (82,5% iš kuruoto korpuso) sumažino WER nuo 55,05% iki 29,96% tiksliniuose dialektuose
  • 2Anglų kalbos WER pagerėjo nuo 11,04% iki 10,42%, arabų – nuo 12,67% iki 11,41%, t.y. kitų kalbų gebėjimai nesunyko
  • 3„Replay mixing“ naudojo 90% tikslinio dialekto duomenų, 7% anglų FLEURS, 3% arabų FLEURS ankstesnėms kalbinėms žinioms išlaikyti
  • 4Atšaldžius viršutinius 8 iš 24 enkoderio sluoksnių (230,4 mln. apmokomų parametrų) pasiektas balansas tarp tikslumo ir mokymo kaštų
  • 5Didesnis dėmesio kontekstas (13 žvilgsnio į priekį kadrų) ir beam-8 MALSD dekodavimas sumažino WER 2,71 punkto, pridedant ~800 ms vėlinimą, tinkamą paketiniam (ne realaus laiko) apdorojimui
  • 6Nemotron 3 Diarization praplečia procesą iki kalbėtojų atpažinimo iki 8 dalyvių pokalbiuose
Nemotron 3.5 ASR
ParametrasBuvoDabar
WER (Najdi+Hijazi testas)55.05%29.96%
CER (Najdi+Hijazi testas)31.63%12.18%
Pilnas SADA WER58.84%35.61%
FLEURS anglų kalbos WER11.04%10.42%
FLEURS arabų kalbos WER12.67%11.41%
Apmokomi parametrai (atlaisvinti viršutiniai 8 sluoksniai)Nenurodyta230.4M iš 638M viso
Kalbų aprėptis40 kalbų-lokalių (bazinis modelis)Tas pats, plius specializuoti Najdi/Hijazi dialektai

Kodėl tai svarbu?

Tai suteikia kūrėjams, kuriantiems daugiakalbes balso sistemas, patikrintą, atkartojamą metodą pritaikyti srautinį ASR modelį menkiau atstovaujamam dialektui ar akcentui, neprarandant tikslumo kitomis anksčiau palaikytomis kalbomis – dažna problema kontaktų centrų ir balso agentų diegimuose, aptarnaujančiuose daugiakalbę auditoriją.

Ką tai reiškia AI agentams ir kontaktų centrams?

Jūsų įmonė galėtų pritaikyti tą pačią metodiką (minimalus kuravimas, replay mixing, dalinis enkoderio atšaldymas, grupavimas pagal trukmę), kad pritaikytų Nemotron ar panašius NeMo pagrindu veikiančius ASR modelius lietuvių kalbai ar regioniniams akcentams, pagerinant transkripcijos tikslumą skambučių analitikai ir balso agentams, neprarandant kitų kalbų palaikymo daugiakalbėse diegimuose.

🧪 Verta testuoti

Metodika konkreti, atkartojama ir atvira (NeMo karkasas, nurodytas viešas notebook'as), todėl ją praktiška išbandyti siekiant pagerinti STT tikslumą lietuvių kalbai ar kitoms menkiau atstovaujamoms kalboms/dialektams, aktualiems jūsų įmonės balso agentų sprendimams.

NVIDIA NeMo ASR fine-tuning recipe (replay mixing + partial encoder unfreezing + bucketing)· Nauja

Šaltiniai

  • NVIDIA DeveloperOficialusPirminis šaltinis
    „Fine-Tuning NVIDIA Nemotron for Saudi Arabic Dialects, with a Path to Other Languages“
    2026-10-01 08:00
    Originalus straipsnis →
Šaltinio publikavimo data
2026-10-01 08:00
Mūsų sistema rado
2026-10-02 19:51
Santrauka sugeneruota
2026-10-02 20:07

Straipsnį pagal originalų šaltinį parašė AI. Faktai, skaičiai ir kainos — iš šaltinio; trūkstamos reikšmės pažymėtos „Nėra oficialių duomenų“. Teisinė informacija, autorių teisės ir privatumas

NVIDIA paskelbė Nemotron modelio pritaikymo dialektams metodiką kalbos atpažinimui · TENESYS AI NEWS