Przejdź do treści
niedziela, 4 października 2026
Tenesys AI News
Subskrypcja

Nemotron 3.5 ASR

Historia zmian

  1. 1 paź 2026
    NVIDIA publikuje przepis na fine-tuning rozpoznawania mowy dla konkretnych dialektów z Nemotron
    ParametrByłoJest
    WER (test nadżdyjski+hidżaski)55,05%29,96%
    CER (test nadżdyjski+hidżaski)31,63%12,18%
    Pełny SADA WER58,84%35,61%
    WER FLEURS angielski11,04%10,42%
    WER FLEURS arabski12,67%11,41%
    Trenowalne parametry (odmrożone górne 8 warstw)Nie określono230,4 mln z 638 mln łącznie
    Pokrycie językowe40 lokalizacji językowych (model bazowy)To samo, plus wyspecjalizowane dialekty nadżdyjski/hidżaski

Wiadomości

Voice AI· Ważne· 🧪 Warte przetestowania

NVIDIA publikuje przepis na fine-tuning rozpoznawania mowy dla konkretnych dialektów z Nemotron

NVIDIA opublikowała szczegółowy workflow do fine-tuningu swojego wielojęzycznego, strumieniowego modelu Nemotron 3.5 ASR na saudyjskich dialektach arabskich (nadżdyjskim i hidżaskim). Przy minimalnej kuracji danych, mieszaniu replay z danymi FLEURS, bucketingu opartym na czasie trwania oraz częściowym odmrażaniu enkodera, zmniejszono wskaźnik błędu słów (WER) dla docelowych dialektów z 55,05% do 29,96%, jednocześnie nieznacznie poprawiając wyniki dla języka angielskiego i innych dialektów arabskich. We wpisie omówiono też modyfikacje dekodowania oraz rozszerzenia diaryzacji mówców dla transkrypcji wielomówcowej.

NVIDIA Developer
Nemotron 3.5 ASR · TENESYS AI NEWS