Przejdź do treści
niedziela, 4 października 2026
Tenesys AI News
Subskrypcja

Voice AI

Speech-to-Text, Text-to-Speech, modele czasu rzeczywistego i agenci Voice AI.

Voice AI· Ważne· 🧪 Warte przetestowania

NVIDIA publikuje przepis na fine-tuning rozpoznawania mowy dla konkretnych dialektów z Nemotron

NVIDIA opublikowała szczegółowy workflow do fine-tuningu swojego wielojęzycznego, strumieniowego modelu Nemotron 3.5 ASR na saudyjskich dialektach arabskich (nadżdyjskim i hidżaskim). Przy minimalnej kuracji danych, mieszaniu replay z danymi FLEURS, bucketingu opartym na czasie trwania oraz częściowym odmrażaniu enkodera, zmniejszono wskaźnik błędu słów (WER) dla docelowych dialektów z 55,05% do 29,96%, jednocześnie nieznacznie poprawiając wyniki dla języka angielskiego i innych dialektów arabskich. We wpisie omówiono też modyfikacje dekodowania oraz rozszerzenia diaryzacji mówców dla transkrypcji wielomówcowej.

NVIDIA Developer
Voice AI · TENESYS AI NEWS