NVIDIA publikuje przepis na fine-tuning rozpoznawania mowy dla konkretnych dialektów z Nemotron
NVIDIA opublikowała szczegółowy workflow do fine-tuningu swojego wielojęzycznego, strumieniowego modelu Nemotron 3.5 ASR na saudyjskich dialektach arabskich (nadżdyjskim i hidżaskim). Przy minimalnej kuracji danych, mieszaniu replay z danymi FLEURS, bucketingu opartym na czasie trwania oraz częściowym odmrażaniu enkodera, zmniejszono wskaźnik błędu słów (WER) dla docelowych dialektów z 55,05% do 29,96%, jednocześnie nieznacznie poprawiając wyniki dla języka angielskiego i innych dialektów arabskich. We wpisie omówiono też modyfikacje dekodowania oraz rozszerzenia diaryzacji mówców dla transkrypcji wielomówcowej.