Deepgram rozszerza medyczne rozpoznawanie mowy na 10 języków
W skrócie: Deepgram rozszerzył swój wyspecjalizowany model mowy medycznej, Nova-3 Medical, z obsługi wyłącznie języka angielskiego do 10 języków, w tym hiszpańskiego, niemieckiego, hindi, japońskiego i rosyjskiego, z automatycznym przełączaniem języków zarówno w trybie wsadowym, jak i strumieniowym. W teście na 115 godzinach starannie dobranego nagrania medycznego wielojęzyczny model medyczny zmniejszył wskaźnik błędów słów o 25-30%, a wskaźnik błędów encji (leki, dawki, diagnozy) o 37-40% w porównaniu z ogólnym wielojęzycznym modelem Deepgram. Pokonał również konkurencyjne modele ElevenLabs i Microsoft pod względem średniego wskaźnika błędów słów we wszystkich 10 językach.
To podsumowanie zostało automatycznie przygotowane przez sztuczną inteligencję na podstawie publikacji „Deepgram”. To nasz tekst, nie kopia oryginału — fakty, liczby i cytaty należą do źródła, do którego link znajduje się powyżej i poniżej.
Co się zmieniło?
- 1Nova-3 Medical obsługuje teraz 10 języków: niderlandzki, angielski, francuski, niemiecki, hindi, włoski, japoński, portugalski, rosyjski, hiszpański
- 2Automatyczne przełączanie języków między obsługiwanymi językami zarówno w trybie wsadowym, jak i strumieniowym
- 3WER w trybie wsadowym spadł z 6,62% do 4,96% (redukcja o 25%) w porównaniu z ogólnym modelem wielojęzycznym
- 4WER w trybie strumieniowym spadł z 8,32% do 5,86% (redukcja o 30%)
- 5Wskaźnik błędów encji w trybie wsadowym (leki, dawki, diagnozy) zmniejszony z 14,46% do 9,11% (redukcja o 37%)
- 6Błędy rozpoznawania dawek zmniejszone o 64% w trybie wsadowym i 81% w trybie strumieniowym
- 7Najniższy średni WER w trybie wsadowym (4,96%) wśród testowanych modeli, wyprzedzając ElevenLabs Scribe v2 Medical (5,49%) i Microsoft MAI 1,5 (7,80%)
- 8Dostępne poprzez pojedynczy parametr API: model=nova-3-medical&language=multi, a także opcja wdrożenia lokalnego (self-hosted)
| Parametr | Było | Jest |
|---|---|---|
| Obsługiwane języki | Tylko angielski (Nova-3 Medical) | 10 języków: niderlandzki, angielski, francuski, niemiecki, hindi, włoski, japoński, portugalski, rosyjski, hiszpański |
| Wskaźnik błędów słów w trybie wsadowym (vs ogólny model wiel | 6,62% | 4,96% |
| Wskaźnik błędów słów w trybie strumieniowym (vs ogólny model | 8,32% | 5,86% |
| Wskaźnik błędów encji w trybie wsadowym | 14,46% | 9,11% |
| Wskaźnik błędów encji w trybie strumieniowym | 16,31% | 9,78% |
| Przełączanie języków | Nie określono | Automatyczne przełączanie między obsługiwanymi językami w trybie wsadowym i strumieniowym |
Dlaczego to ważne?
Dokładna transkrypcja nazw leków, dawek i diagnoz jest kluczowa dla każdego medycznego agenta głosowego lub narzędzia do dokumentacji otoczeniowej; to wydanie pokazuje, że wyspecjalizowane modele nadal znacznie przewyższają ogólne wielojęzyczne STT nawet po rozszerzeniu na wiele języków, co ma znaczenie dla botów rejestracyjnych, narzędzi do dyktowania i generowania notatek klinicznych w różnych językach.
Co to oznacza dla agentów AI i contact center?
Choć jest to model specyficzny dla branży medycznej, metodologia testów porównawczych (porównanie wyspecjalizowanego i ogólnego wielojęzycznego STT pod względem wskaźnika błędów słów i encji, w trybie wsadowym i strumieniowym) jest bezpośrednio przydatna przy ocenie dostawców rozpoznawania mowy dla dowolnego wdrożenia agentów głosowych w językach innych niż angielski, w tym przy ocenie, jak dobrze dostawca radzi sobie z liczbami, nazwami i terminologią branżową w mniejszych językach.
🧪 Warte przetestowania
Testowanie dokładności rozpoznawania strumieniowego oraz zachowania przełączania języków w Nova-3 Medical Multilingual może pomóc w wyborze dostawcy STT dla wielojęzycznych agentów głosowych, szczególnie gdy dokładność słownictwa branżowego (nazwy, liczby, terminy techniczne) jest ważniejsza niż ogólna jakość transkrypcji.
Źródła
- DeepgramOficjalneŹródło pierwotneOryginalny artykuł →„Article · · Announcements Introducing Nova-3 Medical Multilingual: Medical Speech Recognition in 10 Languages“7 paź 2026, 03:00
- Data publikacji źródła
- 7 paź 2026, 03:00
- Znalezione przez nasz system
- 7 paź 2026, 08:36
- Podsumowanie wygenerowano
- 7 paź 2026, 08:37
Artykuł napisała AI na podstawie oryginalnego źródła. Fakty, liczby i ceny pochodzą ze źródła; brakujące wartości oznaczono „Brak oficjalnych danych”. Informacje prawne, prawa autorskie i prywatność