Przejdź do treści
sobota, 10 października 2026
Tenesys AI News
Subskrypcja

Voice AI

Speech-to-Text, Text-to-Speech, modele czasu rzeczywistego i agenci Voice AI.

#Streaming ASR — 1 artykuł ✕

Voice AI· Ważne· 🧪 Warte przetestowania

Mistral wydaje open-source'owy model rozpoznawania mowy arabskiej w czasie rzeczywistym Voxtral Mini 4B Realtime Arabic

Mistral AI wydał Voxtral Mini 4B Realtime Arabic — strumieniowy model rozpoznawania mowy (STT) dostrojony do dialektów arabskich, standardowego arabskiego oraz przełączania kodów językowych podczas rozmowy. Model z 4,4 mld parametrów przetwarza dźwięk 16 kHz w czasie rzeczywistym z konfigurowalnym opóźnieniem transkrypcji, osiągając przy opóźnieniu 480 ms średni wskaźnik błędów znakowych (CER) 8,82% w siedmiu testach dla języka arabskiego — blisko wyniku 7,91% CER offline'owego modelu Voxtral Transcribe Arabic. Model powstał we współpracy z marokańskim ministerstwem transformacji cyfrowej w ramach suwerennego partnerstwa AI i jest wydany na licencji Apache 2.0.

Mistral AI (Hugging Face)