Przejdź do treści
środa, 7 października 2026
Tenesys AI News
Subskrypcja

Voice AI

Speech-to-Text, Text-to-Speech, modele czasu rzeczywistego i agenci Voice AI.

#Latency — 2 artykuły ✕

Voice AI· Ważne· 🧪 Warte przetestowania

AssemblyAI wprowadza Sync API: pełna transkrypcja w jednym wywołaniu HTTP, opóźnienie ~134ms

AssemblyAI zaprezentowało Sync API — nowy sposób transkrypcji krótkich nagrań audio: jedno żądanie HTTP POST zwraca gotową transkrypcję Universal-3.5 Pro w tej samej odpowiedzi, przy medianie opóźnienia ok. 134ms. Wypełnia to lukę między Async API (wysyłka i odpytywanie, dodające 5-6 sekund opóźnienia) a Realtime API (WebSocket, przeznaczone do ciągłych sesji), odpowiadając na potrzeby takie jak dyktowanie, transkrypcja tur rozmowy w agentach głosowych, IVR i push-to-talk. Obsługiwane są nagrania od 80ms do 2 minut, do 40MB, z poziomem błędów 1,59% dla krótkich nagrań. Cena wynosi 0,45 USD/godz., tyle samo co Universal-3.5 Pro Realtime.

AssemblyAI
Voice AI· Ważne· 🧪 Warte przetestowania

AssemblyAI dodaje Qwen3.5 4B do LLM Gateway dla szybkiego przepisywania transkrypcji głosowych

AssemblyAI uruchomił hostowane wdrożenie open-source'owego modelu Qwen3.5 4B w swoim LLM Gateway, zoptymalizowane specjalnie do przepisywania surowej wyjściowej transkrypcji mowy na tekst na czysty, sformatowany tekst. W zadaniach przepisywania głosowego, takich jak czyszczenie dyktowania i formatowanie transkrypcji, model osiągał średni czas odpowiedzi 612ms — 1,9x szybciej niż GPT-4.1 — przy 94% niższym koszcie na godzinę przetworzonego audio. Cena modelu to $0.10/$0.50 za milion tokenów (prompt/odpowiedź), wspierane są tylko parametry max_tokens, temperature i stream, bez wywoływania narzędzi.

AssemblyAI