Przejdź do treści
środa, 7 października 2026
Tenesys AI News
Subskrypcja

AssemblyAI

Najnowsze wiadomości, modele i ich zmiany.

Najnowsze wiadomości

Voice AI· Ważne· 🧪 Warte przetestowania

AssemblyAI wprowadza Sync API: pełna transkrypcja w jednym wywołaniu HTTP, opóźnienie ~134ms

AssemblyAI zaprezentowało Sync API — nowy sposób transkrypcji krótkich nagrań audio: jedno żądanie HTTP POST zwraca gotową transkrypcję Universal-3.5 Pro w tej samej odpowiedzi, przy medianie opóźnienia ok. 134ms. Wypełnia to lukę między Async API (wysyłka i odpytywanie, dodające 5-6 sekund opóźnienia) a Realtime API (WebSocket, przeznaczone do ciągłych sesji), odpowiadając na potrzeby takie jak dyktowanie, transkrypcja tur rozmowy w agentach głosowych, IVR i push-to-talk. Obsługiwane są nagrania od 80ms do 2 minut, do 40MB, z poziomem błędów 1,59% dla krótkich nagrań. Cena wynosi 0,45 USD/godz., tyle samo co Universal-3.5 Pro Realtime.

AssemblyAI
Voice AI· Ważne· 🧪 Warte przetestowania

AssemblyAI dodaje Qwen3.5 4B do LLM Gateway dla szybkiego przepisywania transkrypcji głosowych

AssemblyAI uruchomił hostowane wdrożenie open-source'owego modelu Qwen3.5 4B w swoim LLM Gateway, zoptymalizowane specjalnie do przepisywania surowej wyjściowej transkrypcji mowy na tekst na czysty, sformatowany tekst. W zadaniach przepisywania głosowego, takich jak czyszczenie dyktowania i formatowanie transkrypcji, model osiągał średni czas odpowiedzi 612ms — 1,9x szybciej niż GPT-4.1 — przy 94% niższym koszcie na godzinę przetworzonego audio. Cena modelu to $0.10/$0.50 za milion tokenów (prompt/odpowiedź), wspierane są tylko parametry max_tokens, temperature i stream, bez wywoływania narzędzi.

AssemblyAI
Voice AI· Ważne· 🧪 Warte przetestowania

AssemblyAI wprowadza Universal-3.5 Pro z natywnym przełączaniem języków i lepszym rozpoznawaniem mówców

AssemblyAI wydała Universal-3.5 Pro, nowy flagowy asynchroniczny model mowy-na-tekst w cenie 0,21 USD/godz. Model natywnie transkrybuje rozmowy z przełączaniem języków (code-switching) w 18 językach bez dodatkowej konfiguracji, wprowadza wspólnie modelowane rozpoznawanie mówców wbudowane bezpośrednio w transkrypt (zamiast łączenia z osobnego systemu) oraz obsługuje kontekstowe podpowiadanie, pozwalające dostarczyć modelowi wiedzę branżową. Testy pokazują niższy wskaźnik błędów słów na nagraniach z przełączaniem języków oraz wyższą dokładność cpWER w rozpoznawaniu mówców w porównaniu z kilkoma modelami konkurencji oraz wcześniejszym Universal-3 Pro od AssemblyAI.

AssemblyAI
AssemblyAI — wiadomości AI · TENESYS AI NEWS