Pereiti prie turinio
2026 m. spalio 7 d., trečiadienis
Tenesys AI News
Prenumerata

Voice AI

Speech-to-Text, Text-to-Speech, realaus laiko modeliai ir Voice AI agentai.

#Latency — 2 straipsniai ✕

Voice AI· Svarbu· 🧪 Verta testuoti

AssemblyAI pristato Sync API: pilna transkripcija per vieną HTTP užklausą, ~134ms uždelsimas

AssemblyAI pristatė Sync API — naują transporto būdą trumpų garso įrašų transkripcijai: vienas HTTP POST užklausimas grąžina baigtą Universal-3.5 Pro transkripciją toje pačioje atsakyme, vidutiniškai per ~134ms. Tai užpildo tarpą tarp Async API (pateikti ir laukti, pridedant 5-6 sekundes uždelsimo) ir Realtime API (WebSocket, skirtas tęstinėms sesijoms), taikant dėmesį tokioms užduotims kaip diktavimas, pokalbių agento ėjimų transkripcija, IVR ir push-to-talk. Palaikomi 80ms–2min ilgio įrašai iki 40MB, su 1,59% klaidų lygiu trumpam garsui. Kaina — 0,45 USD/val., tiek pat, kiek Universal-3.5 Pro Realtime.

AssemblyAI
Voice AI· Svarbu· 🧪 Verta testuoti

AssemblyAI pristato Qwen3.5 4B LLM Gateway platformoje greitam balso transkripcijų perrašymui

AssemblyAI paleido atviro kodo Qwen3.5 4B modelio diegimą savo LLM Gateway platformoje, specialiai optimizuotą perrašyti neapdorotą kalbos-teksto išvestį į švarų, suformatuotą tekstą. Balso perrašymo užduotyse, tokiose kaip diktavimo valymas ir transkripcijos formatavimas, modelis vidutiniškai atsakė per 612ms — 1,9 karto greičiau nei GPT-4.1 — ir kainavo 94% mažiau per valandą apdoroto garso. Modelio kaina — $0.10/$0.50 už milijoną tokenų (užklausa/atsakymas), palaikomi tik max_tokens, temperature ir stream parametrai, be įrankių kvietimo (tool calling).

AssemblyAI