AssemblyAI pristato Qwen3.5 4B LLM Gateway platformoje greitam balso transkripcijų perrašymui
Trumpai: AssemblyAI paleido atviro kodo Qwen3.5 4B modelio diegimą savo LLM Gateway platformoje, specialiai optimizuotą perrašyti neapdorotą kalbos-teksto išvestį į švarų, suformatuotą tekstą. Balso perrašymo užduotyse, tokiose kaip diktavimo valymas ir transkripcijos formatavimas, modelis vidutiniškai atsakė per 612ms — 1,9 karto greičiau nei GPT-4.1 — ir kainavo 94% mažiau per valandą apdoroto garso. Modelio kaina — $0.10/$0.50 už milijoną tokenų (užklausa/atsakymas), palaikomi tik max_tokens, temperature ir stream parametrai, be įrankių kvietimo (tool calling).
Šią santrauką automatiškai parengė dirbtinis intelektas pagal „AssemblyAI“ publikaciją. Tai mūsų tekstas, ne originalo kopija — faktai, skaičiai ir citatos priklauso šaltiniui, kurio nuoroda pateikta viršuje ir apačioje.
Kas pasikeitė?
- 1Naujas qwen3.5-4b-32k-fast modelis, talpinamas AssemblyAI serveriuose, 32k konteksto langas
- 2Vidutinis 612ms atsako laikas lyginant su GPT-4.1 1,138ms balso perrašymo užduotyse
- 394% mažesnė kaina per valandą garso lyginant su GPT-4.1; kaina $0.10/$0.50 už milijoną tokenų (užklausa/atsakymas)
- 4Nepalaiko įrankių kvietimo ar struktūrizuotos išvesties — tik max_tokens, temperature, stream
- 5Agentų užduotims su įrankių kvietimo poreikiu AssemblyAI rekomenduoja atskirą qwen3-next-80b-a3b modelį
- 6Jau prieinamas per AssemblyAI API/Playground, tuo pačiu OpenAI suderinamu endpoint'u kaip Claude, GPT ir Gemini LLM Gateway platformoje
| Parametras | Buvo | Dabar |
|---|---|---|
| Konteksto langas | Nenurodyta | 32k |
| Užklausos kaina | Nenurodyta | $0.10 už milijoną tokenų |
| Atsakymo kaina | Nenurodyta | $0.50 už milijoną tokenų |
| Uždelsimas (balso perrašymo vid.) | GPT-4.1: 1,138 ms | 612 ms |
| Kaina per garso valandą | GPT-4.1: $0.1546/val. | $0.0092/val. |
| Įrankių kvietimas | Nenurodyta | Nepalaikomas |
| Palaikomi parametrai | Nenurodyta | Tik max_tokens, temperature, stream |
Kodėl tai svarbu?
Daugelis balso produktų neapdoroto 'transkripcijos išvalymo' žingsnį vykdo brangiais, bendros paskirties modeliais, taip pridėdami nereikalingo uždelsimo ir kaštų kiekvienam ištariamam fragmentui. Specializuotas mažas modelis šiai užduočiai gali gerokai sumažinti abu rodiklius — tai svarbu bet kuriam realaus laiko balso konvejeriui, kuriame perrašymo žingsnis vykdomas kas kiekvieną pokalbio dalį.
Ką tai reiškia AI agentams ir kontaktų centrams?
Jei jūsų įmonė naudoja realaus laiko balso agentus ar diktavimo funkcijas, šis perrašymo žingsnis — šalinti žodžius-užpildus, išspręsti savikorekcijas, performatuoti neapdorotą STT išvestį — vyksta kas kiekvieną ištarimą ir tiesiogiai veikia suvokiamą uždelsimą. Verta šį modelį palyginti su dabartiniu perrašymo/formatavimo modeliu pagal uždelsimą, kainą per garso valandą ir išvesties kokybę su savo pačių transkripcijomis, įskaitant lietuvišką garsą, prieš nusprendžiant, ar toliau naudoti didesnį bendros paskirties modelį šiam konkrečiam žingsniui.
🧪 Verta testuoti
Nurodomi uždelsimo ir kainos pranašumai dažnai pasitaikančiai balso konvejerio užduočiai (transkripcijos perrašymas/formatavimas) yra pakankamai dideli, kad pateisintų lyginamąjį testą su dabartiniu šį žingsnį atliekančiu modeliu, ypač kai siūlomi nemokami kreditai be kreditinės kortelės.
Šaltiniai
- AssemblyAIOficialusPirminis šaltinisOriginalus straipsnis →„Introducing Qwen3.5 4B on LLM Gateway—optimized by AssemblyAI for the fast rewrite tasks at the center of voice products“
- Šaltinio publikavimo data
- —
- Mūsų sistema rado
- 2026-10-06 20:35
- Santrauka sugeneruota
- 2026-10-06 20:37
Straipsnį pagal originalų šaltinį parašė AI. Faktai, skaičiai ir kainos — iš šaltinio; trūkstamos reikšmės pažymėtos „Nėra oficialių duomenų“. Teisinė informacija, autorių teisės ir privatumas