AssemblyAI dodaje Qwen3.5 4B do LLM Gateway dla szybkiego przepisywania transkrypcji głosowych
W skrócie: AssemblyAI uruchomił hostowane wdrożenie open-source'owego modelu Qwen3.5 4B w swoim LLM Gateway, zoptymalizowane specjalnie do przepisywania surowej wyjściowej transkrypcji mowy na tekst na czysty, sformatowany tekst. W zadaniach przepisywania głosowego, takich jak czyszczenie dyktowania i formatowanie transkrypcji, model osiągał średni czas odpowiedzi 612ms — 1,9x szybciej niż GPT-4.1 — przy 94% niższym koszcie na godzinę przetworzonego audio. Cena modelu to $0.10/$0.50 za milion tokenów (prompt/odpowiedź), wspierane są tylko parametry max_tokens, temperature i stream, bez wywoływania narzędzi.
To podsumowanie zostało automatycznie przygotowane przez sztuczną inteligencję na podstawie publikacji „AssemblyAI”. To nasz tekst, nie kopia oryginału — fakty, liczby i cytaty należą do źródła, do którego link znajduje się powyżej i poniżej.
Co się zmieniło?
- 1Nowy model qwen3.5-4b-32k-fast hostowany przez AssemblyAI na własnych GPU, okno kontekstu 32k
- 2Zmierzone średnie opóźnienie 612ms w porównaniu z 1,138ms GPT-4.1 w zadaniach przepisywania głosowego
- 394% niższy koszt na godzinę audio w porównaniu z GPT-4.1; cena $0.10/$0.50 za milion tokenów (prompt/odpowiedź)
- 4Brak wsparcia dla wywoływania narzędzi lub ustrukturyzowanej odpowiedzi — tylko max_tokens, temperature, stream
- 5Dla zadań agentowych wymagających wywoływania narzędzi AssemblyAI zaleca osobny model qwen3-next-80b-a3b
- 6Dostępny już teraz przez AssemblyAI API/Playground, przez ten sam endpoint kompatybilny z OpenAI co Claude, GPT i Gemini w LLM Gateway
| Parametr | Było | Jest |
|---|---|---|
| Okno kontekstu | Nie określono | 32k |
| Cena promptu | Nie określono | $0.10 za milion tokenów |
| Cena odpowiedzi | Nie określono | $0.50 za milion tokenów |
| Opóźnienie (śr. przepisywanie głosowe) | GPT-4.1: 1,138 ms | 612 ms |
| Koszt na godzinę audio | GPT-4.1: $0.1546/godz. | $0.0092/godz. |
| Wywoływanie narzędzi | Nie określono | Niewspierane |
| Wspierane parametry | Nie określono | Tylko max_tokens, temperature, stream |
Dlaczego to ważne?
Wiele produktów głosowych uruchamia prosty krok 'oczyszczenia transkrypcji' na drogich modelach ogólnego przeznaczenia, dodając niepotrzebne opóźnienie i koszty do każdej wypowiedzi. Mały model dostrojony specjalnie do tego zadania może znacząco zmniejszyć oba te czynniki, co ma znaczenie dla każdego potoku głosowego w czasie rzeczywistym, w którym krok przepisywania uruchamiany jest przy każdej turze rozmowy.
Co to oznacza dla agentów AI i contact center?
Jeśli Twoja firma prowadzi agentów głosowych w czasie rzeczywistym lub funkcje dyktowania, ten krok przepisywania — usuwanie wypełniaczy, rozwiązywanie autokorekt, przeformatowanie surowego wyjścia STT — zachodzi przy każdej wypowiedzi i bezpośrednio wpływa na postrzegane opóźnienie. Warto porównać ten model z obecnie używanym modelem do przepisywania/formatowania pod kątem opóźnienia, kosztu na godzinę audio i jakości wyjścia na własnych transkrypcjach, w tym audio w języku litewskim, przed podjęciem decyzji, czy nadal używać większego modelu ogólnego przeznaczenia do tego konkretnego kroku.
🧪 Warte przetestowania
Deklarowane przewagi pod względem opóźnienia i kosztu dla powszechnego zadania w potoku głosowym (przepisywanie/formatowanie transkrypcji) są na tyle znaczące, że uzasadniają test porównawczy z modelem obecnie obsługującym ten krok, zwłaszcza że dostępne są darmowe kredyty bez karty kredytowej.
Źródła
- AssemblyAIOficjalneŹródło pierwotneOryginalny artykuł →„Introducing Qwen3.5 4B on LLM Gateway—optimized by AssemblyAI for the fast rewrite tasks at the center of voice products“
- Data publikacji źródła
- —
- Znalezione przez nasz system
- 6 paź 2026, 20:35
- Podsumowanie wygenerowano
- 6 paź 2026, 20:37
Artykuł napisała AI na podstawie oryginalnego źródła. Fakty, liczby i ceny pochodzą ze źródła; brakujące wartości oznaczono „Brak oficjalnych danych”. Informacje prawne, prawa autorskie i prywatność