Przejdź do treści
środa, 7 października 2026
Tenesys AI News
Subskrypcja
Voice AI· Ważne· 🧪 Warte przetestowania

AssemblyAI dodaje Qwen3.5 4B do LLM Gateway dla szybkiego przepisywania transkrypcji głosowych

W skrócie: AssemblyAI uruchomił hostowane wdrożenie open-source'owego modelu Qwen3.5 4B w swoim LLM Gateway, zoptymalizowane specjalnie do przepisywania surowej wyjściowej transkrypcji mowy na tekst na czysty, sformatowany tekst. W zadaniach przepisywania głosowego, takich jak czyszczenie dyktowania i formatowanie transkrypcji, model osiągał średni czas odpowiedzi 612ms — 1,9x szybciej niż GPT-4.1 — przy 94% niższym koszcie na godzinę przetworzonego audio. Cena modelu to $0.10/$0.50 za milion tokenów (prompt/odpowiedź), wspierane są tylko parametry max_tokens, temperature i stream, bez wywoływania narzędzi.

Źródło: AssemblyAIAssemblyAIQwen3.5 4B (qwen3.5-4b-32k-fast)Oryginalny artykuł ↗

To podsumowanie zostało automatycznie przygotowane przez sztuczną inteligencję na podstawie publikacji „AssemblyAI”. To nasz tekst, nie kopia oryginału — fakty, liczby i cytaty należą do źródła, do którego link znajduje się powyżej i poniżej.

Co się zmieniło?

  • 1Nowy model qwen3.5-4b-32k-fast hostowany przez AssemblyAI na własnych GPU, okno kontekstu 32k
  • 2Zmierzone średnie opóźnienie 612ms w porównaniu z 1,138ms GPT-4.1 w zadaniach przepisywania głosowego
  • 394% niższy koszt na godzinę audio w porównaniu z GPT-4.1; cena $0.10/$0.50 za milion tokenów (prompt/odpowiedź)
  • 4Brak wsparcia dla wywoływania narzędzi lub ustrukturyzowanej odpowiedzi — tylko max_tokens, temperature, stream
  • 5Dla zadań agentowych wymagających wywoływania narzędzi AssemblyAI zaleca osobny model qwen3-next-80b-a3b
  • 6Dostępny już teraz przez AssemblyAI API/Playground, przez ten sam endpoint kompatybilny z OpenAI co Claude, GPT i Gemini w LLM Gateway
Qwen3.5 4B (qwen3.5-4b-32k-fast)
ParametrByłoJest
Okno kontekstuNie określono32k
Cena promptuNie określono$0.10 za milion tokenów
Cena odpowiedziNie określono$0.50 za milion tokenów
Opóźnienie (śr. przepisywanie głosowe)GPT-4.1: 1,138 ms612 ms
Koszt na godzinę audioGPT-4.1: $0.1546/godz.$0.0092/godz.
Wywoływanie narzędziNie określonoNiewspierane
Wspierane parametryNie określonoTylko max_tokens, temperature, stream

Dlaczego to ważne?

Wiele produktów głosowych uruchamia prosty krok 'oczyszczenia transkrypcji' na drogich modelach ogólnego przeznaczenia, dodając niepotrzebne opóźnienie i koszty do każdej wypowiedzi. Mały model dostrojony specjalnie do tego zadania może znacząco zmniejszyć oba te czynniki, co ma znaczenie dla każdego potoku głosowego w czasie rzeczywistym, w którym krok przepisywania uruchamiany jest przy każdej turze rozmowy.

Co to oznacza dla agentów AI i contact center?

Jeśli Twoja firma prowadzi agentów głosowych w czasie rzeczywistym lub funkcje dyktowania, ten krok przepisywania — usuwanie wypełniaczy, rozwiązywanie autokorekt, przeformatowanie surowego wyjścia STT — zachodzi przy każdej wypowiedzi i bezpośrednio wpływa na postrzegane opóźnienie. Warto porównać ten model z obecnie używanym modelem do przepisywania/formatowania pod kątem opóźnienia, kosztu na godzinę audio i jakości wyjścia na własnych transkrypcjach, w tym audio w języku litewskim, przed podjęciem decyzji, czy nadal używać większego modelu ogólnego przeznaczenia do tego konkretnego kroku.

🧪 Warte przetestowania

Deklarowane przewagi pod względem opóźnienia i kosztu dla powszechnego zadania w potoku głosowym (przepisywanie/formatowanie transkrypcji) są na tyle znaczące, że uzasadniają test porównawczy z modelem obecnie obsługującym ten krok, zwłaszcza że dostępne są darmowe kredyty bez karty kredytowej.

Qwen3.5 4B on AssemblyAI LLM Gateway· Nowa

Źródła

  • AssemblyAIOficjalneŹródło pierwotne
    „Introducing Qwen3.5 4B on LLM Gateway—optimized by AssemblyAI for the fast rewrite tasks at the center of voice products“
    Oryginalny artykuł →
Data publikacji źródła
—
Znalezione przez nasz system
6 paź 2026, 20:35
Podsumowanie wygenerowano
6 paź 2026, 20:37

Artykuł napisała AI na podstawie oryginalnego źródła. Fakty, liczby i ceny pochodzą ze źródła; brakujące wartości oznaczono „Brak oficjalnych danych”. Informacje prawne, prawa autorskie i prywatność

AssemblyAI dodaje Qwen3.5 4B do LLM Gateway dla szybkiego przepisywania transkrypcji głosowych · TENESYS AI NEWS