TII pristatė Falcon-ASR – 1,6 mlrd. parametrų kalbos atpažinimo modelį, orientuotą į arabų ir Emiratų dialektą
Trumpai: Technology Innovation Institute (TII) pristatė Falcon-ASR – 1,6 mlrd. parametrų automatinio kalbos atpažinimo (ASR) modelį, pirmiausia skirtą arabų kalbai, ypač Emiratų dialektui. Tais pačiais modelio svoriais jis taip pat transkribuoja anglų, prancūzų, ispanų ir portugalų kalbas. TII teigia, kad modelis aplenkia geriausią viešai skelbtą rezultatą standartiniame arabų kalbos teste ir pirmauja vidiniame Emiratų dialekto vertinime, taip pat palaiko žodžių lygio laiko žymas.
Šią santrauką automatiškai parengė dirbtinis intelektas pagal „Hugging Face“ publikaciją. Tai mūsų tekstas, ne originalo kopija — faktai, skaičiai ir citatos priklauso šaltiniui, kurio nuoroda pateikta viršuje ir apačioje.
Kas pasikeitė?
- 11,6 mlrd. parametrų modelis, palaikantis arabų (įsk. Emiratų, kitus Persijos įlankos dialektus, MSA), anglų, prancūzų, ispanų, portugalų kalbas vienu modelio svorių rinkiniu, be kalbos vėliavėlės
- 2Pasiekė 20,92% vidutinį žodžių klaidų lygį (WER) šešiuose arabų kalbos testavimo rinkiniuose iš Open Universal Arabic ASR Leaderboard, palyginus su 23,17% geriausio viešai skelbto rezultato (Audar-ASR-V1-Turbo)
- 3Vidiniame Emiratų dialekto vertinime pasiekė 22,73% WER / 10,19% CER, aplenkdamas Qwen3-Omni-30B-A3B-Instruct (26,80% WER) ir kitas lygintas sistemas
- 4Pasiekė 5,74% vidutinį WER septyniuose viešuose anglų kalbos testavimo rinkiniuose (Hugging Face Open ASR Leaderboard)
- 5Palaiko žodžių lygio laiko žymas, susiejančias transkribuotus žodžius su pozicija garso įraše
- 6Treniruotas su foniniu triukšmu, persidengiančia kalba, aido efektais ir telefonijos trukdžiais, siekiant pagerinti atsparumą skambučiuose ir susitikimuose
- 7Jau dabar galima išbandyti per Hugging Face demonstracinę versiją; API prieiga ir savarankiškos aplikacijos planuojamos, bet dar nėra prieinamos
| Parametras | Buvo | Dabar |
|---|---|---|
| Parametrai | Nenurodyta | 1.6B |
| Kalbos | Nenurodyta | Arabų (įsk. Emiratų dialektą), anglų, prancūzų, ispanų, portugalų |
| Vidutinis WER arabų kalba | 23.17% (geriausias viešai skelbtas) | 20.92% |
| Emiratų WER (vidinis vertinimas) | 26.80% (kitas geriausias, Qwen3-Omni) | 22.73% |
| Vidutinis WER anglų kalba (7 vieši rinkiniai) | Nenurodyta | 5.74% |
| Laiko žymos | Nenurodyta | Palaikomos žodžių lygio laiko žymos |
| API prieiga | Neprieinama | Planuojama (dar neprieinama) |
Kodėl tai svarbu?
Tai rodo tęstinę pažangą atvirų ASR modelių srityje, specialiai pritaikytų mažiau atstovaujamiems dialektams ir triukšmingoms/telefoninėms sąlygoms, kas svarbu bet kuriai komandai, kurianti skambučių transkripciją ar balso analitiką sudėtingose akustinėse sąlygose, nors čia nėra lietuvių kalbos palaikymo.
Ką tai reiškia AI agentams ir kontaktų centrams?
Šis modelis šiuo metu nepalaiko lietuvių kalbos, todėl tiesiogiai netinka skambučių transkripcijai tame rinkoje, tačiau aiškus treniravimas telefonijos trukdžiams, triukšmui ir persidengiančiai kalbai, kartu su žodžių lygio laiko žymomis, yra naudingas atskaitos taškas vertinant ar lyginant STT variklius kontaktų centrų sprendimuose; verta stebėti galimą kalbų sąrašo plėtrą ir planuojamą API.
🧪 Verta testuoti
Demonstracinės versijos išbandymas galėtų padėti palyginti atsparumo technikas (triukšmas, telefonijos artefaktai, laiko žymos) su šiuo metu naudojamais STT varikliais skambučių apdorojimo grandinėse, net ir be lietuvių kalbos palaikymo.
Šaltiniai
- Hugging FaceOficialusPirminis šaltinisOriginalus straipsnis →„Introducing Falcon ASR“2026-10-07 16:21
- Šaltinio publikavimo data
- 2026-10-07 16:21
- Mūsų sistema rado
- 2026-10-07 16:36
- Santrauka sugeneruota
- 2026-10-07 16:37
Straipsnį pagal originalų šaltinį parašė AI. Faktai, skaičiai ir kainos — iš šaltinio; trūkstamos reikšmės pažymėtos „Nėra oficialių duomenų“. Teisinė informacija, autorių teisės ir privatumas