„Google“ atvėrė ML Drift — naują GPU variklį AI inferencijai įrenginyje
Trumpai: „Google“ išleido ML Drift — atvirojo kodo, kelioms platformoms skirtą GPU skaičiavimo variklį ML inferencijai įrenginyje, pakeičiantį senąjį TFLite GPU delegate. Jis suvienodina šeiderių tvarkymą tarp OpenGL ES, OpenCL, Metal ir WebGPU, prideda 5D tenzorių palaikymą ir įveda etapais pagrįstus optimizavimus LLM prefill/decode fazėms. Jis jau veikia gamyboje „Chrome“, „YouTube Shorts“, „Google Photos“, „Meet“ ir partnerių programose iš „Adobe“ bei „Snap“.
Šią santrauką automatiškai parengė dirbtinis intelektas pagal „Google Developers“ publikaciją. Tai mūsų tekstas, ne originalo kopija — faktai, skaičiai ir citatos priklauso šaltiniui, kurio nuoroda pateikta viršuje ir apačioje.
Kas pasikeitė?
- 1Suvienodinta tenzorių virtualizacija panaikina poreikį atskiroms šeiderių kodų bazėms kiekvienai platformai
- 2Pridėtas 5D tenzorių palaikymas, pašalinantis ankstesnį 4D apribojimą
- 3Etapais pagrįstas branduolių perjungimas optimizuoja LLM prefill (skaičiavimams imlų) ir decode (atminties pralaidumui imlų) etapus
- 4WebGPU variklis per Dawn dabar veikia natyviai Windows ir Linux, ne tik naršyklėje
- 5Iki 12% mažesnės atminties sąnaudos lyginant su kitomis sistemomis Gemma testuose
- 6Senasis TFLite GPU delegate nebegaus naujų funkcijų atnaujinimų
| Parametras | Buvo | Dabar |
|---|---|---|
| Tenzorių dimensija | Tik 4D tenzoriai (TFLite GPU delegate) | 5D tenzorių palaikymas iš karto |
| Platformų aprėptis | OpenGL ES, OpenCL, Metal variantai palaikomi atskirai | Suvienodintas šeiderių modelis per tenzorių virtualizaciją visose OpenGL ES, OpenCL, Metal, WebGPU platformose, plius na |
| Atminties sąnaudos | Bazinis lygis (senasis GPU delegate) | Iki 12% mažesnės atminties sąnaudos Gemma testuose |
| LLM inferencija | Nėra etapais pagrįsto optimizavimo | Etapais pagrįstas branduolių perjungimas prefill vs decode, pasirinktinis KV talpyklos išdėstymas, aktyvacijos kvantavim |
Kodėl tai svarbu?
Komandos, vykdančios kalbos, regėjimo ar generatyvinius modelius įrenginiuose, gauna vieną atvirojo kodo vykdymo laiką vietoj susiskaidžiusių GPU variklių, su realiais rezultatais, tokiais kaip 40% mažesnis kadro vėlavimas „YouTube Shorts“ ir 30% greitesnė inferencija mobiliuosiuose „Adobe“ ir „Snap“ programose.
Ką tai reiškia AI agentams ir kontaktų centrams?
Jei bet kuri balso AI grandinės dalis veikia įrenginyje (mobiliose programose, edge įrenginiuose ar vietiniame LLM skambučių apdorojime dėl vėlavimo ar privatumo), verta palyginti su dabartine GPU inferencijos sąranka, ypač etapais pagrįstą LLM dekodavimą ir atminties sąnaudas, kurios lemia, kiek lygiagrečių sesijų įrenginys gali apdoroti.
🧪 Verta testuoti
Etapais pagrįsti prefill/decode optimizavimai ir mažesnės atminties sąnaudos galėtų tiesiogiai pagerinti vėlavimą ir lygiagretumą bet kokiai įrenginyje vykdomai kalbos ar LLM inferencijai, naudojamai balso agentų diegimuose.
Šaltiniai
- Google DevelopersOficialusPirminis šaltinisOriginalus straipsnis →„ML Drift: Next-Gen GPU AI/ML Inference at the Edge“2026-10-08 03:00
- Šaltinio publikavimo data
- 2026-10-08 03:00
- Mūsų sistema rado
- 2026-10-08 22:09
- Santrauka sugeneruota
- 2026-10-08 22:10
Straipsnį pagal originalų šaltinį parašė AI. Faktai, skaičiai ir kainos — iš šaltinio; trūkstamos reikšmės pažymėtos „Nėra oficialių duomenų“. Teisinė informacija, autorių teisės ir privatumas