Pereiti prie turinio
2026 m. spalio 8 d., ketvirtadienis
Tenesys AI News
Prenumerata
Modeliai· Svarbu· 🧪 Verta testuoti

„Google“ atvėrė ML Drift — naują GPU variklį AI inferencijai įrenginyje

Trumpai: „Google“ išleido ML Drift — atvirojo kodo, kelioms platformoms skirtą GPU skaičiavimo variklį ML inferencijai įrenginyje, pakeičiantį senąjį TFLite GPU delegate. Jis suvienodina šeiderių tvarkymą tarp OpenGL ES, OpenCL, Metal ir WebGPU, prideda 5D tenzorių palaikymą ir įveda etapais pagrįstus optimizavimus LLM prefill/decode fazėms. Jis jau veikia gamyboje „Chrome“, „YouTube Shorts“, „Google Photos“, „Meet“ ir partnerių programose iš „Adobe“ bei „Snap“.

Šaltinis: Google DevelopersGoogleOriginalus straipsnis ↗

Šią santrauką automatiškai parengė dirbtinis intelektas pagal „Google Developers“ publikaciją. Tai mūsų tekstas, ne originalo kopija — faktai, skaičiai ir citatos priklauso šaltiniui, kurio nuoroda pateikta viršuje ir apačioje.

Kas pasikeitė?

  • 1Suvienodinta tenzorių virtualizacija panaikina poreikį atskiroms šeiderių kodų bazėms kiekvienai platformai
  • 2Pridėtas 5D tenzorių palaikymas, pašalinantis ankstesnį 4D apribojimą
  • 3Etapais pagrįstas branduolių perjungimas optimizuoja LLM prefill (skaičiavimams imlų) ir decode (atminties pralaidumui imlų) etapus
  • 4WebGPU variklis per Dawn dabar veikia natyviai Windows ir Linux, ne tik naršyklėje
  • 5Iki 12% mažesnės atminties sąnaudos lyginant su kitomis sistemomis Gemma testuose
  • 6Senasis TFLite GPU delegate nebegaus naujų funkcijų atnaujinimų
ParametrasBuvoDabar
Tenzorių dimensijaTik 4D tenzoriai (TFLite GPU delegate)5D tenzorių palaikymas iš karto
Platformų aprėptisOpenGL ES, OpenCL, Metal variantai palaikomi atskiraiSuvienodintas šeiderių modelis per tenzorių virtualizaciją visose OpenGL ES, OpenCL, Metal, WebGPU platformose, plius na
Atminties sąnaudosBazinis lygis (senasis GPU delegate)Iki 12% mažesnės atminties sąnaudos Gemma testuose
LLM inferencijaNėra etapais pagrįsto optimizavimoEtapais pagrįstas branduolių perjungimas prefill vs decode, pasirinktinis KV talpyklos išdėstymas, aktyvacijos kvantavim

Kodėl tai svarbu?

Komandos, vykdančios kalbos, regėjimo ar generatyvinius modelius įrenginiuose, gauna vieną atvirojo kodo vykdymo laiką vietoj susiskaidžiusių GPU variklių, su realiais rezultatais, tokiais kaip 40% mažesnis kadro vėlavimas „YouTube Shorts“ ir 30% greitesnė inferencija mobiliuosiuose „Adobe“ ir „Snap“ programose.

Ką tai reiškia AI agentams ir kontaktų centrams?

Jei bet kuri balso AI grandinės dalis veikia įrenginyje (mobiliose programose, edge įrenginiuose ar vietiniame LLM skambučių apdorojime dėl vėlavimo ar privatumo), verta palyginti su dabartine GPU inferencijos sąranka, ypač etapais pagrįstą LLM dekodavimą ir atminties sąnaudas, kurios lemia, kiek lygiagrečių sesijų įrenginys gali apdoroti.

🧪 Verta testuoti

Etapais pagrįsti prefill/decode optimizavimai ir mažesnės atminties sąnaudos galėtų tiesiogiai pagerinti vėlavimą ir lygiagretumą bet kokiai įrenginyje vykdomai kalbos ar LLM inferencijai, naudojamai balso agentų diegimuose.

ML Drift GPU inference engine· Nauja

Šaltiniai

  • Google DevelopersOficialusPirminis šaltinis
    „ML Drift: Next-Gen GPU AI/ML Inference at the Edge“
    2026-10-08 03:00
    Originalus straipsnis →
Šaltinio publikavimo data
2026-10-08 03:00
Mūsų sistema rado
2026-10-08 22:09
Santrauka sugeneruota
2026-10-08 22:10

Straipsnį pagal originalų šaltinį parašė AI. Faktai, skaičiai ir kainos — iš šaltinio; trūkstamos reikšmės pažymėtos „Nėra oficialių duomenų“. Teisinė informacija, autorių teisės ir privatumas

„Google“ atvėrė ML Drift — naują GPU variklį AI inferencijai įrenginyje · TENESYS AI NEWS