Google udostępnia ML Drift — nowy silnik GPU do wnioskowania AI na urządzeniu
W skrócie: Google wydał ML Drift, otwartoźródłowy, wieloplatformowy silnik obliczeniowy GPU do wnioskowania ML na urządzeniu, zastępujący dotychczasowy TFLite GPU delegate. Ujednolica obsługę shaderów między OpenGL ES, OpenCL, Metal i WebGPU, dodaje obsługę tensorów 5D oraz wprowadza optymalizacje etapowe dla faz prefill/decode w LLM. Jest już wdrożony produkcyjnie w Chrome, YouTube Shorts, Google Photos, Meet oraz aplikacjach partnerów Adobe i Snap.
To podsumowanie zostało automatycznie przygotowane przez sztuczną inteligencję na podstawie publikacji „Google Developers”. To nasz tekst, nie kopia oryginału — fakty, liczby i cytaty należą do źródła, do którego link znajduje się powyżej i poniżej.
Co się zmieniło?
- 1Ujednolicona wirtualizacja tensorów eliminuje potrzebę oddzielnych baz kodu shaderów dla każdego backendu
- 2Dodano obsługę tensorów 5D, usuwając wcześniejsze ograniczenie do 4D
- 3Etapowe przełączanie kerneli optymalizuje fazy prefill (ograniczoną obliczeniowo) i decode (ograniczoną przepustowością pamięci) w LLM
- 4Backend WebGPU przez Dawn działa teraz natywnie na Windows i Linux, nie tylko w przeglądarce
- 5Do 12% mniejsze zużycie pamięci w porównaniu z innymi frameworkami w testach Gemma
- 6Dotychczasowy TFLite GPU delegate nie otrzyma już nowych funkcji
| Parametr | Było | Jest |
|---|---|---|
| Wymiarowość tensorów | Tylko tensory 4D (TFLite GPU delegate) | Obsługa tensorów 5D od razu dostępna |
| Pokrycie platform | Backendy OpenGL ES, OpenCL, Metal utrzymywane osobno | Ujednolicony model shaderów poprzez wirtualizację tensorów we wszystkich platformach OpenGL ES, OpenCL, Metal, WebGPU, p |
| Zużycie pamięci | Poziom bazowy (stary GPU delegate) | Do 12% niższe zużycie pamięci w testach Gemma |
| Wnioskowanie LLM | Brak optymalizacji etapowej | Etapowe przełączanie kerneli prefill vs decode, niestandardowy układ pamięci podręcznej KV, kwantyzacja aktywacji w kern |
Dlaczego to ważne?
Zespoły uruchamiające modele mowy, wizji czy generatywne na urządzeniach zyskują jeden, otwartoźródłowy runtime zamiast fragmentarycznych silników GPU, z realnymi efektami jak 40% niższe opóźnienie klatki w YouTube Shorts czy 30% szybsze wnioskowanie mobilne w aplikacjach Adobe i Snap.
Co to oznacza dla agentów AI i contact center?
Jeśli jakakolwiek część potoku voice AI działa na urządzeniu (aplikacje mobilne, urządzenia brzegowe lub lokalna obsługa połączeń wspomagana LLM ze względu na opóźnienia lub prywatność), warto porównać to z obecną konfiguracją wnioskowania GPU, szczególnie pod kątem etapowego dekodowania LLM i zużycia pamięci, które wpływają na liczbę równoległych sesji obsługiwanych przez urządzenie.
🧪 Warte przetestowania
Etapowe optymalizacje prefill/decode oraz niższe zużycie pamięci mogą bezpośrednio poprawić opóźnienia i liczbę równoległych sesji w każdym wnioskowaniu mowy lub LLM na urządzeniu wykorzystywanym w wdrożeniach agentów głosowych.
Źródła
- Google DevelopersOficjalneŹródło pierwotneOryginalny artykuł →„ML Drift: Next-Gen GPU AI/ML Inference at the Edge“8 paź 2026, 03:00
- Data publikacji źródła
- 8 paź 2026, 03:00
- Znalezione przez nasz system
- 8 paź 2026, 22:09
- Podsumowanie wygenerowano
- 8 paź 2026, 22:10
Artykuł napisała AI na podstawie oryginalnego źródła. Fakty, liczby i ceny pochodzą ze źródła; brakujące wartości oznaczono „Brak oficjalnych danych”. Informacje prawne, prawa autorskie i prywatność