Przejdź do treści
czwartek, 8 października 2026
Tenesys AI News
Subskrypcja
Modele· Ważne· 🧪 Warte przetestowania

Google udostępnia ML Drift — nowy silnik GPU do wnioskowania AI na urządzeniu

W skrócie: Google wydał ML Drift, otwartoźródłowy, wieloplatformowy silnik obliczeniowy GPU do wnioskowania ML na urządzeniu, zastępujący dotychczasowy TFLite GPU delegate. Ujednolica obsługę shaderów między OpenGL ES, OpenCL, Metal i WebGPU, dodaje obsługę tensorów 5D oraz wprowadza optymalizacje etapowe dla faz prefill/decode w LLM. Jest już wdrożony produkcyjnie w Chrome, YouTube Shorts, Google Photos, Meet oraz aplikacjach partnerów Adobe i Snap.

Źródło: Google DevelopersGoogleOryginalny artykuł ↗

To podsumowanie zostało automatycznie przygotowane przez sztuczną inteligencję na podstawie publikacji „Google Developers”. To nasz tekst, nie kopia oryginału — fakty, liczby i cytaty należą do źródła, do którego link znajduje się powyżej i poniżej.

Co się zmieniło?

  • 1Ujednolicona wirtualizacja tensorów eliminuje potrzebę oddzielnych baz kodu shaderów dla każdego backendu
  • 2Dodano obsługę tensorów 5D, usuwając wcześniejsze ograniczenie do 4D
  • 3Etapowe przełączanie kerneli optymalizuje fazy prefill (ograniczoną obliczeniowo) i decode (ograniczoną przepustowością pamięci) w LLM
  • 4Backend WebGPU przez Dawn działa teraz natywnie na Windows i Linux, nie tylko w przeglądarce
  • 5Do 12% mniejsze zużycie pamięci w porównaniu z innymi frameworkami w testach Gemma
  • 6Dotychczasowy TFLite GPU delegate nie otrzyma już nowych funkcji
ParametrByłoJest
Wymiarowość tensorówTylko tensory 4D (TFLite GPU delegate)Obsługa tensorów 5D od razu dostępna
Pokrycie platformBackendy OpenGL ES, OpenCL, Metal utrzymywane osobnoUjednolicony model shaderów poprzez wirtualizację tensorów we wszystkich platformach OpenGL ES, OpenCL, Metal, WebGPU, p
Zużycie pamięciPoziom bazowy (stary GPU delegate)Do 12% niższe zużycie pamięci w testach Gemma
Wnioskowanie LLMBrak optymalizacji etapowejEtapowe przełączanie kerneli prefill vs decode, niestandardowy układ pamięci podręcznej KV, kwantyzacja aktywacji w kern

Dlaczego to ważne?

Zespoły uruchamiające modele mowy, wizji czy generatywne na urządzeniach zyskują jeden, otwartoźródłowy runtime zamiast fragmentarycznych silników GPU, z realnymi efektami jak 40% niższe opóźnienie klatki w YouTube Shorts czy 30% szybsze wnioskowanie mobilne w aplikacjach Adobe i Snap.

Co to oznacza dla agentów AI i contact center?

Jeśli jakakolwiek część potoku voice AI działa na urządzeniu (aplikacje mobilne, urządzenia brzegowe lub lokalna obsługa połączeń wspomagana LLM ze względu na opóźnienia lub prywatność), warto porównać to z obecną konfiguracją wnioskowania GPU, szczególnie pod kątem etapowego dekodowania LLM i zużycia pamięci, które wpływają na liczbę równoległych sesji obsługiwanych przez urządzenie.

🧪 Warte przetestowania

Etapowe optymalizacje prefill/decode oraz niższe zużycie pamięci mogą bezpośrednio poprawić opóźnienia i liczbę równoległych sesji w każdym wnioskowaniu mowy lub LLM na urządzeniu wykorzystywanym w wdrożeniach agentów głosowych.

ML Drift GPU inference engine· Nowa

Źródła

  • Google DevelopersOficjalneŹródło pierwotne
    „ML Drift: Next-Gen GPU AI/ML Inference at the Edge“
    8 paź 2026, 03:00
    Oryginalny artykuł →
Data publikacji źródła
8 paź 2026, 03:00
Znalezione przez nasz system
8 paź 2026, 22:09
Podsumowanie wygenerowano
8 paź 2026, 22:10

Artykuł napisała AI na podstawie oryginalnego źródła. Fakty, liczby i ceny pochodzą ze źródła; brakujące wartości oznaczono „Brak oficjalnych danych”. Informacje prawne, prawa autorskie i prywatność

Google udostępnia ML Drift — nowy silnik GPU do wnioskowania AI na urządzeniu · TENESYS AI NEWS