Przejdź do treści
niedziela, 4 października 2026
Tenesys AI News
Subskrypcja

Google pokazuje, jak przyspieszyć uwagę w dyfuzji wideo na TPU 2,4x

W skrócie: Inżynierowie Google opisują, jak zaimplementowali rzadką uwagę przestrzenno-czasową (sparse spatio-temporal attention) dla modeli dyfuzji wideo na chipach TPU v6e, przekształcając teoretyczną rzadkość podejścia Sparse VideoGen (SVG) w realne przyspieszenia sprzętowe. Dzięki serii optymalizacji kernela (specjalizacja kafelków pełnych/brzegowych, strojenie rozmiaru kafelków oraz wyrównanie kafelków maski) zredukowali opóźnienie kernela uwagi z 96,37ms (naiwna wersja rzadka) do 32,76ms, co daje 2,40x przyspieszenie względem gęstej Splash Attention na pojedynczym chipie TPU v6e, przy 75,6K tokenów, 10 głowicach i wymiarze głowicy 128.

Źródło: Google DevelopersGoogleOryginalny artykuł ↗

To podsumowanie zostało automatycznie przygotowane przez sztuczną inteligencję na podstawie publikacji „Google Developers”. To nasz tekst, nie kopia oryginału — fakty, liczby i cytaty należą do źródła, do którego link znajduje się powyżej i poniżej.

Co się zmieniło?

  • 1Naiwna rzadka uwaga (B1) była w rzeczywistości o 22% wolniejsza niż gęsta uwaga, mimo pomijania kafelków, z powodu niepotrzebnego maskowania wewnątrz kafelków
  • 2Specjalizacja kafelków pełnych/brzegowych (B2) skróciła opóźnienie z 96,37ms do 54,12ms (31% szybciej niż gęsta wersja)
  • 3Strojenie rozmiaru kafelków pokazało, że konfiguracja z najmniejszą ilością pracy związanej z maskowaniem nie była najszybsza
  • 4Finalne wyrównane do kafelków rzadkie przeszukiwanie (B3) zredukowało opóźnienie do 32,76ms, czyli 2,40x przyspieszenie względem gęstej Splash Attention
  • 5Permutacja tokenów z układu frame-major na temporal-major poprawiła wydajność uwagi w głowicach czasowych (44,40ms vs 74,14ms bez permutacji)

Dlaczego to ważne?

Szybsze wnioskowanie w generowaniu wideo na TPU ma znaczenie dla firm budujących produkty oparte na dyfuzji wideo, pokazując, że teoretyczne zyski z rzadkości wymagają starannego, świadomego sprzętowo inżynierstwa kernela, aby uzyskać rzeczywiste przyspieszenia — lekcja mająca szerokie zastosowanie przy optymalizacji dowolnego obciążenia inferencyjnego opartego na rzadkości/uwadze.

Źródła

  • Google DevelopersOficjalneŹródło pierwotne
    „Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs“
    30 wrz 2026, 03:00
    Oryginalny artykuł →
Data publikacji źródła
30 wrz 2026, 03:00
Znalezione przez nasz system
2 paź 2026, 19:51
Podsumowanie wygenerowano
2 paź 2026, 20:05

Artykuł napisała AI na podstawie oryginalnego źródła. Fakty, liczby i ceny pochodzą ze źródła; brakujące wartości oznaczono „Brak oficjalnych danych”. Informacje prawne, prawa autorskie i prywatność

Google pokazuje, jak przyspieszyć uwagę w dyfuzji wideo na TPU 2,4x · TENESYS AI NEWS