Google pokazuje, jak przyspieszyć uwagę w dyfuzji wideo na TPU 2,4x
W skrócie: Inżynierowie Google opisują, jak zaimplementowali rzadką uwagę przestrzenno-czasową (sparse spatio-temporal attention) dla modeli dyfuzji wideo na chipach TPU v6e, przekształcając teoretyczną rzadkość podejścia Sparse VideoGen (SVG) w realne przyspieszenia sprzętowe. Dzięki serii optymalizacji kernela (specjalizacja kafelków pełnych/brzegowych, strojenie rozmiaru kafelków oraz wyrównanie kafelków maski) zredukowali opóźnienie kernela uwagi z 96,37ms (naiwna wersja rzadka) do 32,76ms, co daje 2,40x przyspieszenie względem gęstej Splash Attention na pojedynczym chipie TPU v6e, przy 75,6K tokenów, 10 głowicach i wymiarze głowicy 128.
To podsumowanie zostało automatycznie przygotowane przez sztuczną inteligencję na podstawie publikacji „Google Developers”. To nasz tekst, nie kopia oryginału — fakty, liczby i cytaty należą do źródła, do którego link znajduje się powyżej i poniżej.
Co się zmieniło?
- 1Naiwna rzadka uwaga (B1) była w rzeczywistości o 22% wolniejsza niż gęsta uwaga, mimo pomijania kafelków, z powodu niepotrzebnego maskowania wewnątrz kafelków
- 2Specjalizacja kafelków pełnych/brzegowych (B2) skróciła opóźnienie z 96,37ms do 54,12ms (31% szybciej niż gęsta wersja)
- 3Strojenie rozmiaru kafelków pokazało, że konfiguracja z najmniejszą ilością pracy związanej z maskowaniem nie była najszybsza
- 4Finalne wyrównane do kafelków rzadkie przeszukiwanie (B3) zredukowało opóźnienie do 32,76ms, czyli 2,40x przyspieszenie względem gęstej Splash Attention
- 5Permutacja tokenów z układu frame-major na temporal-major poprawiła wydajność uwagi w głowicach czasowych (44,40ms vs 74,14ms bez permutacji)
Dlaczego to ważne?
Szybsze wnioskowanie w generowaniu wideo na TPU ma znaczenie dla firm budujących produkty oparte na dyfuzji wideo, pokazując, że teoretyczne zyski z rzadkości wymagają starannego, świadomego sprzętowo inżynierstwa kernela, aby uzyskać rzeczywiste przyspieszenia — lekcja mająca szerokie zastosowanie przy optymalizacji dowolnego obciążenia inferencyjnego opartego na rzadkości/uwadze.
Źródła
- Google DevelopersOficjalneŹródło pierwotneOryginalny artykuł →„Accelerating Spatio-Temporal Attention for Video Diffusion on TPUs“30 wrz 2026, 03:00
- Data publikacji źródła
- 30 wrz 2026, 03:00
- Znalezione przez nasz system
- 2 paź 2026, 19:51
- Podsumowanie wygenerowano
- 2 paź 2026, 20:05
Artykuł napisała AI na podstawie oryginalnego źródła. Fakty, liczby i ceny pochodzą ze źródła; brakujące wartości oznaczono „Brak oficjalnych danych”. Informacje prawne, prawa autorskie i prywatność