Przejdź do treści
niedziela, 4 października 2026
Tenesys AI News
Subskrypcja

Wszystkie wiadomości

TENESYS AI NEWS śledzi najważniejsze wiadomości o AI i wyjaśnia, co się zmieniło, dlaczego to ważne i czy technologię warto przetestować.

#TPU — 2 artykuły ✕

Zespół TPU Google odtwarza trening Olmo 3 7B od Ai2 w MaxText

Zespół inżynierski Google Cloud TPU współpracował z Ai2, aby od podstaw odtworzyć pre-trening Olmo 3 7B przy użyciu MaxText, frameworku treningowego JAX/XLA od Google, działającego na TPU zamiast oryginalnej konfiguracji PyTorch/GPU od Ai2. Dopasowali opublikowane wyniki Ai2 nie tylko w zakresie krzywej straty treningowej, ale na czterech niezależnych powierzchniach ewaluacyjnych typu held-out, obejmując cały run etapu 1 (~5,93 biliona tokenów, 1,41 miliona kroków) oraz fazę annealingu etapu 2. Po drodze przenieśli nietypową architekturę Olmo 3 (bloki z przestawioną normalizacją, QK-norm, stosunek uwagi sliding/global 3:1) do MaxText i wykryli błąd w ładowarce danych, który po cichu zawyżał pozorną wydajność poprzez zapamiętywanie, a nie rzeczywiste uczenie się.

Google Developers

Google pokazuje, jak przyspieszyć uwagę w dyfuzji wideo na TPU 2,4x

Inżynierowie Google opisują, jak zaimplementowali rzadką uwagę przestrzenno-czasową (sparse spatio-temporal attention) dla modeli dyfuzji wideo na chipach TPU v6e, przekształcając teoretyczną rzadkość podejścia Sparse VideoGen (SVG) w realne przyspieszenia sprzętowe. Dzięki serii optymalizacji kernela (specjalizacja kafelków pełnych/brzegowych, strojenie rozmiaru kafelków oraz wyrównanie kafelków maski) zredukowali opóźnienie kernela uwagi z 96,37ms (naiwna wersja rzadka) do 32,76ms, co daje 2,40x przyspieszenie względem gęstej Splash Attention na pojedynczym chipie TPU v6e, przy 75,6K tokenów, 10 głowicach i wymiarze głowicy 128.

Google Developers