Pereiti prie turinio
2026 m. spalio 4 d., sekmadienis
Tenesys AI News
Prenumerata

Visos naujienos

TENESYS AI NEWS seka svarbiausias AI naujienas ir paaiškina, kas pasikeitė, kodėl tai svarbu ir ar technologiją verta išbandyti.

#TPU — 2 straipsniai ✕

„Google“ atkūrė „Ai2“ Olmo 3 7B modelio mokymą naudodama MaxText TPU

„Google“ TPU inžinerijos komanda nuo nulio atkūrė visiškai atvirą Allen Institute for AI (Ai2) modelį Olmo 3 7B, naudodama JAX/XLA pagrindu veikiančią mokymo sistemą MaxText, ir sutapo su Ai2 PyTorch/GPU etaloniniu paleidimu pagal realių (angl. held-out) metrikų rezultatus, o ne vien pagal nuostolių kreivę. Atkūrimas apėmė 1-ąjį pre-training etapą (~5,93 trln. žymenų, 1,41 mln. žingsnių) ir 2-ąjį vidurinio mokymo „anneal“ etapą, taip pat Olmo 3 nestandartinės architektūros (pertvarkytas normos blokas, QK-norm, 3:1 slankaus/globalaus dėmesio santykis) perkėlimą į JAX. Komanda taip pat aptiko ir pataisė subtilią duomenų įkėlimo klaidą, dėl kurios mokymo nuostoliai klaidingai atrodė geresni dėl atminimo (memorization) efekto.

Google Developers

Google parodo, kaip TPU pagreitinti vaizdo difuzijos dėmesio skaičiavimus 2,4 karto

Google inžinieriai aprašo, kaip jie įgyvendino retą (sparse) erdvinio-laikinio dėmesio (attention) skaičiavimą vaizdo difuzijos modeliams TPU v6e lustuose, paversdami teorinį Sparse VideoGen (SVG) metodo retumą realiu aparatinės įrangos pagreičiu. Per kelis branduolio optimizavimo etapus (plytelių specializaciją, dydžio derinimą ir kaukės suderinimą su plytelėmis) jie sumažino dėmesio skaičiavimo laiką nuo 96,37 ms (naivus retas variantas) iki 32,76 ms – tai 2,40 karto greičiau nei tankus Splash Attention viename TPU v6e luste, naudojant 75,6 tūkst. token, 10 galvų ir 128 galvos dimensiją.

Google Developers