Pereiti prie turinio
2026 m. spalio 4 d., sekmadienis
Tenesys AI News
Prenumerata

Visos naujienos

TENESYS AI NEWS seka svarbiausias AI naujienas ir paaiškina, kas pasikeitė, kodėl tai svarbu ir ar technologiją verta išbandyti.

#MaxText — 1 straipsnis ✕

„Google“ TPU komanda MaxText pakartojo Ai2 „Olmo 3 7B“ treniravimo procesą

„Google Cloud“ TPU inžinerių komanda kartu su Ai2 nuo nulio atkūrė „Olmo 3 7B“ modelio pre-treniravimą naudodama MaxText — „Google“ JAX/XLA treniravimo karkasą, veikiantį TPU įrenginiuose vietoje originalaus Ai2 PyTorch/GPU sprendimo. Jie pasiekė sutapimą su Ai2 paskelbtais rezultatais ne tik treniravimo nuostolio kreivėje, bet ir keturiose nepriklausomose atskirtų (held-out) vertinimo plotmėse per visą ~5,93 trilijono žetonų, 1,41 mln. žingsnių 1 etapo treniravimą bei 2 etapo „annealing“ fazę. Šio darbo metu jie perkėlė į MaxText neįprastą „Olmo 3“ architektūrą (pertvarkytą normalizavimo bloką, QK-norm, 3:1 slankaus/globalaus dėmesio santykį) ir aptiko duomenų kraunimo klaidą, kuri tyliai „pagražino“ rezultatus dėl įsiminimo, o ne tikro mokymosi.

Google Developers