„Google“ atkūrė „Ai2“ Olmo 3 7B modelio mokymą naudodama MaxText TPU
„Google“ TPU inžinerijos komanda nuo nulio atkūrė visiškai atvirą Allen Institute for AI (Ai2) modelį Olmo 3 7B, naudodama JAX/XLA pagrindu veikiančią mokymo sistemą MaxText, ir sutapo su Ai2 PyTorch/GPU etaloniniu paleidimu pagal realių (angl. held-out) metrikų rezultatus, o ne vien pagal nuostolių kreivę. Atkūrimas apėmė 1-ąjį pre-training etapą (~5,93 trln. žymenų, 1,41 mln. žingsnių) ir 2-ąjį vidurinio mokymo „anneal“ etapą, taip pat Olmo 3 nestandartinės architektūros (pertvarkytas normos blokas, QK-norm, 3:1 slankaus/globalaus dėmesio santykis) perkėlimą į JAX. Komanda taip pat aptiko ir pataisė subtilią duomenų įkėlimo klaidą, dėl kurios mokymo nuostoliai klaidingai atrodė geresni dėl atminimo (memorization) efekto.

