NVIDIA pokazuje, jak uczynić wielkoskalowe pretrenowanie modeli deterministycznym bitowo przy niskim koszcie
NVIDIA opisała przepływ pracy wbudowany w Megatron Core, który sprawia, że wielkoskalowe pretrenowanie jest deterministyczne na poziomie bitowym — niezależne lub wznawiane z checkpointu uruchomienia treningu podążają dokładnie tą samą trajektorią numeryczną. Dzięki fingerprintingowi tensorów na poziomie faz treningu, modułów, operacji i kerneli inżynierowie mogą namierzyć niedeterminizm aż do konkretnego kernela i go naprawić. Dla modelu Nemotron z bilionem parametrów działającego na 2432 GPU optymalizacje obniżyły koszt wymuszania determinizmu ('determinism tax') do około 2%, zachowując identyczne bitowo wyniki przez 800 kroków treningu.