Przejdź do treści
piątek, 9 października 2026
Tenesys AI News
Subskrypcja

Wszystkie wiadomości

TENESYS AI NEWS śledzi najważniejsze wiadomości o AI i wyjaśnia, co się zmieniło, dlaczego to ważne i czy technologię warto przetestować.

#Megatron Core — 1 artykuł ✕

NVIDIA pokazuje, jak uczynić wielkoskalowe pretrenowanie modeli deterministycznym bitowo przy niskim koszcie

NVIDIA opisała przepływ pracy wbudowany w Megatron Core, który sprawia, że wielkoskalowe pretrenowanie jest deterministyczne na poziomie bitowym — niezależne lub wznawiane z checkpointu uruchomienia treningu podążają dokładnie tą samą trajektorią numeryczną. Dzięki fingerprintingowi tensorów na poziomie faz treningu, modułów, operacji i kerneli inżynierowie mogą namierzyć niedeterminizm aż do konkretnego kernela i go naprawić. Dla modelu Nemotron z bilionem parametrów działającego na 2432 GPU optymalizacje obniżyły koszt wymuszania determinizmu ('determinism tax') do około 2%, zachowując identyczne bitowo wyniki przez 800 kroków treningu.

NVIDIA Developer