Pereiti prie turinio
2026 m. spalio 9 d., penktadienis
Tenesys AI News
Prenumerata

NVIDIA parodė, kaip padaryti didelio masto modelių pretreniravimą bitiniu lygmeniu determinuotą pigiai

Trumpai: NVIDIA aprašė Megatron Core darbo eigą, kuri leidžia didelio masto modelių pretreniravimui būti bitiniu lygmeniu determinuotam – tai reiškia, kad nepriklausomi arba iš kontrolinio taško atnaujinti treniravimo paleidimai vyksta lygiai tuo pačiu skaitiniu keliu. Naudojant tenzorių fingerprinting metodą per treniravimo fazes, modulius, operacijas ir branduolius (kernels), inžinieriai gali atsekti nedeterminizmą iki konkretaus branduolio ir jį ištaisyti. Trilijono parametrų Nemotron modeliui, veikiančiam su 2 432 GPU, optimizacijos sumažino determinizmo kainą iki apie 2 %, išlaikant bitiniu lygmeniu identiškus rezultatus per 800 treniravimo žingsnių.

Šaltinis: NVIDIA DeveloperNVIDIAOriginalus straipsnis ↗

Šią santrauką automatiškai parengė dirbtinis intelektas pagal „NVIDIA Developer“ publikaciją. Tai mūsų tekstas, ne originalo kopija — faktai, skaičiai ir citatos priklauso šaltiniui, kurio nuoroda pateikta viršuje ir apačioje.

Kas pasikeitė?

  • 1Megatron-LM PR #7262 pristato tvarkingą per-rank tenzorių fingerprinting metodą nedeterminizmui lokalizuoti
  • 2Laipsniškas sekimas susiaurina skirtumus nuo treniravimo iteracijos iki fazės, modulio, operacijos ir branduolio
  • 3Branduolio lygmens pataisymai, pvz., atskiros išvesties vietos kiekvienam grouped-GEMM rašytojui ir fiksuota sumavimo tvarka, atkuria determinizmą neprarandant lygiagretumo
  • 4Determinizmo kaina sumažinta iki maždaug 2 % su 2 432 GPU, išlaikant bitinį determinizmą per 800 žingsnių
  • 5Megatron Core prideda recepto validaciją (--deterministic-mode), branduolių testavimą ir modulių validaciją FP8/FP4 konfigūracijose, siekiant išvengti regresijų

Kodėl tai svarbu?

Bitinis determinizmas leidžia inžinieriams tiksliai atkartoti nuostolio šuolį, patikrinti, ar sistemos ar programinės įrangos pakeitimas turėjo numatytą poveikį, ir atnaujinti pertrauktą treniravimą nepakeičiant rezultatų – ir visa tai be didelio našumo praradimo, kas svarbu, nes 10 000 GPU mastu net 10 procentinių punktų sumažėjimas gali sutaupyti apie 100 000 GPU-dienų.

Ką tai reiškia AI agentams ir kontaktų centrams?

Tai aktualu daugiausia organizacijoms, kurios treniruoja ar derina didelio masto pamatinius modelius, o ne komandoms, naudojančioms modelius per API balso agentams, todėl tiesioginės įtakos kasdieniam balso AI ar kontaktų centro darbui nedaug.

Šaltiniai

  • NVIDIA DeveloperOficialusPirminis šaltinis
    „Scale Bitwise-Deterministic Pretraining with NVIDIA Megatron Core“
    2026-10-06 22:58
    Originalus straipsnis →
Šaltinio publikavimo data
2026-10-06 22:58
Mūsų sistema rado
2026-10-09 02:09
Santrauka sugeneruota
2026-10-09 02:10

Straipsnį pagal originalų šaltinį parašė AI. Faktai, skaičiai ir kainos — iš šaltinio; trūkstamos reikšmės pažymėtos „Nėra oficialių duomenų“. Teisinė informacija, autorių teisės ir privatumas

NVIDIA parodė, kaip padaryti didelio masto modelių pretreniravimą bitiniu lygmeniu determinuotą pigiai · TENESYS AI NEWS