„Apple“ tyrėjai pristatė rubrikomis pagrįstą metodą agentams mokyti keliose aplinkose
Trumpai: „Apple“ tyrėjai kartu su Singapūro nacionaliniu universitetu paskelbė straipsnį apie RISED – naują LLM agentų mokymo sistemą, skirtą tuo pačiu metu mokytis keliose skirtingose interaktyviose aplinkose. Vietoj to, kad remtųsi tik skaitiniais atlygio signalais, RISED naudoja LLM teisėją, kuris kiekvieną mokymo bandymą pažymi rubrikomis, apibūdinančiomis elgseną, o tada šias žymas naudoja treniruočių duomenims atrinkti ir papildomai priežiūrai suteikti. Autoriai teigia, kad RISED pasiekia aukščiausią vidutinį sėkmės rodiklį tarp aplinkų, palyginti su esamais metodais, ir kiekvienoje testuotoje aplinkoje užima pirmą arba antrą vietą.
Šią santrauką automatiškai parengė dirbtinis intelektas pagal „Apple Machine Learning“ publikaciją. Tai mūsų tekstas, ne originalo kopija — faktai, skaičiai ir citatos priklauso šaltiniui, kurio nuoroda pateikta viršuje ir apačioje.
Kas pasikeitė?
- 1Naujas metodas RISED sujungia rubrikomis pagrįstą duomenų atranką su on-policy savaiminiu distiliavimu daugiaaplinkiniam agentų mokymui
- 2LLM teisėjas pažymi kiekvieną bandymą iš anksto apibrėžtomis rubrikomis, bendromis visoms aplinkoms
- 3Teigiamos rubrikos suteikia papildomą priežiūrą žodžių (token) lygmeniu, o neigiamos nukreipia būsimus bandymus nuo pasikartojančių nesėkmių
- 4Teigiama, kad metodas pasiekia aukščiausią vidutinį sėkmės rodiklį tarp aplinkų ir kiekvienoje testuotoje aplinkoje užima 1-ą arba 2-ą vietą, naudojant kelis skirtingus modelių pagrindus
Kodėl tai svarbu?
Kompanijoms siekiant agentų, galinčių tvarkyti daug skirtingų užduočių ar aplinkų su vienu modeliu, mokymo metodai, apimantys daugiau nei paprastą sėkmės/nesėkmės atlygį, tampa svarbūs kuriant pajėgesnius, universalesnius agentus — tai naudinga informacija stebint, kaip tobulinamos agentinės AI sistemos.
Ką tai reiškia AI agentams ir kontaktų centrams?
Tai ankstyvos stadijos tyrimas apie mokymo metodiką, o ne pritaikomas produktas, todėl jis neturi tiesioginio, greito pritaikymo balso agentų ar kontaktų centrų sprendimams; jis naudingas daugiausia kaip signalas, kaip pramonė tobulina daugiaaplinkinį agentų mokymą, kas ateityje galėtų paveikti būsimas agentų sistemas ar įrankių iškvietimo (tool calling) modelius.
Šaltiniai
- Apple Machine LearningOficialusPirminis šaltinisOriginalus straipsnis →„RISED: Rubrics for Agentic Multi-Environment Selection and Self-Distillation“2026-10-06 03:00
- Šaltinio publikavimo data
- 2026-10-06 03:00
- Mūsų sistema rado
- 2026-10-07 05:05
- Santrauka sugeneruota
- 2026-10-07 05:06
Straipsnį pagal originalų šaltinį parašė AI. Faktai, skaičiai ir kainos — iš šaltinio; trūkstamos reikšmės pažymėtos „Nėra oficialių duomenų“. Teisinė informacija, autorių teisės ir privatumas