Apple prezentuje metodę trenowania agentów w wielu środowiskach opartą na rubrykach
W skrócie: Badacze Apple, wspólnie z Narodowym Uniwersytetem Singapuru, opublikowali pracę o RISED – nowej metodzie trenowania agentów LLM, które muszą jednocześnie uczyć się w wielu różnych środowiskach interaktywnych. Zamiast polegać wyłącznie na skalarnych sygnałach nagrody, RISED wykorzystuje sędziego LLM, który oznacza każdy przebieg treningowy rubrykami opisującymi zachowanie, a następnie wykorzystuje te oznaczenia do wyboru danych treningowych i dostarczenia dodatkowego nadzoru. Autorzy podają, że RISED osiąga najwyższy średni wskaźnik sukcesu we wszystkich środowiskach w porównaniu z istniejącymi metodami, zajmując pierwsze lub drugie miejsce w każdym testowanym środowisku.
To podsumowanie zostało automatycznie przygotowane przez sztuczną inteligencję na podstawie publikacji „Apple Machine Learning”. To nasz tekst, nie kopia oryginału — fakty, liczby i cytaty należą do źródła, do którego link znajduje się powyżej i poniżej.
Co się zmieniło?
- 1Nowa metoda RISED łączy selekcję danych opartą na rubrykach z samodystylacją on-policy do trenowania agentów w wielu środowiskach
- 2Sędzia LLM oznacza każdy przebieg predefiniowanymi rubrykami wspólnymi dla wszystkich środowisk
- 3Pozytywne rubryki dostarczają dodatkowego nadzoru na poziomie tokenów, a negatywne kierują kolejne przebiegi z dala od powtarzających się błędów
- 4Zgłoszono osiągnięcie najwyższego średniego wskaźnika sukcesu we wszystkich środowiskach oraz 1. lub 2. miejsca w każdym testowanym środowisku, przy różnych modelach bazowych
Dlaczego to ważne?
W miarę jak firmy dążą do agentów zdolnych obsługiwać wiele różnych zadań czy środowisk za pomocą jednego modelu, metody treningowe wykraczające poza prostą nagrodę sukces/porażka stają się istotne dla budowy bardziej uniwersalnych agentów — to przydatny sygnał dla śledzących rozwój trenowania systemów agentowych AI.
Co to oznacza dla agentów AI i contact center?
Jest to wczesny etap badań nad metodologią treningową, a nie gotowy produkt, więc nie ma bezpośredniego, natychmiastowego zastosowania w stosach agentów głosowych czy contact center; jest przydatny głównie jako sygnał, jak branża ulepsza trenowanie agentów wielozadaniowych, co może w przyszłości wpłynąć na przyszłe frameworki agentowe lub modele z wywoływaniem narzędzi (tool calling).
Źródła
- Apple Machine LearningOficjalneŹródło pierwotneOryginalny artykuł →„RISED: Rubrics for Agentic Multi-Environment Selection and Self-Distillation“6 paź 2026, 03:00
- Data publikacji źródła
- 6 paź 2026, 03:00
- Znalezione przez nasz system
- 7 paź 2026, 05:05
- Podsumowanie wygenerowano
- 7 paź 2026, 05:06
Artykuł napisała AI na podstawie oryginalnego źródła. Fakty, liczby i ceny pochodzą ze źródła; brakujące wartości oznaczono „Brak oficjalnych danych”. Informacje prawne, prawa autorskie i prywatność