Przejdź do treści
środa, 7 października 2026
Tenesys AI News
Subskrypcja

Apple prezentuje metodę trenowania agentów w wielu środowiskach opartą na rubrykach

W skrócie: Badacze Apple, wspólnie z Narodowym Uniwersytetem Singapuru, opublikowali pracę o RISED – nowej metodzie trenowania agentów LLM, które muszą jednocześnie uczyć się w wielu różnych środowiskach interaktywnych. Zamiast polegać wyłącznie na skalarnych sygnałach nagrody, RISED wykorzystuje sędziego LLM, który oznacza każdy przebieg treningowy rubrykami opisującymi zachowanie, a następnie wykorzystuje te oznaczenia do wyboru danych treningowych i dostarczenia dodatkowego nadzoru. Autorzy podają, że RISED osiąga najwyższy średni wskaźnik sukcesu we wszystkich środowiskach w porównaniu z istniejącymi metodami, zajmując pierwsze lub drugie miejsce w każdym testowanym środowisku.

Źródło: Apple Machine LearningAppleOryginalny artykuł ↗

To podsumowanie zostało automatycznie przygotowane przez sztuczną inteligencję na podstawie publikacji „Apple Machine Learning”. To nasz tekst, nie kopia oryginału — fakty, liczby i cytaty należą do źródła, do którego link znajduje się powyżej i poniżej.

Co się zmieniło?

  • 1Nowa metoda RISED łączy selekcję danych opartą na rubrykach z samodystylacją on-policy do trenowania agentów w wielu środowiskach
  • 2Sędzia LLM oznacza każdy przebieg predefiniowanymi rubrykami wspólnymi dla wszystkich środowisk
  • 3Pozytywne rubryki dostarczają dodatkowego nadzoru na poziomie tokenów, a negatywne kierują kolejne przebiegi z dala od powtarzających się błędów
  • 4Zgłoszono osiągnięcie najwyższego średniego wskaźnika sukcesu we wszystkich środowiskach oraz 1. lub 2. miejsca w każdym testowanym środowisku, przy różnych modelach bazowych

Dlaczego to ważne?

W miarę jak firmy dążą do agentów zdolnych obsługiwać wiele różnych zadań czy środowisk za pomocą jednego modelu, metody treningowe wykraczające poza prostą nagrodę sukces/porażka stają się istotne dla budowy bardziej uniwersalnych agentów — to przydatny sygnał dla śledzących rozwój trenowania systemów agentowych AI.

Co to oznacza dla agentów AI i contact center?

Jest to wczesny etap badań nad metodologią treningową, a nie gotowy produkt, więc nie ma bezpośredniego, natychmiastowego zastosowania w stosach agentów głosowych czy contact center; jest przydatny głównie jako sygnał, jak branża ulepsza trenowanie agentów wielozadaniowych, co może w przyszłości wpłynąć na przyszłe frameworki agentowe lub modele z wywoływaniem narzędzi (tool calling).

Źródła

  • Apple Machine LearningOficjalneŹródło pierwotne
    „RISED: Rubrics for Agentic Multi-Environment Selection and Self-Distillation“
    6 paź 2026, 03:00
    Oryginalny artykuł →
Data publikacji źródła
6 paź 2026, 03:00
Znalezione przez nasz system
7 paź 2026, 05:05
Podsumowanie wygenerowano
7 paź 2026, 05:06

Artykuł napisała AI na podstawie oryginalnego źródła. Fakty, liczby i ceny pochodzą ze źródła; brakujące wartości oznaczono „Brak oficjalnych danych”. Informacje prawne, prawa autorskie i prywatność

Apple prezentuje metodę trenowania agentów w wielu środowiskach opartą na rubrykach · TENESYS AI NEWS