Apple prezentuje metodę trenowania agentów w wielu środowiskach opartą na rubrykach
Badacze Apple, wspólnie z Narodowym Uniwersytetem Singapuru, opublikowali pracę o RISED – nowej metodzie trenowania agentów LLM, które muszą jednocześnie uczyć się w wielu różnych środowiskach interaktywnych. Zamiast polegać wyłącznie na skalarnych sygnałach nagrody, RISED wykorzystuje sędziego LLM, który oznacza każdy przebieg treningowy rubrykami opisującymi zachowanie, a następnie wykorzystuje te oznaczenia do wyboru danych treningowych i dostarczenia dodatkowego nadzoru. Autorzy podają, że RISED osiąga najwyższy średni wskaźnik sukcesu we wszystkich środowiskach w porównaniu z istniejącymi metodami, zajmując pierwsze lub drugie miejsce w każdym testowanym środowisku.