GitHub udostępnia ReviewBench — wspólny standard oceny agentów AI do przeglądu kodu
GitHub opublikował ReviewBench, benchmark w fazie podglądu badawczego (research preview), który ma umożliwić porównywanie agentów AI do przeglądu kodu według wspólnego, weryfikowalnego standardu. Zbiór danych obejmuje 219 rzeczywistych publicznych pull requestów w 19 językach i 187 repozytoriach, dobranych tak, by odzwierciedlały rozkład języków i rozmiarów wśród 103,9 mln rzeczywistych pull requestów na GitHubie. Dane referencyjne (ground truth) pochodzą z połączenia recenzentów-ludzi, narzędzi do analizy statycznej oraz kilku czołowych modeli LLM, a ich oceny zweryfikowali starsi inżynierowie, których osądy zgadzały się z etykietami benchmarku w 96,6% przypadków. GitHub twierdzi, że już wykorzystał ReviewBench wewnętrznie do śledzenia własnego produktu Copilot code review (CCR), a zmiany wyników offline wiarygodnie przewidywały kierunek późniejszych testów A/B na produkcji.