Przejdź do treści
wtorek, 6 października 2026
Tenesys AI News
Subskrypcja

Badania AI

Prace naukowe, benchmarki, architektury, rozumowanie i metody trenowania.

#Code Review — 1 artykuł ✕

Badania· Ważne· 🧪 Warte przetestowania

GitHub udostępnia ReviewBench — wspólny standard oceny agentów AI do przeglądu kodu

GitHub opublikował ReviewBench, benchmark w fazie podglądu badawczego (research preview), który ma umożliwić porównywanie agentów AI do przeglądu kodu według wspólnego, weryfikowalnego standardu. Zbiór danych obejmuje 219 rzeczywistych publicznych pull requestów w 19 językach i 187 repozytoriach, dobranych tak, by odzwierciedlały rozkład języków i rozmiarów wśród 103,9 mln rzeczywistych pull requestów na GitHubie. Dane referencyjne (ground truth) pochodzą z połączenia recenzentów-ludzi, narzędzi do analizy statycznej oraz kilku czołowych modeli LLM, a ich oceny zweryfikowali starsi inżynierowie, których osądy zgadzały się z etykietami benchmarku w 96,6% przypadków. GitHub twierdzi, że już wykorzystał ReviewBench wewnętrznie do śledzenia własnego produktu Copilot code review (CCR), a zmiany wyników offline wiarygodnie przewidywały kierunek późniejszych testów A/B na produkcji.

GitHub