Pereiti prie turinio
2026 m. spalio 6 d., antradienis
Tenesys AI News
Prenumerata

AI tyrimai

Moksliniai darbai, benchmarkai, architektūros, reasoning ir mokymo metodai.

#Evaluation — 1 straipsnis ✕

Tyrimai· Svarbu· 🧪 Verta testuoti

GitHub atveria ReviewBench — bendrą standartą AI kodo peržiūros agentų vertinimui

GitHub paskelbė ReviewBench — tyrimų peržiūros stadijos (research preview) etaloną, skirtą palyginti AI kodo peržiūros agentus pagal bendrą, patikrinamą standartą. Duomenų rinkinį sudaro 219 realių viešų pull request'ų iš 19 kalbų ir 187 saugyklų, parinktų taip, kad atspindėtų kalbų ir dydžio pasiskirstymą tarp 103,9 mln. realių GitHub PR. Pagrindinė tiesa (ground truth) sudaryta iš žmonių recenzentų, statinės analizės įrankių ir kelių pažangiausių (frontier) LLM, o jų vertinimus patikrino vyresnieji inžinieriai, kurių sprendimai sutapo su etalono žymėjimais 96,6% atvejų. GitHub teigia jau naudojęs ReviewBench vidiniam Copilot code review (CCR) produkto sekimui, ir kad offline etalono pokyčiai patikimai prognozavo vėlesnių gamybinių A/B testų kryptį.

GitHub