GitHub представила открытый бенчмарк для AI-проверки кода
GitHub запустила ReviewBench — набор для оценки агентов code review на реальных по структуре pull request. Бенчмарк объединяет несколько источников эталонной разметки и метрики, ориентированные на рабочие сценарии.

5 октября 2026 года GitHub представила ReviewBench — открытый офлайн-бенчмарк для агентов, проверяющих исходный код. По описанию компании, он создан для сопоставления того, какие проблемы находят разные системы, что они пропускают и насколько много лишних замечаний выдают.
В основу набора легли 219 публичных pull request из 187 репозиториев на 19 языках. GitHub сформировала корпус после анализа 103,9 млн pull request, чтобы приблизить распределение языков и размеров репозиториев к общей картине платформы. При этом доля изменений смещена в сторону более содержательных задач, а не только небольших правок в одном файле.
Для эталонной разметки ReviewBench использует несколько источников: оценки людей, frontier LLM, статический анализ и структурированные findings. Каждое найденное замечание получает категорию и уровень серьёзности. В описании также перечислены grounded precision и recall, augmented precision и recall — они позволяют отдельно оценивать попадание в известные проблемы и обнаружение новых.
GitHub сообщает, что senior engineers независимо разметили положительные примеры с согласованием 96,6%. Набор данных опубликован для использования, а команды могут подключать собственные системы проверки и отправлять результаты. Компания также утверждает, что её офлайн-оценка Copilot code review стала лучше предсказывать направление производственных экспериментов.
Почему это важно
ReviewBench даёт разработчикам общий способ проверять AI-инструменты для code review не на демонстрационных примерах, а на корпусе, приближенном к реальным задачам, с раздельной оценкой точности и полноты.