GitHub Blog · AI & ML· Michelle Zhou·· 4 天前精选
GitHub 发布开放 AI 代码审查基准 ReviewBench
ReviewBench: An open benchmark for AI code review
研究任务与主要进展
GitHub 发布 AI 代码审查基准 ReviewBench,其研究预览版现已开放,可用于比较代码审查 Agent 和提交自有系统评测。基准包含来自187个开源许可仓库、覆盖19种语言的219个拉取请求,分布参考了1.039亿条GitHub拉取请求,并采用多来源黄金集、Claude Sonnet 5评委及96.6%的专家复核一致率。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请阅读原文核验。
本站判断
ReviewBench的主要增量是将GitHub真实拉取请求分布、多来源审查结论、统一规则和分级指标整合为可复现的离线评测,并用公开数据集、评委配置和提交工具支持横向比较。其对研发迭代的价值取决于离线结果能否持续预测线上效果;当前生产对应关系主要来自GitHub内部实验,仍需不同代码库和代码审查系统上的独立验证。
来源:GitHub Blog · AI & ML · github.blog