GitHub 推出开源基准 ReviewBench,用于评估 AI 代码审查工具
GitHub 推出开源基准 ReviewBench,用于测试 AI 代码审查工具能否在不产生多余噪音的情况下捕获实质问题。该基准源自对 GitHub 上 1.039 亿个拉取请求的分析,并整合了涵盖 19 种编程语言的 219 个拉取请求。
如 [GitHub 官方博文](https://github.blog/ai-and-ml/github-copilot/reviewbench-an-open-benchmark-for-ai-code-review/?utm_source=x-promoting-reviewbench-blog-article&utm_medium=social&utm_campaign=reviewbenchmark-oct-2026) 所述,开发者可以接入自己的代码审查智能体,通过该基准进行评估并提交结果。