跳到正文
arXiv · cs.AI· Hang He, Li Wang, Hao Chen, Yuchen Shao, Yuling Shi, Lisheng Wang, Peiyang Liu, Goose Lin, Zaiyuan Wang, Haiying Sun, Ting Su, Chengcheng Wan·· 2 天前

CheckerBench:长程 Agent 能否合成静态分析检查器

CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?

arXiv:2610.07557v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Hang He, Li Wang, Hao Chen, Yuchen Shao, Yuling Shi, Lisheng Wang, Peiyang Liu, Goose Lin, Zaiyuan Wang, Haiying Sun, Ting Su, Chengcheng Wan

研究任务与主要进展

基于论文摘要,作者提出 CheckerBench,用于评估编码 Agent 根据缺陷规格在代码仓库中从头合成可运行静态分析检查器的长程能力。该基准包含 300 个任务,来自 167 个代码仓库、297 个 CVE、85 个 CWE 和五种语言生态;配套 CheckerLab 独立重建提交的检查器,并评估漏洞与修复版本的诊断对比、补丁定位、误报和工具使用。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org