跳到正文
热点事件观察中

提出CheckerBench编码代理基准

1 篇报道1 个报道来源2 天前更新

先了解这件事

报道摘要

基于论文摘要,作者提出 CheckerBench,用于评估编码 Agent 根据缺陷规格在代码仓库中从头合成可运行静态分析检查器的长程能力。该基准包含 300 个任务,来自 167 个代码仓库、297 个 CVE、85 个 CWE 和五种语言生态;配套 CheckerLab 独立重建提交的检查器,并评估漏洞与修复版本的诊断对比、补丁定位、误报和工具使用。

摘自 arXiv · cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    CheckerBench:长程 Agent 能否合成静态分析检查器

    基于论文摘要,作者提出 CheckerBench,用于评估编码 Agent 根据缺陷规格在代码仓库中从头合成可运行静态分析检查器的长程能力。该基准包含 300 个任务,来自 167 个代码仓库、297 个 CVE、85 个 CWE 和五种语言生态;配套 CheckerLab 独立重建提交的检查器,并评估漏洞与修复版本的诊断对比、补丁定位、误报和工具使用。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。