arXiv · cs.AI· Pengyu Xue, He Yang Yuan, Xin Wang, Junkai Chen, Haonan Zhang, Boyuan Chen, Zishuo Ding, Zhenhao Li, Weiyi Shang·· 1 天前
SWE-NFI:评测编码代理的非功能性改进能力
SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements
arXiv:2607.27409v2阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Pengyu Xue, He Yang Yuan, Xin Wang, Junkai Chen, Haonan Zhang, Boyuan Chen, Zishuo Ding, Zhenhao Li, Weiyi Shang
研究任务与主要进展
研究提出SWE-NFI基准,用188个来自开源Python项目真实合并PR的任务和92条可执行规则,评测编码代理在不改变可观察行为前提下改进软件质量的能力。研究评估了八种商业与开源代理配置,每种配置在每个任务上运行五次;最多70.0%的有效输出通过全部任务特定功能保持检查。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org