SWE-NFI评测编码代理非功能改进
热点事件观察中
SWE-NFI评测编码代理非功能改进
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
SWE-NFI研究团队提出编码Agent基准,用188个源自开源Python项目真实合并PR的任务和92条可执行规则,评测代理在保持原有可观察行为的同时改进软件质量的能力;基于论文摘要,测试先检查功能保持,再评估五类开发者关注的非功能性改进。 团队评测了八种商业及开源Agent配置,每种配置在每个任务上运行五次。结果显示,即使表现最好的配置,通过全部任务特定功能保持检查的有效输出也不超过70.0%,说明现有配置在完成非功能性修改时仍较易破坏原功能;该结论目前来自论文摘要所报告的评测。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
SWE-NFI:评测编码代理的非功能性改进能力报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · cs.AISWE-NFI:评测编码代理的非功能性改进能力
研究提出SWE-NFI基准,用188个来自开源Python项目真实合并PR的任务和92条可执行规则,评测编码代理在不改变可观察行为前提下改进软件质量的能力。研究评估了八种商业与开源代理配置,每种配置在每个任务上运行五次;最多70.0%的有效输出通过全部任务特定功能保持检查。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。