跳到正文
热点事件观察中

SWE-NFI评测编码代理非功能改进

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

SWE-NFI研究团队提出编码Agent基准,用188个源自开源Python项目真实合并PR的任务和92条可执行规则,评测代理在保持原有可观察行为的同时改进软件质量的能力;基于论文摘要,测试先检查功能保持,再评估五类开发者关注的非功能性改进。 团队评测了八种商业及开源Agent配置,每种配置在每个任务上运行五次。结果显示,即使表现最好的配置,通过全部任务特定功能保持检查的有效输出也不超过70.0%,说明现有配置在完成非功能性修改时仍较易破坏原功能;该结论目前来自论文摘要所报告的评测。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · cs.AI
    SWE-NFI:评测编码代理的非功能性改进能力

    研究提出SWE-NFI基准,用188个来自开源Python项目真实合并PR的任务和92条可执行规则,评测编码代理在不改变可观察行为前提下改进软件质量的能力。研究评估了八种商业与开源代理配置,每种配置在每个任务上运行五次;最多70.0%的有效输出通过全部任务特定功能保持检查。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。