跳到正文
arXiv · cs.AI· Qizheng Zhang, Changxiu Ji, Isaac Sun, Yuetai Li, Shubhangi Upasani, Sherry Ruan, Boyuan Ma, Fenglu Hong, Vamsidhar Kamanuru, Yoonho Lee, Yuzhen Mao, Genghan Zhang, Rulin Shao, Qiuyang Mang, Andy Dimnaku, Changran Hu, Radha Poovendran, Kunle Olukotun·· 2 天前精选

无状态语言代理:扩展长周期自动化研究

Stateless Language Agents: Scaling Long-Horizon Automated Research

arXiv:2610.07625v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Qizheng Zhang, Changxiu Ji, Isaac Sun, Yuetai Li, Shubhangi Upasani, Sherry Ruan, Boyuan Ma, Fenglu Hong, Vamsidhar Kamanuru, Yoonho Lee, Yuzhen Mao, Genghan Zhang, Rulin Shao, Qiuyang Mang, Andy Dimnaku, Changran Hu, Radha Poovendran, Kunle Olukotun

研究任务与主要进展

研究提出 Stateless Language Agents(SLA),由 harness 保存候选方案和测量结果,并为每次调用重建无历史的角色化上下文,由 Advisor 分派并行实验。基于论文摘要,SLA 在软件工程、内核优化和算法设计任务上取得最佳最终结果,并以超过84%更少的 token 达到最强内核基线的最终性能;Advisor的 token 消耗低于0.6%。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

本站判断

该工作把长周期研究中的状态管理与任务分派从代理对话中抽离到外部 harness,减少历史重放、重复实验和无效 token 消耗。基于论文摘要,SLA 在三类任务和最高十亿 token 预算下优于三种对比框架,但完整实验细节仍需以全文核对。本站设想:可在相同预算和任务上独立复现,并比较其成本—性能曲线与短时评测结果的偏差。

来源:arXiv · cs.AI · arxiv.org