研究从基础模型预测后训练编码 Agent 性能
Before They Can Solve: Predicting Post-Training Coding-Agent Performance from Base Models
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Tan Yu, Alexander Bukharin, Khushi Bhardwaj, Jennifer Williams, Zirui Liu, Jonathan Lingjie Li, Soumye Singhal, Joseph Jennings, Sanjeev Satheesh, Yash Jain, Ashish Vaswani, Venkat Krishna Srinivasan, Matthew Papakipos, Hyunwoo Kim, Jian Zhang, Oleksii Kuchaiev, Markus Kliegl, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Jonathan Cohen, Jiantao Jiao
首次提交:2026-10-08 01:37
作者提出三种无需让基础模型从冷启动完整驱动 Agent 环境、即可预测后训练编码 Agent 潜力的筛选方法。基于论文摘要,Decisive-Action BPB、Patch MCQ 和 prefix-conditioned pass@K 在十组公开基础模型与后训练模型上,排序结果均与后训练模型的 SWE-bench Verified pass@1 接近。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org