跳到正文
arXiv · cs.AI· Yibo Li, Jinhang Qiu, Zhi Zheng, Qianyun Guo, Jiaying Wu, Shuo Ji, Bryan Hooi·· 2 天前

Learn2Play Bench评估LLM Agent在陌生环境中的经验学习能力

Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments?

arXiv:2610.08215v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Yibo Li, Jinhang Qiu, Zhi Zheng, Qianyun Guo, Jiaying Wu, Shuo Ji, Bryan Hooi

研究任务与主要进展

作者提出Learn2Play Bench,通过规则新颖或反直觉的文本游戏,评估LLM Agent能否从交互反馈中学习,而非主要依赖预训练知识。基于论文摘要,评估结果显示,保留完整行动与反馈记录可能比将其总结为规则或策略更利于学习;人类高分玩家的峰值得分高于受测Agent,且在固定骨干模型时改变Agent harness可改善表现并降低估算推理成本。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org