跳到正文
arXiv · cs.AI· Jun Zhao, Leiming Fu, Yanbo Wen, Yiding Wang, Xuantong Liu, Yang Shu, Yuyang Lu, Xuanran Xing, Jingqi Tong, Hao Xu, Qi Zhang, Xuanjing Huang·· 1 天前

LiveMACEBench:面向动态金融市场的过程感知LLM Agent评测基准

LiveMACE: Process-Aware Evaluation of LLM Agent Capabilities in Evolving Markets

arXiv:2610.09872v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Jun Zhao, Leiming Fu, Yanbo Wen, Yiding Wang, Xuantong Liu, Yang Shu, Yuyang Lu, Xuanran Xing, Jingqi Tong, Hao Xu, Qi Zhang, Xuanjing Huang

首次提交:2026-10-07 19:33

研究任务与主要进展

作者提出LiveMACEBench,利用持续演化的金融市场作为测试环境,按工具使用、持久记忆、规则遵循和多Agent协作配置评估五个前沿LLM。基于论文摘要,在30天实时评测中,作者同时分析最终结果和完整决策轨迹,发现实际收益与机制能力测量经常出现偏离。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org