WAMJET:加速世界动作模型推理的智能体框架
WAMJET通过编码智能体分析、修改并验证世界动作模型的推理优化代码,以持续适应主要性能瓶颈。基于论文摘要,实验覆盖6个世界动作模型、3个编码智能体和2种GPU架构,相较上游实现最高实现9.95倍无损加速;近似与硬件感知优化还能进一步降低延迟,同时保持相近的成功率。
动态展示门槛:AI 前沿与应用 ≥ 65 分,量子方向 ≥ 60 分;已确认精选照常展示。
WAMJET通过编码智能体分析、修改并验证世界动作模型的推理优化代码,以持续适应主要性能瓶颈。基于论文摘要,实验覆盖6个世界动作模型、3个编码智能体和2种GPU架构,相较上游实现最高实现9.95倍无损加速;近似与硬件感知优化还能进一步降低延迟,同时保持相近的成功率。
ValueDiff 根据 token 值向量相对缓存均值的 L2 偏差进行 KV 缓存淘汰,面向注意力汇较弱的大语言模型。基于论文摘要,在 2k token 缓存预算下,该方法在七个模型中保留 88% 至 99% 的密集注意力性能;在 LongBench 4k 预算下平均保留率为 92%,高于最强既有基线的 83%。
论文摘要介绍 NeMo-DCR,用于在训练与 rollout 分离的智能体强化学习中同步 30B 至 1T 参数模型。作者称该方法仅传输变化,并通过 XOR 掩码、覆写、原地应用、重试和联合提交实现与完整检查点一致的参数位与缓冲区位;跨 AWS 区域完整 1T 重拟合需 87.5 分钟,而 3% 变化率下采用 relay tree 的 1T 重拟合用时 150 秒。
SAG将批评调用建模为逐步决策问题,通过全局熵和局部top-2 margin估计批评效用,仅在预期收益足以覆盖成本时调用批评。论文摘要称,该方法在三个长时程交互基准和多组骨干模型上改善了性能成本权衡;在ALFWorld上,任务成功率由24.6%提升至78.4%,规范化token效率提升3.1倍,7B执行器配合3B批评器的表现接近14B无批评执行器。以上结果仅依据论文摘要,材料未提供完整正文。
Xin Teng、Muxiao Li和Hongyi Wen提出分布鲁棒混合专家训练目标DRMoET,用于应对路由不完美导致的专家训练不足问题。