WAMJET:加速世界动作模型推理的智能体框架
WAMJET通过编码智能体分析、修改并验证世界动作模型的推理优化代码,以持续适应主要性能瓶颈。基于论文摘要,实验覆盖6个世界动作模型、3个编码智能体和2种GPU架构,相较上游实现最高实现9.95倍无损加速;近似与硬件感知优化还能进一步降低延迟,同时保持相近的成功率。
动态展示门槛:AI 前沿与应用 ≥ 65 分,量子方向 ≥ 60 分;已确认精选照常展示。
WAMJET通过编码智能体分析、修改并验证世界动作模型的推理优化代码,以持续适应主要性能瓶颈。基于论文摘要,实验覆盖6个世界动作模型、3个编码智能体和2种GPU架构,相较上游实现最高实现9.95倍无损加速;近似与硬件感知优化还能进一步降低延迟,同时保持相近的成功率。
ValueDiff 根据 token 值向量相对缓存均值的 L2 偏差进行 KV 缓存淘汰,面向注意力汇较弱的大语言模型。基于论文摘要,在 2k token 缓存预算下,该方法在七个模型中保留 88% 至 99% 的密集注意力性能;在 LongBench 4k 预算下平均保留率为 92%,高于最强既有基线的 83%。
SAG将批评调用建模为逐步决策问题,通过全局熵和局部top-2 margin估计批评效用,仅在预期收益足以覆盖成本时调用批评。论文摘要称,该方法在三个长时程交互基准和多组骨干模型上改善了性能成本权衡;在ALFWorld上,任务成功率由24.6%提升至78.4%,规范化token效率提升3.1倍,7B执行器配合3B批评器的表现接近14B无批评执行器。以上结果仅依据论文摘要,材料未提供完整正文。
NVIDIA 发布 cuQuantum SDK v25.11,新增 cuPauliProp 和 cuStabilizer,用于在 GPU 上加速 Pauli 传播与稳定子模拟。
阅读价值:文章给出两类大规模量子模拟的 GPU 用法、代码示例与 CPU 基线,帮助理解新增组件的适用范围和性能入口。