跳到正文
arXiv · cs.AI· Chuan Liu, Shuoming Zhang, Zhicheng Li, Qianqi Sun, Ruiyuan Xu, Qiuchu Yu, Xiyu Shi, Huimin Cui, Jiacheng Zhao·· 9 天前精选

SPLASH:在 LLM 服务中无缝切换注意力并行布局

SPLASH: Switching Parallel Layouts of Attention with Seamless Handoff for LLM Serving

arXiv:2609.37626v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Chuan Liu, Shuoming Zhang, Zhicheng Li, Qianqi Sun, Ruiyuan Xu, Qiuchu Yu, Xiyu Shi, Huimin Cui, Jiacheng Zhao

首次提交:2026-09-29 22:02

研究任务与主要进展

基于论文摘要,SPLASH 可在 LLM 请求运行期间切换注意力并行布局,复用并后台迁移已有状态,在批次边界完成交接;作者报告其切换中位开销低于执行步的 0.51%。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

本站判断

基于论文摘要,SPLASH 的核心增量是把注意力并行布局从启动时固定改为请求运行期间可切换,并通过 KV 状态复用、后台迁移和批次边界交接降低切换成本;作者还提出 DOP 以解耦权重分片与缓存归属。其价值取决于所述 GPU、模型和负载下的实测结果,仍需在更广泛硬件、模型及推理、Agent、RL-rollout 工作负载中比较吞吐、延迟和内存开销。本站设想:可在相同请求负载和资源预算下,对比固定布局与动态切换在长上下文突发场景中的端到端性能。

来源:arXiv · cs.AI · arxiv.org