arXiv · cs.AI· Noam Elata, Itay Lamprecht, Mikey Shechter, Daniel Ohayon, Itay Hubara, Daniel Soudry·· 1 天前
SAGA 非对称稀疏注意力方法将大模型长上下文解码加速超过2倍
More Value per Key: Asymmetric Sparse Attention for Faster LLM Decoding
arXiv:2610.04753v2阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Noam Elata, Itay Lamprecht, Mikey Shechter, Daniel Ohayon, Itay Hubara, Daniel Soudry
研究任务与主要进展
研究提出 Sparse Asymmetric Group-Query Attention(SAGA),通过减少键头、保留更多值头,结合近似 top-N(Atop-N)注意力来降低大语言模型解码中的查询—键计算开销。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org