跳到正文
热点事件观察中

SAGA以稀疏非对称注意力加速大模型解码

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Noam Elata等作者提出稀疏非对称分组查询注意力SAGA,通过减少键头、保留更多值头,并结合近似top-N注意力Atop-N,降低大语言模型解码的查询—键计算开销。基于论文摘要,实验覆盖最高15亿参数模型:长上下文下,两种方法组合相较全注意力GQA实现超过2倍的端到端解码加速;从头训练的SAGA在所测基准上质量接近可比GQA。 作者还提出一种高效微调方法,可将预训练模型转换为SAGA架构,以减少从头重训成本;该方法的实际转换效果未在所给证据中单独说明。

AI 根据报道生成 · 30 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    SAGA 非对称稀疏注意力方法将大模型长上下文解码加速超过2倍

    研究提出 Sparse Asymmetric Group-Query Attention(SAGA),通过减少键头、保留更多值头,结合近似 top-N(Atop-N)注意力来降低大语言模型解码中的查询—键计算开销。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。