提出混合潜在注意力,压缩循环语言模型KV缓存
热点事件观察中
提出混合潜在注意力,压缩循环语言模型KV缓存
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
Yuhan Chen 等在 arXiv 提出混合潜注意力(HLA):在循环语言模型中,近期 W 个 token 保留精确 key/value,更早 token 以紧凑潜表示存储、直接供每轮查询读取而无需重建 KV,从而缩小缓存。他们在 Ouro 循环模型(T=4,1.4B 和 2.6B 参数)上冻结预训练权重、只训练新增参数进行 uptrain,复现原始注意力。 摘要报告:每 token 缓存缩小 10.7 倍,GPU 可同时解码序列增加 4.0–8.8 倍,1K 上下文解码吞吐提升 2.5 倍、16K 上下文最高提升 7.4 倍。精度上,数学、知识与推理基准保留原模型 97% 以上,16K 内长上下文检索保留 96–100%;监督微调后在竞赛级数学上与微调后的原模型相当。以上数字均为论文摘要报告,未独立复现。
AI 根据报道生成 · 17 分钟前更新
最新进展10月7日 12:00
Hybrid Latent Attention:面向循环语言模型的混合潜注意力方法报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIHybrid Latent Attention:面向循环语言模型的混合潜注意力方法
Yuhan Chen等提出混合潜注意力(HLA),在循环语言模型中以紧凑潜表示存储较早token,直接供查询读取,从而减少KV缓存。摘要报告:在T=4、1.4B和2.6B参数的Ouro模型上,缓存按token缩小10.7倍,GPU可同时解码的序列增加4.0–8.8倍;1K和16K上下文解码吞吐分别提升2.5倍和最高7.4倍。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。