跳到正文
热点事件观察中

AttSVD按提示压缩AI的KV缓存

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Sara Abdali、Jongwoo Ko和Pashmina Cameron提出AttSVD,利用每个提示自身的注意力几何,在线截断SVD并沿特征维度压缩KV缓存,从而保留全部Token并降低存储开销。方法提供适用于短、长生成场景的累积式与流式解码缓存策略。 据论文摘要,AttSVD在多个模型、一个Agentic基准和完整LongBench套件上与稠密缓存表现相当,KV缓存内存降至稠密缓存的50%;目前证据为arXiv摘要报告,尚未说明独立复现情况。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    AttSVD:通过注意力引导SVD实现Prompt自适应低秩KV缓存压缩

    研究者提出AttSVD,通过基于每个Prompt注意力几何的在线截断SVD压缩KV缓存,保留所有Token并沿特征维度降低存储开销。方法提供累积式和流式两种解码缓存策略,并通过能量规则与注意力感知基进行自适应截断;在多个模型、Agentic基准和完整LongBench套件上,摘要报告其表现与稠密缓存相当,KV缓存内存最高降至50%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。