AttSVD按提示压缩AI的KV缓存
热点事件观察中
AttSVD按提示压缩AI的KV缓存
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Sara Abdali、Jongwoo Ko和Pashmina Cameron提出AttSVD,利用每个提示自身的注意力几何,在线截断SVD并沿特征维度压缩KV缓存,从而保留全部Token并降低存储开销。方法提供适用于短、长生成场景的累积式与流式解码缓存策略。 据论文摘要,AttSVD在多个模型、一个Agentic基准和完整LongBench套件上与稠密缓存表现相当,KV缓存内存降至稠密缓存的50%;目前证据为arXiv摘要报告,尚未说明独立复现情况。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
AttSVD:通过注意力引导SVD实现Prompt自适应低秩KV缓存压缩报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIAttSVD:通过注意力引导SVD实现Prompt自适应低秩KV缓存压缩
研究者提出AttSVD,通过基于每个Prompt注意力几何的在线截断SVD压缩KV缓存,保留所有Token并沿特征维度降低存储开销。方法提供累积式和流式两种解码缓存策略,并通过能量规则与注意力感知基进行自适应截断;在多个模型、Agentic基准和完整LongBench套件上,摘要报告其表现与稠密缓存相当,KV缓存内存最高降至50%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。