跳到正文
arXiv · cs.AI· Sara Abdali, Jongwoo Ko, Pashmina Cameron·· 1 天前

AttSVD:通过注意力引导SVD实现Prompt自适应低秩KV缓存压缩

AttSVD:Prompt-Adaptive Low-Rank KV Cache Compression via Attention-Guided SVD

arXiv:2610.06927v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Sara Abdali, Jongwoo Ko, Pashmina Cameron

研究任务与主要进展

研究者提出AttSVD,通过基于每个Prompt注意力几何的在线截断SVD压缩KV缓存,保留所有Token并沿特征维度降低存储开销。方法提供累积式和流式两种解码缓存策略,并通过能量规则与注意力感知基进行自适应截断;在多个模型、Agentic基准和完整LongBench套件上,摘要报告其表现与稠密缓存相当,KV缓存内存最高降至50%。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org