跳到正文
arXiv · cs.AI· Kyoungjun Park, Yunzhe Li, Lili Qiu·· 9 天前精选

Triage在语言模型运行前预测音频Token注意力以压缩输入

Audio Token Attention Is Predictable Before the Language Model Runs

arXiv:2609.38878v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Kyoungjun Park, Yunzhe Li, Lili Qiu

首次提交:2026-09-30 11:28

研究任务与主要进展

研究作者提出Triage,在大型音频语言模型运行前根据编码器输出无标签预测音频Token的跨层注意力排名,并在第2层用实际注意力进行修正。摘要称,该方法在13个模型中的11个上达到不低于0.69的预测相关性;保守预算下词错误率和准确率与全音频输入相差不超过0.04,激进预算下在12个转录案例中优于所有基线。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

本站判断

该方法把音频Token的压缩排序前移到语言模型运行前,利用编码器输出无标签预测跨层注意力,并在后续层进行修正。摘要显示其在保守预算下接近全音频结果、激进预算下优于基线,但压缩上限、准确性代价和资源收益均依赖特定模型、预算与任务;本站设想:可比较该方法在不同音频任务和上下文长度下的压缩率、延迟与端到端资源开销。

来源:arXiv · cs.AI · arxiv.org