跳到正文
arXiv · cs.AI· Mehdi Makni, Ryan Lucas, Rahul Mazumder·· 10 天前精选

ThinQuant提出面向大语言模型低比特量化的可扩展旋转学习方法

ThinQuant: Scalable Rotation Learning for Weight and Activation Quantization of LLMs

arXiv:2609.36120v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Mehdi Makni, Ryan Lucas, Rahul Mazumder

首次提交:2026-09-29 02:52

研究任务与主要进展

Mehdi Makni、Ryan Lucas和Rahul Mazumder提出ThinQuant,通过减少旋转校准所需的激活数据,并将优化约化为低维Stiefel流形问题,提升大语言模型权重与激活低比特量化的可扩展性。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

本站判断

ThinQuant针对大语言模型低比特权重量化和激活量化中的旋转校准计算瓶颈,结合激活凸包几何进行数据选择,并将旋转变量约化为Stiefel流形上的低维矩阵优化;作者报告其在Llama-3-70B上显著缩短校准时间并改善WikiText-2困惑度。当前仅见论文摘要,结论范围及对更大架构的适用条件仍需结合全文核对。本站设想:在相同模型、量化配置和硬件预算下,比较ThinQuant与SpinQuant、DartQuant的校准数据敏感性、端到端时间和推理成本。

来源:arXiv · cs.AI · arxiv.org