arXiv · cs.AI· Kwanhee Lee, Namhoon Lee, Dan Alistarh·· 10 天前精选
研究团队提出面向万亿参数MoE的硬件原生联合稀疏量化框架
Hardware-Native Joint Sparse-Quantization for Trillion-Scale Mixture-of-Experts
arXiv:2610.02241v1阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Kwanhee Lee, Namhoon Lee, Dan Alistarh
首次提交:2026-09-29 15:58
研究任务与主要进展
研究团队提出一种面向万亿参数级混合专家模型的硬件—软件协同设计框架,将专家权重压缩为硬件原生低精度稀疏表示,并在NVIDIA B200 GPU上通过面向稀疏张量核心的分组稀疏GEMM内核加速推理。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
本站判断
该研究针对万亿参数级MoE部署中的权重存储、内存带宽和稀疏计算原语缺失,提出将低精度半结构化稀疏与硬件原生SpTC执行协同设计的端到端框架。基于论文摘要,算法通过连续重参数化联合优化量化与稀疏表示,并配套面向SpTC的分组稀疏GEMM内核;其价值仍需结合全文实验设置、基线复现和实际部署负载进一步判断。
来源:arXiv · cs.AI · arxiv.org