跳到正文
arXiv · cs.AI· Joe Dwyer·· 22 小时前

大语言模型缩放定律综述:资源受限下的参数效率与计算最优训练

Scaling Down the Scaling Laws: Parameter Efficiency and Compute-Optimal Training in Resource-Constrained Large Language Models

arXiv:2610.06387v2阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Joe Dwyer

首次提交:2026-10-05 22:12

研究任务与主要进展

该综述梳理了大语言模型缩放理论从经验缩放定律到计算最优训练的演进,重点考察参数效率、token利用、数据效率及资源受限环境。相关文献涵盖数据剪枝、高效架构、量化、低秩适配和面向边缘设备的优化,并指出企业级基础设施上的缩放原则能否泛化至小模型与受限算力环境仍存在经验、理论和方法缺口。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org