跳到正文
arXiv · cs.AI· Andrei Marchenko, Viacheslav Bezrukov, Oleg Kashurin, Inessa Fedorova, Dmitry Bocharov, Yuliana Shakhvalieva, Maria Tikhonova, Valerii Ternovskii·· 8 天前精选

LoopLM 提出循环语言模型的实用训练配方

Closing the Loop: Practical Training Recipes for Looped Language Models

arXiv:2610.00673v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Andrei Marchenko, Viacheslav Bezrukov, Oleg Kashurin, Inessa Fedorova, Dmitry Bocharov, Yuliana Shakhvalieva, Maria Tikhonova, Valerii Ternovskii

首次提交:2026-10-01 04:09

研究任务与主要进展

基于论文摘要,研究团队提出一种计算效率更高的循环语言模型从零训练流程,将训练预算从 7.7T tokens 降至 310B tokens,同时保持较强推理能力。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

本站判断

该研究把循环语言模型的有效深度与训练数据、训练阶段和计算预算控制分开,报告了从零训练与将预训练密集模型转换为循环模型的具体配方。摘要中的结果基于特定模型规模、基准和推理计算条件,尚不能外推到所有规模;循环块、退出门和损失设计对性能及训练稳定性的独立贡献仍需进一步拆分验证。本站设想:在相同预训练数据、参数预算和推理计算量下,对比共享循环块、不同退出门正则化与转换配方的消融结果。

来源:arXiv · cs.AI · arxiv.org