跳到正文
arXiv · cs.AI· Bingxi Hou, Guochao Jiang, Guofeng Quan, Weiqing Li, Wenfeng Feng, Guohua Liu, Yuewei Zhang·· 1 天前

重新思考跨分词器在线策略蒸馏:从对齐覆盖到监督可靠性

Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability

arXiv:2610.08448v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Bingxi Hou, Guochao Jiang, Guofeng Quan, Weiqing Li, Wenfeng Feng, Guohua Liu, Yuewei Zhang

研究任务与主要进展

该论文研究不同分词器下教师与学生的在线策略蒸馏,比较数学推理和代码生成任务中的三组教师—学生模型。结果显示,严格1:1对齐组已覆盖多数学生生成词元,在每个严格位置仅选择共享词汇前16项进行反向KL监督,效果可与完整共享词汇方案相当,并优于所评估的跨分词器基线;对错配组加入区间对数概率的均方误差监督虽实现完整覆盖,却降低准确率,训练检查点还显示区间梯度与严格梯度的方向一致性较弱或为负。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org