跳到正文
arXiv · cs.AI· Jonghyun Han, Younghoon Song, Jongyoul Park·· 1 天前精选

研究者定位大语言模型灾难性遗忘的输出嵌入来源

A Deafening Silence: Catastrophic Forgetting Lives in the Output Embeddings of Tokens the Data Never Speaks

arXiv:2610.09835v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Jonghyun Han, Younghoon Song, Jongyoul Park

首次提交:2026-10-07 19:01

研究任务与主要进展

研究者通过五种设置下的系统性参数冻结分析,发现大语言模型持续预训练和微调造成的灾难性遗忘主要集中于新语料中低频词的输出嵌入,而非模型主体中的对应频带。基于论文摘要,作者提出训练期间仅提高输出投影的 Adam epsilon,在160M至12B参数、四个模型族和八个设置中,于七个稳定配置里减少39.4%至67.9%的遗忘,并且不损害目标任务学习。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

本站判断

基于论文摘要,研究将灾难性遗忘定位到新语料中低频词的输出嵌入,并提出仅提高输出投影的 Adam epsilon 以抑制相关更新。摘要报告该方法在160M至12B参数、四个模型族和八个设置中,于七个稳定配置里减少39.4%至67.9%的遗忘,且未损害目标任务学习;结论仍限于摘要所述设置,跨领域稳定性与更广泛优化器比较仍待验证。

来源:arXiv · cs.AI · arxiv.org