跳到正文
热点事件观察中

定位持续训练中的灾难性遗忘

1 篇报道1 个报道来源1 天前更新

先了解这件事

报道摘要

研究者通过五种设置下的系统性参数冻结分析,发现大语言模型持续预训练和微调造成的灾难性遗忘主要集中于新语料中低频词的输出嵌入,而非模型主体中的对应频带。基于论文摘要,作者提出训练期间仅提高输出投影的 Adam epsilon,在160M至12B参数、四个模型族和八个设置中,于七个稳定配置里减少39.4%至67.9%的遗忘,并且不损害目标任务学习。

摘自 arXiv · cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI精选
    研究者定位大语言模型灾难性遗忘的输出嵌入来源

    研究者通过五种设置下的系统性参数冻结分析,发现大语言模型持续预训练和微调造成的灾难性遗忘主要集中于新语料中低频词的输出嵌入,而非模型主体中的对应频带。基于论文摘要,作者提出训练期间仅提高输出投影的 Adam epsilon,在160M至12B参数、四个模型族和八个设置中,于七个稳定配置里减少39.4%至67.9%的遗忘,并且不损害目标任务学习。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。