跳到正文
热点事件观察中

DRMoE提升混合专家模型路由可靠性

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Xin Teng、Muxiao Li和Hongyi Wen在arXiv论文中提出分布鲁棒混合专家训练目标DRMoET;基于论文摘要的实验显示,该方法可改善路由不完美导致的专家训练不足。DRMoE将各层专家视为鲁棒性分组,重点优化高损失路由结果,而非只平衡专家流量。 在FLAME-MoE训练配方下,746M和10.3B总参数规模的下游任务平均分均高于标准FLAME-MoE及无辅助损失平衡基线。10.3B参数、训练670亿token时,七任务平均分由标准方法的0.6625升至0.6767,无辅助损失基线为0.6431;作者的分析还显示,专家损失方差下降,强制中位k路由错误时超额损失降低4.3%。项目页和代码已公开。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    DRMoET提出分布鲁棒混合专家训练方法以提升路由可靠性

    Xin Teng、Muxiao Li和Hongyi Wen提出分布鲁棒混合专家训练目标DRMoET,用于应对路由不完美导致的专家训练不足问题。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。