DRMoE提升混合专家模型路由可靠性
热点事件观察中
DRMoE提升混合专家模型路由可靠性
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Xin Teng、Muxiao Li和Hongyi Wen在arXiv论文中提出分布鲁棒混合专家训练目标DRMoET;基于论文摘要的实验显示,该方法可改善路由不完美导致的专家训练不足。DRMoE将各层专家视为鲁棒性分组,重点优化高损失路由结果,而非只平衡专家流量。 在FLAME-MoE训练配方下,746M和10.3B总参数规模的下游任务平均分均高于标准FLAME-MoE及无辅助损失平衡基线。10.3B参数、训练670亿token时,七任务平均分由标准方法的0.6625升至0.6767,无辅助损失基线为0.6431;作者的分析还显示,专家损失方差下降,强制中位k路由错误时超额损失降低4.3%。项目页和代码已公开。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
DRMoET提出分布鲁棒混合专家训练方法以提升路由可靠性报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIDRMoET提出分布鲁棒混合专家训练方法以提升路由可靠性
Xin Teng、Muxiao Li和Hongyi Wen提出分布鲁棒混合专家训练目标DRMoET,用于应对路由不完美导致的专家训练不足问题。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。