LLM可在故障硬件上训练
热点事件持续更新
LLM可在故障硬件上训练
1 篇报道1 个报道来源20 小时前更新
先了解这件事
AI 综述
Trevor McCourt、Ila R. Fiete和Isaac L. Chuang基于模拟故障数字硬件的4万GPU小时训练称,大语言模型可适应硬件不可靠性,且错误韧性随模型规模增大而提升,而非下降。 修正后的神经缩放定律支持这一趋势;论文认为模型可能在相对开销随规模增大仍保持有限的“好”纠错码内计算。作者据此猜想,适当训练的LLM或可实现形式化容错,并可能降低低能耗硬件上的推理能耗,但当前证据仅来自模拟硬件训练,尚未证明形式化容错或实际节能效果。
AI 根据报道生成 · 52 分钟前更新
最新进展10月8日 00:05
面向故障硬件训练的大语言模型:规模增大或提升错误韧性报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · cs.AI面向故障硬件训练的大语言模型:规模增大或提升错误韧性
该论文研究如何训练大语言模型以适应牺牲可靠性换取能效的硬件,并报告在模拟故障数字硬件上进行的 40,000 GPU 小时训练结果。基于修正的神经缩放定律,作者称模型规模增大时错误韧性反而提升,模型可能学习在具有有限相对开销的“好”纠错码内计算;作者进一步猜想,适当训练的模型或可实现形式化容错,从而为低能耗 AI 推理带来节能潜力,当前摘要未证明这一点。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。