跳到正文
热点事件持续更新

LLM可在故障硬件上训练

1 篇报道1 个报道来源20 小时前更新

先了解这件事

AI 综述

Trevor McCourt、Ila R. Fiete和Isaac L. Chuang基于模拟故障数字硬件的4万GPU小时训练称,大语言模型可适应硬件不可靠性,且错误韧性随模型规模增大而提升,而非下降。 修正后的神经缩放定律支持这一趋势;论文认为模型可能在相对开销随规模增大仍保持有限的“好”纠错码内计算。作者据此猜想,适当训练的LLM或可实现形式化容错,并可能降低低能耗硬件上的推理能耗,但当前证据仅来自模拟硬件训练,尚未证明形式化容错或实际节能效果。

AI 根据报道生成 · 52 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · cs.AI
    面向故障硬件训练的大语言模型:规模增大或提升错误韧性

    该论文研究如何训练大语言模型以适应牺牲可靠性换取能效的硬件,并报告在模拟故障数字硬件上进行的 40,000 GPU 小时训练结果。基于修正的神经缩放定律,作者称模型规模增大时错误韧性反而提升,模型可能学习在具有有限相对开销的“好”纠错码内计算;作者进一步猜想,适当训练的模型或可实现形式化容错,从而为低能耗 AI 推理带来节能潜力,当前摘要未证明这一点。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。