跳到正文
热点事件观察中

DMC-Optim用强化学习优化代码执行速度

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

研究团队提出三阶段强化学习方法DMC-Optim,通过大规模测试与校准沙盒、组合正确性和速度奖励,并改造GRPO,使模型学习稀疏且含噪的计时执行结果。论文报告,最佳配置在DMC-Optim上将Qwen 2.5 7B和CWM 32B的严格前50% pass@1分别从18.0%升至31.3%、从30.7%升至50.4%。 在LCB中,CWM 32B相对标准RLVR最多赢得83%的中位样本速度比较;沙盒退化时,稳健优化RL按不同评估指标较标准RLVR提升100%至200%。但相对每题最快的正确人类提交,其复杂度级别改进率约为人类一半(13%对22%)。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · cs.AI
    强化学习用于代码优化:DMC-Optim提升Qwen 2.5 7B与CWM 32B的优化通过率

    该论文提出DMC-Optim三阶段代码优化强化学习方法,通过大规模优化测试与校准沙盒、将正确性和速度组合为奖励,并适配GRPO以处理稀疏且有噪声的计时执行。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。