跳到正文
热点事件观察中

CM-DPO用约束边际改进LLM规划

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

论文作者提出并评估约束边际直接偏好优化CM-DPO:用确定性符号验证器按违规严重程度生成连续约束边际,替代DPO的二元偏好信号,并通过词典序目标优先满足硬约束。 作者称,在TravelPlanner、NaturalPlan及分布外PlanBench上,经CM-DPO微调的8B模型通过率为89.2%、求解率为93.4%;其延迟较对比的多智能体系统低13倍,并在未见过的Blocksworld任务上比GPT-4o高9.2个百分点。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    CM-DPO:面向大语言模型规划的约束边际直接偏好优化

    作者提出CM-DPO,将DPO的二元偏好信号替换为基于确定性符号验证器、按违规严重程度缩放的连续约束边际,并通过词典序目标分离硬约束与软约束。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。