CM-DPO用约束边际改进LLM规划
热点事件观察中
CM-DPO用约束边际改进LLM规划
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
论文作者提出并评估约束边际直接偏好优化CM-DPO:用确定性符号验证器按违规严重程度生成连续约束边际,替代DPO的二元偏好信号,并通过词典序目标优先满足硬约束。 作者称,在TravelPlanner、NaturalPlan及分布外PlanBench上,经CM-DPO微调的8B模型通过率为89.2%、求解率为93.4%;其延迟较对比的多智能体系统低13倍,并在未见过的Blocksworld任务上比GPT-4o高9.2个百分点。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 07:30
CM-DPO:面向大语言模型规划的约束边际直接偏好优化报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AICM-DPO:面向大语言模型规划的约束边际直接偏好优化
作者提出CM-DPO,将DPO的二元偏好信号替换为基于确定性符号验证器、按违规严重程度缩放的连续约束边际,并通过词典序目标分离硬约束与软约束。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。