跳到正文
热点事件观察中

研究:参考答案提升CoT监控效果但依赖结论对错

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Will Yeadon 等在 arXiv 发布论文,评估给 LLM 监控器提供可信参考答案(certification)是否提升思维链推理核验。基于 79 道 Humanity's Last Exam 物理题、237 份自然生成的分步解答(独立标注最终答案正误与首个错误步骤)和 8 个 LLM 监控器,结果显示参考答案将平均平衡准确率从 0.637 提升到 0.796,但错误检测效果强烈依赖结论本身。 具体而言,在答案错误的解答轨迹上召回率提升 +0.299;而在答案正确但含推理错误的轨迹上,没有改善证据(-0.083,95% CI [-0.196, +0.030])。即参考答案主要帮助发现结论错误的解答,对“结论对但推理有错”的情况没有证据表明有助益。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · cs.AI
    论文研究可信答案对大模型思维链监控的影响

    论文基于79道 Humanity's Last Exam 物理题、237份自然生成的步骤解答和8个LLM监控器,研究可信参考答案是否真正提升思维链推理核验。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。