OpenAI · Alignment Research Blog· Micah Carroll, Tomek Korbak, Zehao Dou, Bowen Baker, Ian Kivlichan·· 2026-05-07精选
OpenAI 研究强化学习中意外评分思维链的后果
Investigating the consequences of accidentally grading CoT during RL
研究任务与主要进展
OpenAI 研究了部分已发布模型在强化学习训练中意外进行思维链评分的影响,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请阅读原文核验。
阅读价值
文章结合真实训练事故、消融分析与内部压力测试,说明有限思维链评分为何未普遍降低可监测性,并归纳影响混淆的奖励强度、覆盖率与可发现性因素。
来源:OpenAI · Alignment Research Blog · alignment.openai.com