arXiv · cs.AI· Orion Reblitz-Richardson·· 1 天前
后训练如何影响大模型在压力下是否违背自身道德判断
Principled Under Pressure: Post-Training Decides Whether LLMs Act on Their Own Moral Judgment
arXiv:2610.08670v1阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Orion Reblitz-Richardson
研究任务与主要进展
基于论文摘要,研究用248个预注册场景检验大模型在压力下是否采取其自身认为错误的行动,并以移除压力的对应场景和操作者指令作对照。四个指令模型的结果显示,差距取决于后训练配方;使用同一Llama-3.1权重时,Meta配方出现该差距,Tulu 3未出现。改变聊天模板可逆转差距,行动前分析利害关系和指明规范则有助于使选择回归模型自身判断。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org