跳到正文
热点事件观察中

发现不同训练阶段的说服力差异

1 篇报道1 个报道来源1 天前更新

先了解这件事

报道摘要

一项随机对照研究发现,在 conspiracy 数据监督微调基础上加入论证数据监督微调,可使参与者态度变化更大,而偏好优化未带来额外显著收益。研究将835名参与者随机分至五组,阅读围绕10个分裂性政治议题的个性化文本;结果还显示训练效果依赖参与者初始态度,GPT-4与中性文本未显示显著差异。该内容基于论文摘要,未读取全文。

摘自 arXiv · cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    分阶段后训练与大型语言模型说服力:失配、监督微调和偏好优化的影响

    一项随机对照研究发现,在 conspiracy 数据监督微调基础上加入论证数据监督微调,可使参与者态度变化更大,而偏好优化未带来额外显著收益。研究将835名参与者随机分至五组,阅读围绕10个分裂性政治议题的个性化文本;结果还显示训练效果依赖参与者初始态度,GPT-4与中性文本未显示显著差异。该内容基于论文摘要,未读取全文。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。