跳到正文
热点事件观察中

训练语言模型进行连贯决策

1 篇报道1 个报道来源2 天前更新

先了解这件事

报道摘要

作者研究通过监督微调训练语言模型在保持已 elicited 信念的同时,依据效用选择预期效用最高的行动,并在20个数据集上评估跨领域、跨表述和不同收益结构的迁移能力。论文还引入信息缺失场景,测试模型能否区分缺失决策所需信息与无关上下文;摘要报告,定向微调在许多情形下改善了决策一致性,分离决策完整性识别与效用敏感执行的路由系统显示出价值。

摘自 arXiv · cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    训练语言模型成为一致的决策者

    作者研究通过监督微调训练语言模型在保持已 elicited 信念的同时,依据效用选择预期效用最高的行动,并在20个数据集上评估跨领域、跨表述和不同收益结构的迁移能力。论文还引入信息缺失场景,测试模型能否区分缺失决策所需信息与无关上下文;摘要报告,定向微调在许多情形下改善了决策一致性,分离决策完整性识别与效用敏感执行的路由系统显示出价值。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。