跳到正文
热点事件持续更新

MIT等提出HugAgent:评估LLM预测个人信念更新

1 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

MIT等机构研究人员提出HugAgent基准,让大模型基于对真实个体的访谈、问卷和ThinkYourThinking开放式对话,预测其在全民医疗、公共监控、住房加密等新情境下的回答,论文入选EMNLP 2026 Main Oral。 评测覆盖54名参与者和1,742个题目,测试了GPT、Claude、Gemini、DeepSeek、Llama、Qwen等模型。表现最好的Claude Sonnet 4.5达到68.61%,LLaMA 3.3 70B为67.57%,GPT-4o为63.11%,而实验上界为85.66%。 随模型迭代,Belief State Inference(信念状态推断)准确率从68.84%升至73.02%、再到77.17%,但Belief Dynamics Update(信念动态更新)未同步提升,说明模型尚不能可靠预测个人在新情境下如何更新立场。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月11日
  1. 36Kr Europe · English
    MIT研究人员提出HugAgent,用访谈预测个人在新情境下的回答

    MIT等机构研究人员提出HugAgent,通过访谈、问卷和ThinkYourThinking开放式对话预测个人在全民医疗、公共监控和住房加密等新情境下的立场,评估包含54名参与者和1,742个题目。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。