MIT等提出HugAgent:评估LLM预测个人信念更新
热点事件持续更新
MIT等提出HugAgent:评估LLM预测个人信念更新
1 篇报道1 个报道来源13 小时前更新
先了解这件事
AI 综述
MIT等机构研究人员提出HugAgent基准,让大模型基于对真实个体的访谈、问卷和ThinkYourThinking开放式对话,预测其在全民医疗、公共监控、住房加密等新情境下的回答,论文入选EMNLP 2026 Main Oral。 评测覆盖54名参与者和1,742个题目,测试了GPT、Claude、Gemini、DeepSeek、Llama、Qwen等模型。表现最好的Claude Sonnet 4.5达到68.61%,LLaMA 3.3 70B为67.57%,GPT-4o为63.11%,而实验上界为85.66%。 随模型迭代,Belief State Inference(信念状态推断)准确率从68.84%升至73.02%、再到77.17%,但Belief Dynamics Update(信念动态更新)未同步提升,说明模型尚不能可靠预测个人在新情境下如何更新立场。
AI 根据报道生成 · 2 小时前更新
最新进展10月11日 08:00
MIT研究人员提出HugAgent,用访谈预测个人在新情境下的回答报道时间线
沿着报道,了解事件的不同侧面。
10月11日
- 36Kr Europe · EnglishMIT研究人员提出HugAgent,用访谈预测个人在新情境下的回答
MIT等机构研究人员提出HugAgent,通过访谈、问卷和ThinkYourThinking开放式对话预测个人在全民医疗、公共监控和住房加密等新情境下的立场,评估包含54名参与者和1,742个题目。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。