PPol:进化生成多样用户Persona用于LLM Agent评测
热点事件观察中
PPol:进化生成多样用户Persona用于LLM Agent评测
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Harshita Chopra等提出Persona Policies(PPol),一个即插即用的控制层,通过进化式编码Agent为用户模拟器生成保持任务目标但具有行为多样性的用户Persona,用于LLM Agent的评测与训练。基于论文摘要,在τ²-bench Retail、τ²-bench Airline、ColBench和WildChat 4个基准上,PPol用户模拟器的fitness score较基线提升28–72个百分点;盲评中标注者将PPol用户判为“人类”的比例为80.4%,约为基线模拟器的2倍。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
PPol通过进化式Persona生成提升LLM Agent评测与训练效果报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · cs.AIPPol通过进化式Persona生成提升LLM Agent评测与训练效果
研究提出Persona Policies(PPol)控制层,利用进化式编码Agent生成保持任务目标但具有行为多样性的用户Persona。基于论文摘要,在包含τ²-bench Retail和Airline、ColBench、WildChat的4个基准上,PPol用户模拟器的fitness score较基线提升28–72个百分点;盲评中有80.4%被标注为“人类”。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。