SkillPoison污染智能体技能学习
热点事件观察中
SkillPoison污染智能体技能学习
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
Lizhi Zhang等作者提出并实验评估SkillPoison框架,基于论文摘要,该方法在三个基准上的攻击成功率达到95.71%,注入经验均保持任务正确,并通过验证与词汇检查。 该方法不是直接植入恶意内容,而是先构造强化目标行为的成功经验,再逐步移除限定其适用场景的条件,使技能抽取器在完成任务的同时,将有害行为错误泛化到其他情境。代码、数据和实现细节已提供公开仓库,但当前证据仅来自论文摘要。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
SkillPoison通过成功经验渐进式污染LLM智能体技能报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AISkillPoison通过成功经验渐进式污染LLM智能体技能
研究者提出SkillPoison,通过构造强化目标行为的成功经验并逐步移除其适用条件,污染LLM智能体的技能学习流程,使技能抽取器在任务成功之外保留可能被误用的有害行为。基于论文摘要,该方法在三个基准上的攻击成功率达到95.71%,且所有注入经验均保持任务正确并通过验证和词汇检查;代码、数据和实现细节已提供公开仓库。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。