跳到正文
热点事件观察中

SkillPoison污染智能体技能学习

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Lizhi Zhang等作者提出并实验评估SkillPoison框架,基于论文摘要,该方法在三个基准上的攻击成功率达到95.71%,注入经验均保持任务正确,并通过验证与词汇检查。 该方法不是直接植入恶意内容,而是先构造强化目标行为的成功经验,再逐步移除限定其适用场景的条件,使技能抽取器在完成任务的同时,将有害行为错误泛化到其他情境。代码、数据和实现细节已提供公开仓库,但当前证据仅来自论文摘要。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    SkillPoison通过成功经验渐进式污染LLM智能体技能

    研究者提出SkillPoison,通过构造强化目标行为的成功经验并逐步移除其适用条件,污染LLM智能体的技能学习流程,使技能抽取器在任务成功之外保留可能被误用的有害行为。基于论文摘要,该方法在三个基准上的攻击成功率达到95.71%,且所有注入经验均保持任务正确并通过验证和词汇检查;代码、数据和实现细节已提供公开仓库。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。