跳到正文
arXiv · cs.AI· Yan Zhan, Yunze Song, Mengkai Hou, Wanting Zhang, Shaobo Liu, Zhijun Gao·· 11 天前精选

LLM代理聊天模板提示注入:保留令牌表示决定攻击权限

Same Bytes, Different Authority: Reserved-Token Representations in Chat-Template Prompt Injection

arXiv:2609.35932v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Yan Zhan, Yunze Song, Mengkai Hou, Wanting Zhang, Shaobo Liu, Zhijun Gao

首次提交:2026-09-28 22:51

研究任务与主要进展

基于论文摘要,将伪造成聊天模板标记的保留令牌改编码为普通子词词元,会使InjecAgent基准上的攻击成功率在四个开放权重模型家族中的三个下降39至66个百分点,差异也延续到AgentDojo多轮代理任务。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

本站判断

该研究将聊天模板提示注入攻击的强度与保留令牌的内部表示联系起来,并在InjecAgent、AgentDojo及多个开放权重模型家族上比较普通子词编码的影响。结果显示,标准分词器缓解措施无法覆盖配置未声明为特殊令牌的工具协议标记;其影响范围仍取决于模型、模板、多轮工具权限和推理机制。本站设想:在固定模型、解码设置与工具权限的条件下,进一步比较保留令牌、邻近普通词元和推理抑制对攻击成功率的独立贡献。

来源:arXiv · cs.AI · arxiv.org