跳到正文
热点事件观察中

LLM智能体语义行为水印方法

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Suxin Ji等提出语义行为水印SBW,在不改动输出token的情况下,将密钥嵌入智能体历史条件下的语义动作簇分桶,以追踪生成来源并抵抗改写与伪造。基于论文摘要,五个3B至14B、四家厂商的智能体模型和三种编码器在两项基准上保持检测排序;在ALFWorld每个模型100个回合中,报告得分为0.92至0.97,对照为0.00至0.01。 该方法用带密钥的抗碰撞分桶替代公开分桶;在主要工作点bge编码器、r=64时,摘要称自适应伪造率由100%降至误报下限。代码已通过匿名仓库提供,但当前材料未显示独立复现。

AI 根据报道生成 · 46 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    语义行为水印:为LLM智能体提供抗改写与抗伪造的来源溯源

    Suxin Ji等提出语义行为水印 SBW,通过历史条件下的语义动作簇和带密钥的抗碰撞分桶,为LLM智能体提供不改动输出token的来源溯源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。