跳到正文
热点事件观察中

稀疏修改破坏端侧模型安全行为

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

一项基于论文摘要的研究发现,对 LLaMA-2-7B-Chat 的安全敏感行为主要集中于少量参数:按参数重要性筛选,仅修改 MLP down_proj 中0.19%的权重,便使 Basic ASR 达到53%、GCG ASR 达到56%。 与此同时,修改后模型在 tinyBenchmarks 上的准确率为51.6%,接近未修改模型的52.2%。研究还称 down_proj 持续是主要安全敏感组件,o_proj 贡献较小;该结果目前仅对应上述模型、攻击指标与基准。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    端侧语言模型安全性有多脆弱?定位安全关键参数进行稀疏故障分析

    基于论文摘要,LLaMA-2-7B-Chat 的安全敏感行为集中于稀疏参数,使用参数级重要性筛选仅修改 down_proj 中0.19%的模型权重,就得到53%的 Basic ASR 和56%的 GCG ASR。tinyBenchmarks 准确率为51.6%,接近未修改模型的52.2%;研究还发现 MLP down_proj 持续是主要安全敏感组件,o_proj 的贡献较小。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。