稀疏修改破坏端侧模型安全行为
热点事件观察中
稀疏修改破坏端侧模型安全行为
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
一项基于论文摘要的研究发现,对 LLaMA-2-7B-Chat 的安全敏感行为主要集中于少量参数:按参数重要性筛选,仅修改 MLP down_proj 中0.19%的权重,便使 Basic ASR 达到53%、GCG ASR 达到56%。 与此同时,修改后模型在 tinyBenchmarks 上的准确率为51.6%,接近未修改模型的52.2%。研究还称 down_proj 持续是主要安全敏感组件,o_proj 贡献较小;该结果目前仅对应上述模型、攻击指标与基准。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 02:56
端侧语言模型安全性有多脆弱?定位安全关键参数进行稀疏故障分析报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AI端侧语言模型安全性有多脆弱?定位安全关键参数进行稀疏故障分析
基于论文摘要,LLaMA-2-7B-Chat 的安全敏感行为集中于稀疏参数,使用参数级重要性筛选仅修改 down_proj 中0.19%的模型权重,就得到53%的 Basic ASR 和56%的 GCG ASR。tinyBenchmarks 准确率为51.6%,接近未修改模型的52.2%;研究还发现 MLP down_proj 持续是主要安全敏感组件,o_proj 的贡献较小。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。