SLDR以分层恢复和动态路由抵御恶意微调
热点事件持续更新
SLDR以分层恢复和动态路由抵御恶意微调
1 篇报道1 个报道来源19 小时前更新
先了解这件事
AI 综述
Hui Zhang等提出后微调防御方法SLDR,仅用安全敏感性最高和最低的层训练LoRA恢复适配器,并在推理时根据表示为恶意查询启用适配器。基于论文摘要,该方法在四种模型架构、五个下游任务和四个有害基准上减少有害输出并保持下游效用。 在Llama3.1/SST2上,平均有害分数由11.54降至0.08,同时维持下游准确率;污染比例最高达0.9时,有害分数仍接近零。代码已公开,但上述结果目前仅据论文摘要。
AI 根据报道生成 · 46 分钟前更新
最新进展10月8日 00:23
SLDR通过选择性层恢复与动态路由防御恶意微调报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · cs.AISLDR通过选择性层恢复与动态路由防御恶意微调
作者提出SLDR,通过恢复安全敏感性最高和最低的层,并在推理时仅对恶意查询动态启用LoRA适配器,以防御恶意微调。基于论文摘要,SLDR在四种模型架构、五个下游任务和四个有害基准上减少有害输出并保持下游效用;在Llama3.1/SST2上,平均有害分数从11.54降至0.08,污染比例最高达0.9时仍接近零。代码地址为https://github.com/Stardust457/SLDR。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。