跳到正文
热点事件持续更新

SLDR以分层恢复和动态路由抵御恶意微调

1 篇报道1 个报道来源19 小时前更新

先了解这件事

AI 综述

Hui Zhang等提出后微调防御方法SLDR,仅用安全敏感性最高和最低的层训练LoRA恢复适配器,并在推理时根据表示为恶意查询启用适配器。基于论文摘要,该方法在四种模型架构、五个下游任务和四个有害基准上减少有害输出并保持下游效用。 在Llama3.1/SST2上,平均有害分数由11.54降至0.08,同时维持下游准确率;污染比例最高达0.9时,有害分数仍接近零。代码已公开,但上述结果目前仅据论文摘要。

AI 根据报道生成 · 46 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · cs.AI
    SLDR通过选择性层恢复与动态路由防御恶意微调

    作者提出SLDR,通过恢复安全敏感性最高和最低的层,并在推理时仅对恶意查询动态启用LoRA适配器,以防御恶意微调。基于论文摘要,SLDR在四种模型架构、五个下游任务和四个有害基准上减少有害输出并保持下游效用;在Llama3.1/SST2上,平均有害分数从11.54降至0.08,污染比例最高达0.9时仍接近零。代码地址为https://github.com/Stardust457/SLDR。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。