持续训练削弱恶意微调防御
热点事件观察中
持续训练削弱恶意微调防御
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
研究人员在四个开放权重模型上测试六种恶意微调防御,发现经过三轮持续有害数据微调后,全部72次防御运行的有害性都高于模型发布时;Llama-3.1在最高学习率下,防御模型最终几乎与未防御模型同样有害。 该研究基于对15种近期防御方法的调查,称这些方法多依赖有限攻击假设,权重发布后没有机制持续强制执行防护。实验结果表明,现有防御可以延缓或扰乱恶意微调,但多数未能形成持久保护;结论限于所测模型、防御和攻击设置。
AI 根据报道生成 · 3 小时前更新
最新进展10月8日 12:00
持续训练会侵蚀大语言模型恶意微调防御报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · cs.AI持续训练会侵蚀大语言模型恶意微调防御
作者调查15种防御恶意微调的方法,并在4个开放权重模型上对6种代表性防御进行持续有害数据微调测试。结果显示,72次防御运行在三次训练后的有害性都高于发布时,部分模型最高学习率下的防御结果接近未防御模型;这些防御目前主要能延缓或扰乱攻击,摘要未显示其普遍具备持久保护能力。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。