跳到正文
arXiv · cs.AI· Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky·· 1 天前

持续训练会侵蚀大语言模型恶意微调防御

A Few Steps Further: Why Defenses Against Malicious Finetuning Erode Under Continued Training

arXiv:2605.14605v3阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

研究任务与主要进展

作者调查15种防御恶意微调的方法,并在4个开放权重模型上对6种代表性防御进行持续有害数据微调测试。结果显示,72次防御运行在三次训练后的有害性都高于发布时,部分模型最高学习率下的防御结果接近未防御模型;这些防御目前主要能延缓或扰乱攻击,摘要未显示其普遍具备持久保护能力。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org