跳到正文
arXiv · cs.AI· Abhinav Sudhakar Dubey (University of California Santa Cruz), Scott Sirri (University of California Santa Cruz), Vaggos Chatziafratis (University of California Santa Cruz), C. Seshadhri (University of California Santa Cruz)·· 2 天前

研究提出利用随机嵌入扰动越狱开放权重大语言模型

Jailbreaking Open-Weight LLMs via Random Embedding Perturbations

arXiv:2610.07125v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Abhinav Sudhakar Dubey (University of California Santa Cruz), Scott Sirri (University of California Santa Cruz), Vaggos Chatziafratis (University of California Santa Cruz), C. Seshadhri (University of California Santa Cruz)

研究任务与主要进展

Dubey等提出 PEV,通过在提示词的嵌入向量中加入独立高斯噪声,使六种开放权重大语言模型生成不安全回答。基于论文摘要,PEV 在 JailbreakBench 的全部测试模型和提示词上均生成不安全回答,新提示词通常一分钟内出现首次成功攻击;作者还观察到其获得首次成功攻击的平均计算成本最多比此前方法低一个数量级。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org