PEV用嵌入噪声攻击开放权重大模型
热点事件观察中
PEV用嵌入噪声攻击开放权重大模型
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
Dubey等提出PEV越狱方法,并基于论文摘要报告:在JailbreakBench中,它让六种不同规模的开放权重大语言模型对全部测试提示词生成了不安全回答,显示这些模型仍存在安全漏洞。 PEV仅在提示词的嵌入向量中加入独立高斯噪声,无需进一步修改。作者称,对新提示词,所有受测模型通常一分钟内即可出现首次成功攻击;获得首次成功攻击的平均计算成本最多比此前方法低一个数量级。这些结果目前来自论文摘要所述实验,尚不代表独立复现。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
研究提出利用随机嵌入扰动越狱开放权重大语言模型报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AI研究提出利用随机嵌入扰动越狱开放权重大语言模型
Dubey等提出 PEV,通过在提示词的嵌入向量中加入独立高斯噪声,使六种开放权重大语言模型生成不安全回答。基于论文摘要,PEV 在 JailbreakBench 的全部测试模型和提示词上均生成不安全回答,新提示词通常一分钟内出现首次成功攻击;作者还观察到其获得首次成功攻击的平均计算成本最多比此前方法低一个数量级。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。