提出RASA:针对MoE模型越狱的专家级安全对齐框架
热点事件观察中
提出RASA:针对MoE模型越狱的专家级安全对齐框架
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Jiacheng Liang等人提出RASA,一种面向混合专家(MoE)模型的路由感知专家级安全对齐框架,用于减少稀疏路由导致的越狱绕过。基于论文摘要,作者报告在两种代表性MoE架构和多种越狱攻击上实现接近完美的鲁棒性和强跨攻击泛化,同时降低过度拒答、保持MMLU、GSM8K、TruthfulQA等基准上的部分通用能力。 背景:作者称初步实验发现,对MoE模型直接做全参数安全微调降低攻击成功率,靠的是路由或专家支配效应,而非直接修复安全关键专家。RASA的做法是识别被成功越狱样本过度激活的专家,在固定路由下只微调这些安全关键专家,再强化其与安全对齐上下文之间的路由一致性。 以上结果为作者基于论文摘要的报告,尚无独立验证。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
RASA:面向混合专家模型的路由感知安全对齐框架报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · cs.AIRASA:面向混合专家模型的路由感知安全对齐框架
Jiacheng Liang等人提出RASA,一种面向混合专家(MoE)模型的路由感知专家级安全对齐框架,用于减少稀疏路由导致的越狱绕过。基于论文摘要,RASA识别被成功越狱样本过度激活的专家,在固定路由下选择性微调这些安全关键专家,再强化其与安全对齐上下文之间的路由一致性;作者报告在两种代表性MoE架构和多种越狱攻击上实现接近完美的鲁棒性,并降低过度拒答、保持部分通用基准能力。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。