跳到正文
热点事件观察中

提出SSRFT框架:安全对齐重构为安全角色内化

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Jinghao Pang等在arXiv论文(基于摘要)中提出SSRFT(Supervised Safe-Role Fine-Tuning)框架,称其为首个将大语言模型安全对齐重新表述为内化预定安全角色的框架。该框架从心理测量问题、少量越狱提示和安全角色描述构建SRQA(Safe-Role Question-Answer)数据集用于微调。 论文称,在多个Base和Instruct模型上的实验显示,SSRFT比标准SFT获得更稳健、更可泛化的安全对齐:对prefilling攻击的鲁棒性显著更强,对未见过的越狱域泛化更好,同时减少对良性查询的过度拒答并保持模型通用能力。以上为作者声称的实验结果。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    大语言模型安全对齐研究提出 SSRFT 安全角色内化框架

    基于论文摘要,研究团队提出 SSRFT(Supervised Safe-Role Fine-Tuning)框架,将大语言模型安全对齐重新表述为预定安全角色的内化。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。