Palette按领域放宽模型拒答
热点事件观察中
Palette按领域放宽模型拒答
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
Qitao Tan等提出Palette,通过轻量适配和参数合并,仅在授权目标领域放宽大模型的拒答行为;作者基于论文摘要称,其在四个安全基准、多个模型变体及大语言模型和视觉语言模型上实现了精确控制,同时保留其他场景的标准安全策略与通用能力。 Palette先用多目标搜索识别拒答方向,再通过轻量适配将其内化到模型中,并独立学习各领域的安全控制模块,从而无需重新训练即可组合多个领域的授权。该结果目前仅见于论文摘要所述实验。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
Palette:面向大语言模型按需授权安全对齐放宽的模块化框架报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIPalette:面向大语言模型按需授权安全对齐放宽的模块化框架
基于论文摘要,Qitao Tan 等提出 Palette 框架,通过多目标搜索识别拒答方向并用轻量适配将其内化到模型中,仅在授权目标领域放宽拒答,同时保留其他场景的标准安全策略。Palette 独立学习领域安全控制并通过参数合并组合,无需重新训练即可支持按需多领域授权;作者报告其在四个安全基准、多个模型变体以及大语言模型和视觉语言模型上的实验取得了精确控制且未牺牲通用能力。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。