跳到正文
热点事件观察中

SafeEvo演化大模型拒答回路

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Miao Yu等提出SafeEvo框架,从预训练大语言模型中提取可独立表达拒答行为的弱拒答回路,并通过因果消融检验其作用;研究还追踪了拒答回路在连续安全对齐检查点中的结构变化。 基于arXiv摘要,团队提出Safety Circuit Alignment(SCA),将安全更新限制在拒答回路内。在三个大语言模型、两种对齐算法上的实验中,SCA平均在三个方面优于常规对齐,但摘要未说明具体指标、优势幅度或代码验证情况。作者称,对齐过程中拒答回路的渐进变化可能导致其更新影响与通用能力相关的参数,从而解释安全与能力之间的权衡;这一机制仍属其提出的解释。

AI 根据报道生成 · 58 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    SafeEvo揭示并演化大语言模型安全对齐回路

    作者提出SafeEvo可解释性框架,从预训练大语言模型中提取可独立表达拒绝行为的弱拒绝回路,并通过因果消融验证其对拒绝有害输入的作用。框架进一步追踪拒绝回路在连续对齐检查点中的结构变化,并提出将安全更新限制在拒绝回路内的Safety Circuit Alignment(SCA)。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。