提出局部稀疏LLM安全检测框架
热点事件观察中
提出局部稀疏LLM安全检测框架
1 篇报道1 个报道来源1 天前更新
先了解这件事
报道摘要
研究提出基于稀疏自编码器局部掩码的无监督大语言模型安全异常检测方法,用于识别训练中未覆盖的分布外输入。基于线性表示假设,研究认为概念空间中的邻近样本共享较小的活跃支持;摘要称该方法在多种架构和数据集上进行了验证,使用1%分布外数据校准后达到接近最优性能,计算仅使用1%–2%的SAE神经元。
摘自 arXiv · cs.AI
最新进展10月7日 12:00
研究利用局部稀疏性实现无监督大语言模型安全检测报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AI研究利用局部稀疏性实现无监督大语言模型安全检测
研究提出基于稀疏自编码器局部掩码的无监督大语言模型安全异常检测方法,用于识别训练中未覆盖的分布外输入。基于线性表示假设,研究认为概念空间中的邻近样本共享较小的活跃支持;摘要称该方法在多种架构和数据集上进行了验证,使用1%分布外数据校准后达到接近最优性能,计算仅使用1%–2%的SAE神经元。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。