跳到正文
arXiv · cs.AI· Md Sazid Uddin, Md. Khairul Alam Mazumder, M. F. Mridha·· 6 天前精选

认证机制编辑:为技能移除与保留提供行为保证

Certified Mechanistic Edits: Behavioral Guarantees for Skill Removal and Preservation

arXiv:2610.03502v1阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Md Sazid Uddin, Md. Khairul Alam Mazumder, M. F. Mridha

首次提交:2026-10-03 00:01

研究任务与主要进展

研究者提出认证机制编辑方法,在连续嵌入空间区域内证明某项技能被移除、另一项有用技能得到保留,实验从玩具 ReLU 网络覆盖到标准 softmax + LayerNorm Transformer。论文摘要称,该方法在切换到 sound bound propagation 后,可处理约为精确求解器9倍的输入扰动维度,并证明有限确定性黑盒测试无法认证移除。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

本站判断

基于论文摘要,该工作将机制编辑的验证从有限测试扩展为连续输入区域上的行为保证,分别约束目标技能的移除与有用技能的保留,并以 sound bound propagation 将可处理扰动维度约为精确求解器的9倍。保证目前适用于小型标准架构网络,且依赖目标技能具有可判定规范;实际有害能力是否满足该条件仍待进一步验证。

来源:arXiv · cs.AI · arxiv.org