跳到正文
热点事件观察中

AI攻击能力评测被指高估危害

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Riegler等研究认为,现有AI攻击能力评测既可能高估模型造成的危害,也会把系统级能力归于模型,治理时不能只限制模型访问。 在每个目标承受逾225次群体生成攻击的测试中,LLM裁判称Claude Sonnet 4有40%的攻击成功,但人工复核未发现可操作的有害内容;在预设漏洞目标上,围绕12亿参数模型搭建的完整流程找出全部9个弱点,而移除手工组件后,按崩溃验证和引用代码行分别只能识别0个和2个。作者据此主张,攻击能力应由模型、脚手架和评测协议共同衡量。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · cs.AI
    《限制模型、忽视系统:Offensive AI 治理中的测量与问责》

    研究指出,AI 攻击能力测量会高估危害,并把属于系统而非模型的能力归因于模型,因此仅限制模型访问不足以构成治理方案。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。