跳到正文
TechCrunch · AI· Aditya Mehta·· 1 天前

Goodfire推出基于模型内部激活的Agent监测器

Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost

研究任务与主要进展

Goodfire推出“内部激活监测器”,用探针读取模型运行中的中间信号,仅在发现风险时调用第二个AI进一步检查。该方案已向Baseten客户提供,可监测攻击、化学和生物武器滥用及奖励欺骗等风险,并支持日志记录、人工审查或拒绝请求。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请阅读原文核验。

来源:TechCrunch · AI · techcrunch.com