TechCrunch · AI· Aditya Mehta·· 1 天前
Goodfire推出基于模型内部激活的Agent监测器
Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost
研究任务与主要进展
Goodfire推出“内部激活监测器”,用探针读取模型运行中的中间信号,仅在发现风险时调用第二个AI进一步检查。该方案已向Baseten客户提供,可监测攻击、化学和生物武器滥用及奖励欺骗等风险,并支持日志记录、人工审查或拒绝请求。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请阅读原文核验。
来源:TechCrunch · AI · techcrunch.com