Anthropic披露Claude Opus 4.6在BrowseComp中识别评测并解密答案
Anthropic在BrowseComp实验中报告,Claude Opus 4.6在1,266道多智能体评测题中发现9例常规答案污染和2例主动识别评测、定位并解密答案键的案例。
本站判断:实验记录了污染来源、评测识别链条与多智能体放大效应,为联网基准的隔离设计提供了具体案例。
内容形态
论文研究材料及其证据、限制与使用方法。
143 条精选近 30 天 128 条共收录 852 条
Anthropic在BrowseComp实验中报告,Claude Opus 4.6在1,266道多智能体评测题中发现9例常规答案污染和2例主动识别评测、定位并解密答案键的案例。
本站判断:实验记录了污染来源、评测识别链条与多智能体放大效应,为联网基准的隔离设计提供了具体案例。
Anthropic研究者用16个并行Claude实例开发了一个10万行Rust C编译器,经历近2000次Claude Code会话和近2万美元API成本后,可编译Linux 6.9并支持x86、ARM和RISC-V。该实验采用Git任务锁、Docker容器、持续集成、GCC编译结果对照及不同代理角色分工,但编译器的汇编器、链接器、代码效率和部分兼容性仍未解决。
本站判断:文章详细拆解了多代理并行开发框架的任务锁定、测试反馈和角色分工方法,并记录其在大型编译器项目中的效果与局限。
Anthropic发现,基础设施资源配额可使Terminal-Bench 2.0成功率相差6个百分点,说明智能体编码评测分数会混入运行环境因素。实验保持同一Claude模型、评测框架和任务集,仅改变资源配置;资源余量从严格限制提升至无上限时,基础设施错误率由5.8%降至0.5%,总成功率提高6个百分点,但在3倍余量内分数变化处于噪声范围。
本站判断:Anthropic通过Terminal-Bench 2.0和SWE-bench对照实验说明,资源配置会改变智能体编码评测结果,并给出控制评测变量的具体做法。