跳到正文
热点事件观察中

Humanize用独立评审约束编码智能体

2 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Sihao Liu等提出面向智能体编码的多智能体工作流Humanize:人工批准计划契约,builder代理分轮实现,由另一供应商的reviewer代理判定完成;角色路由和72项机械门控由确定性钩子而非模型执行。 作者称该工作流已用于gem5构建系统迁移、内核设计代理和竞赛代理,在PutnamBench达到672/672、在Lean-Eval排名第1,并公开118份复盘;这些为作者报告的结果(基于论文摘要),未经独立核验。 事后分析显示,独立评审能发现builder缺乏证据的完成声明,但停止仍是主要弱点:在按阶段划分轮次的报告中,三分之二轮次发生在实现已被接受之后。上述证据为观察性事后分析,并非工作流之间的受控比较。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · cs.AI
    Humanize:通过判断工程提升代理式编码可靠性

    作者提出 Humanize 多人代理编排工作流,通过人工批准计划、构建代理分轮实现、另一供应商的审查代理决策完成,并由确定性钩子执行72项机械门控。基于论文摘要,作者报告该工作流用于 gem5 构建系统迁移、内核设计代理及竞赛代理,并在 PutnamBench 达到672/672、在 Lean-Eval 排名第1;相关证据包括应用部署、118份公开复盘和观察性分析,但不是工作流之间的受控比较。

10月7日
  1. arXiv · cs.AI
    Humanize:面向智能体编程的判定工程工作流

    Humanize 提出一种面向智能体编程的多代理编排工作流,通过人工批准计划、builder 代理分轮实现、另一供应商的 reviewer 代理判定完成,并由确定性钩子执行72项机械门控。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。