Humanize用独立评审约束编码智能体
热点事件观察中
Humanize用独立评审约束编码智能体
2 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Sihao Liu等提出面向智能体编码的多智能体工作流Humanize:人工批准计划契约,builder代理分轮实现,由另一供应商的reviewer代理判定完成;角色路由和72项机械门控由确定性钩子而非模型执行。 作者称该工作流已用于gem5构建系统迁移、内核设计代理和竞赛代理,在PutnamBench达到672/672、在Lean-Eval排名第1,并公开118份复盘;这些为作者报告的结果(基于论文摘要),未经独立核验。 事后分析显示,独立评审能发现builder缺乏证据的完成声明,但停止仍是主要弱点:在按阶段划分轮次的报告中,三分之二轮次发生在实现已被接受之后。上述证据为观察性事后分析,并非工作流之间的受控比较。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
Humanize:通过判断工程提升代理式编码可靠性报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · cs.AIHumanize:通过判断工程提升代理式编码可靠性
作者提出 Humanize 多人代理编排工作流,通过人工批准计划、构建代理分轮实现、另一供应商的审查代理决策完成,并由确定性钩子执行72项机械门控。基于论文摘要,作者报告该工作流用于 gem5 构建系统迁移、内核设计代理及竞赛代理,并在 PutnamBench 达到672/672、在 Lean-Eval 排名第1;相关证据包括应用部署、118份公开复盘和观察性分析,但不是工作流之间的受控比较。
10月7日
- arXiv · cs.AIHumanize:面向智能体编程的判定工程工作流
Humanize 提出一种面向智能体编程的多代理编排工作流,通过人工批准计划、builder 代理分轮实现、另一供应商的 reviewer 代理判定完成,并由确定性钩子执行72项机械门控。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。