跳到正文
热点事件观察中

SWE-Game评测编码代理开发游戏能力

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Xiaoyu Chen等作者提出SWE-Game基准,并在六个模型上评测编码智能体的游戏开发能力;论文摘要称,Opus5在五类任务中总体得分均最高,但三类构建任务的最佳得分仍低于60/100,其中简述生成游戏为50.38分。 该基准基于41个可执行的Godot参考游戏,包含13类2D、3D玩法和247个任务,覆盖按简述开发、按设计文档实现、补全项目骨架、修复83个注入故障案例及从Godot移植至Unity。评测结合引擎状态检查、认证参考输入回放和代理自行编写功能演示,检查机制正确性、展示的可玩性,以及修复后的行为恢复与保留情况。

AI 根据报道生成 · 55 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    SWE-Game 基准评测编码智能体构建 Godot 游戏的五类任务能力

    基于论文摘要,SWE-Game提出包含247个任务、41个可执行Godot参考游戏和13类玩法的基准,覆盖从需求简述、设计文档到骨架补全、故障修复及Godot-to-Unity移植五类任务。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。