SWE-Game评测编码代理开发游戏能力
热点事件观察中
SWE-Game评测编码代理开发游戏能力
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
Xiaoyu Chen等作者提出SWE-Game基准,并在六个模型上评测编码智能体的游戏开发能力;论文摘要称,Opus5在五类任务中总体得分均最高,但三类构建任务的最佳得分仍低于60/100,其中简述生成游戏为50.38分。 该基准基于41个可执行的Godot参考游戏,包含13类2D、3D玩法和247个任务,覆盖按简述开发、按设计文档实现、补全项目骨架、修复83个注入故障案例及从Godot移植至Unity。评测结合引擎状态检查、认证参考输入回放和代理自行编写功能演示,检查机制正确性、展示的可玩性,以及修复后的行为恢复与保留情况。
AI 根据报道生成 · 55 分钟前更新
最新进展10月7日 12:00
SWE-Game 基准评测编码智能体构建 Godot 游戏的五类任务能力报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AISWE-Game 基准评测编码智能体构建 Godot 游戏的五类任务能力
基于论文摘要,SWE-Game提出包含247个任务、41个可执行Godot参考游戏和13类玩法的基准,覆盖从需求简述、设计文档到骨架补全、故障修复及Godot-to-Unity移植五类任务。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。