跳到正文
热点事件观察中

连续Dyna循环将十英雄MOBA胜率提至70.2%

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Jordy Kieto在论文摘要中报告,其连续异步Dyna循环让策略在完整十英雄MOBA中以Radiant身份对游戏自带对手取得70.2%的真实对局胜率,即600场胜421场(95%置信区间66.4%—73.7%);评测种子未用于任何决策。 该方法学习覆盖206个单位、每tick由全部英雄行动且最长6,000 tick的多智能体世界模型,仅在其中用1,400-tick自由运行想象回合训练策略。真实游戏不提供梯度,而是持续生成策略自身对局来更新世界模型,并通过在线评测选择和锚定策略;循环前胜率为33.7%,仅做梦中训练则为0%。策略作为Dire时没有获胜。

AI 根据报道生成 · 38 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    梦中学习、现实取胜:面向十英雄 MOBA 的连续 Dyna 循环

    基于论文摘要,作者学习了一个覆盖完整十英雄 MOBA 的结构化多智能体世界模型,并用 1,400 tick 的自由运行想象回合训练策略;通过持续异步 Dyna 循环,在未用于决策的种子上以 radiant 身份取得 70.2% 的真实对局胜率,即 600 场中的 421 场(95% CI 66.4%–73.7%)。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。