跳到正文
热点事件持续更新

GAGR-Lab提出并报告单模型试点

1 篇报道1 个报道来源22 小时前更新

先了解这件事

AI 综述

Jingyao Zhang、Yun Li和Lu Han提出GAGR-Lab,用于评测模型在笛卡尔游戏场景中联合完成空间感知、度量落地、几何关系判断与解析函数构建的能力;其受控试点中,Llama 3.2 11B Vision Instruct完成432次尝试、获得429次有效响应,但未命中任何目标。 该试点仅覆盖一个托管模型,并以两个API凭据作为执行副本。具备额外权限的解析搜索对照在300个生成场景的600个方向案例中全部成功,且300个场景对应的1,200次垂直反射或平移检查均可重复完成,说明当前失败不能直接归因于任务本身。论文摘要还提出分阶段评测方案,但其中留出集复测、多模型比较和配对鲁棒性测试属于后续协议。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    GAGR-Lab:评估联合空间几何与解析函数推理

    基于论文摘要,GAGR-Lab 通过 Cartesian 游戏场景、显式函数语义和 Rust 轨迹执行,评估空间感知、度量落地、几何关系与函数构建等能力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。