GAGR-Lab提出并报告单模型试点
热点事件持续更新
GAGR-Lab提出并报告单模型试点
1 篇报道1 个报道来源22 小时前更新
先了解这件事
AI 综述
Jingyao Zhang、Yun Li和Lu Han提出GAGR-Lab,用于评测模型在笛卡尔游戏场景中联合完成空间感知、度量落地、几何关系判断与解析函数构建的能力;其受控试点中,Llama 3.2 11B Vision Instruct完成432次尝试、获得429次有效响应,但未命中任何目标。 该试点仅覆盖一个托管模型,并以两个API凭据作为执行副本。具备额外权限的解析搜索对照在300个生成场景的600个方向案例中全部成功,且300个场景对应的1,200次垂直反射或平移检查均可重复完成,说明当前失败不能直接归因于任务本身。论文摘要还提出分阶段评测方案,但其中留出集复测、多模型比较和配对鲁棒性测试属于后续协议。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 23:01
GAGR-Lab:评估联合空间几何与解析函数推理报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · cs.AIGAGR-Lab:评估联合空间几何与解析函数推理
基于论文摘要,GAGR-Lab 通过 Cartesian 游戏场景、显式函数语义和 Rust 轨迹执行,评估空间感知、度量落地、几何关系与函数构建等能力。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。