arXiv · cs.AI· Uttamasha Monjoree, Wei Yan·· 2 天前
微调 Gemma-4 视觉语言模型以增强 AI 的空间智能:理解 3D 与 2D 旋转
Fine-Tuning VLM for Enhancing AI's Spatial Intelligence: Understanding 3D and 2D Rotations
arXiv:2610.04206v2阅读论文 PDF ↗
仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。
作者:Uttamasha Monjoree, Wei Yan
研究任务与主要进展
基于多对象旋转数据集的实验显示,微调后的 Gemma-4 MoE 模型在预测旋转轴和角度方面显著优于通用 Gemma-4 模型,并提升了无需显式坐标系的 2D 角度估计。可识别物体未提高角度检测准确性,而具有突出线性特征的物体表现更好;结果仅基于论文摘要。
阶段、条件与复现 · 深读核对
- 新能力对应什么具体任务与最小输入输出?
- 代码、模型、数据、许可与可用入口是否明确?
- 效果、总成本、失效条件与实际工作流如何验证?
这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。
来源:arXiv · cs.AI · arxiv.org