跳到正文
arXiv · cs.AI· Uttamasha Monjoree, Wei Yan·· 2 天前

微调 Gemma-4 视觉语言模型以增强 AI 的空间智能:理解 3D 与 2D 旋转

Fine-Tuning VLM for Enhancing AI's Spatial Intelligence: Understanding 3D and 2D Rotations

arXiv:2610.04206v2阅读论文 PDF ↗

仅依据论文摘要整理;未读取全文,实验条件、证明与基准细节请核对原文。

作者:Uttamasha Monjoree, Wei Yan

研究任务与主要进展

基于多对象旋转数据集的实验显示,微调后的 Gemma-4 MoE 模型在预测旋转轴和角度方面显著优于通用 Gemma-4 模型,并提升了无需显式坐标系的 2D 角度估计。可识别物体未提高角度检测准确性,而具有突出线性特征的物体表现更好;结果仅基于论文摘要。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请结合上方论文版本、资料范围与原文核验。

来源:arXiv · cs.AI · arxiv.org