跳到正文
热点事件观察中

SEA-LM用阵列空间音频训练多模态模型

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Sonal Kumar等提出并评估SEA-LM,用FOACODER将可变数量、可变位置的智能眼镜麦克风阵列经波束形成转换为一阶Ambisonics嵌入,再以两阶段课程训练多模态大语言模型理解空间音频,覆盖六项任务,包括多人及重叠声音中的声源定位和空间选择性转录。 作者称,在其评估集上,SEA-LM相较对比基线具有更低的方位角和仰角误差、更高的时序IoU、更低的外部声源幻觉与漏检率,并在多数转录任务上取得更低词错误率;模型在4至9个麦克风、1,211种智能眼镜阵列配置下保持稳健。

AI 根据报道生成 · 55 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · cs.AI
    SEA-LM:面向可穿戴麦克风阵列的第一人称空间音频理解模型

    SEA-LM提出一种空间音频理解模型,通过FOACODER编码由可变数量、可变位置智能眼镜阵列经波束形成得到的一阶Ambisonics,并训练多模态大语言模型完成空间音频理解。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。