讲真的, 瞅见这个消息, 我的首个反应是: 又是一则“国产模型登上顶峰”的新闻稿?
但仔细看完,发现这次不太一样。
“图文理解”并非那种通过刷榜得来的, 而是音视频联合起来在实际真实环境里所进行的理解。
85.21分,压过了千问、豆包、英伟达。
不是那种随便找人评的野榜。
是行业公认的权威第三方评测。
专门考你:画面和声音能不能对上号。
对于举例来说, 当有一个在此说话情况下背景存在着狗叫的人, 模型必须晓得那是狗发出叫声这一情况, 而一定不能是从人嘴里所发出的。
听着简单,其实巨难。
人形机器人要在真实世界里干活。
不是对着PPT讲相声。
它要听懂你所说的“把那个红色的杯子递给我”, 与此同时看到你手指所指的方向, 并且还必须听到环境里能不能够存在别的声音产生干扰。
这才是真交互。
最关键的一点:它不是把聊天模型硬塞进机器人。
相当多的公司所施行的行为, 乃是将诸如GPT这般的模型衔接上语音接口, 尔后宣称“我们已然打造出了机器人AI”。
智元这次的做法是——原生端到端。
什么意思?

就是视觉、听觉、语言、动作、表情,全在一个模型里统一处理。
不是拼凑,是融合。
用了千万小时级的音视频数据。
注意,不是那种剪辑好的短视频。
这是处于真实环境当中的原始素材, 既有噪音, 又存在中断情况, 还有各种各样杂乱无章的背景音。
而且,他们还自己建了一个以人为中心的全模态数据集。
完整保留了声音、画面、语言、动作、表情之间的时序关系。
这点很狠。
因为公开数据集里,这些东西往往是割裂的。
不是单项冠军,是全能型选手。
剩下两项没拿第一,估计也差得不多。
这种全面性,对机器人来说才是真有用。
终究你不愿一个机器人仅仅会聊天, 却领会不了你讲话时的语气, 以及背景音。
短期看,是技术实力的证明。
长期看,是具身智能赛道的一个信号。
当模型能够切实理解真实世界里声音与画面之间所存在的关系时, 机器人方才会就有从“工具”转变成为“伙伴”的可能性, 呐句号。
虽然还早,但方向对了。
至少这次,不是PPT上的第一。
相关标签: # WITA-OmniPreview # 具身大模型 # DailyOmni榜单 # 全模态理解 # 音视频联合理解