首页 AI实时资讯内容详情

全球第一,智元 WITA-Omni Preview 具身大模型登顶 DailyOmni 全模态理解榜单

2026-08-03 1 暗号导航联盟

讲真的, 瞅见这个消息, 我的首个反应是: 又是一则“国产模型登上顶峰”的新闻稿?

但仔细看完,发现这次不太一样。

“图文理解”并非那种通过刷榜得来的, 而是音视频联合起来在实际真实环境里所进行的理解。

85.21分,压过了千问、豆包、英伟达。

这榜单到底什么来头?

不是那种随便找人评的野榜。

是行业公认的权威第三方评测。

专门考你:画面和声音能不能对上号。

对于举例来说, 当有一个在此说话情况下背景存在着狗叫的人, 模型必须晓得那是狗发出叫声这一情况, 而一定不能是从人嘴里所发出的。

听着简单,其实巨难。

为什么说它跟机器人关系很大?

人形机器人要在真实世界里干活。

不是对着PPT讲相声。

它要听懂你所说的“把那个红色的杯子递给我”, 与此同时看到你手指所指的方向, 并且还必须听到环境里能不能够存在别的声音产生干扰。

这才是真交互。

WITA-Omni跟别的模型有啥不同?

最关键的一点:它不是把聊天模型硬塞进机器人。

相当多的公司所施行的行为, 乃是将诸如GPT这般的模型衔接上语音接口, 尔后宣称“我们已然打造出了机器人AI”。

智元这次的做法是——原生端到端。

什么意思?

2016全球高校排名榜单_八佰登顶2020年度票房全球_

就是视觉、听觉、语言、动作、表情,全在一个模型里统一处理。

不是拼凑,是融合。

它怎么训练的?

用了千万小时级的音视频数据。

注意,不是那种剪辑好的短视频。

这是处于真实环境当中的原始素材, 既有噪音, 又存在中断情况, 还有各种各样杂乱无章的背景音。

而且,他们还自己建了一个以人为中心的全模态数据集。

完整保留了声音、画面、语言、动作、表情之间的时序关系。

这点很狠。

因为公开数据集里,这些东西往往是割裂的。

八项指标,六项第一

不是单项冠军,是全能型选手。

剩下两项没拿第一,估计也差得不多。

这种全面性,对机器人来说才是真有用。

终究你不愿一个机器人仅仅会聊天, 却领会不了你讲话时的语气, 以及背景音。

所以,这到底意味着什么?

短期看,是技术实力的证明。

长期看,是具身智能赛道的一个信号。

当模型能够切实理解真实世界里声音与画面之间所存在的关系时, 机器人方才会就有从“工具”转变成为“伙伴”的可能性, 呐句号。

虽然还早,但方向对了。

至少这次,不是PPT上的第一。

相关标签: # WITA-OmniPreview # 具身大模型 # DailyOmni榜单 # 全模态理解 # 音视频联合理解