PChome 7月29日消息,7月28日晚,据智元AGIBOT微信公众号消息,智元自研的具身原生全模态大模型WITA-Omni Preview以85.21分登顶DailyOmni榜首。
PChome 7月29日消息,7月28日晚,据智元AGIBOT微信公众号消息,智元自研的具身原生全模态大模型WITA-Omni Preview以85.21分登顶DailyOmni榜首。该成绩超越千问、Gemini、豆包、英伟达等主流模型,并在八项细分指标中拿下六项第一,展现出在音视频联合理解与时序推理方面的领先能力。

DailyOmni是行业公认的检验音视频时序对齐与跨模态推理的权威榜单,大量采用真实开放环境音视频素材。其核心考核模型能否像人一样精准识别声画对应关系与事件先后顺序,这正是人形机器人在商场、展馆等真实物理空间与人交互时所需的核心感知能力。

WITA-Omni并非简单将聊天模型“装进”机器人,而是采用Thinker–Talker–Actor三层原生端到端架构,将物理动作和表情提升为与语音并列的一级输出。训练阶段使用了千万小时级的多模态数据,让机器人从冰冷工具向能理解人类意图的协作伙伴迈出关键一步。