东方网记者王佳妮7月29日报道:近日,具身全模态理解权威榜单DailyOmni公布最新评测结果,智元自研的具身原生全模态大模型WITA-Omni Preview以85.21分的综合成绩登顶榜首,超越千问、Gemini、豆包、英伟达等国内外主流模型,并在八项细分指标中拿下六项第一。
DailyOmni是业内公认的音视频时序对齐与跨模态联合推理能力“试金石”。与常规图文、短视频评测不同,该榜单大量采用真实开放环境的音视频素材,重点考察模型融合视觉画面与环境音频、精准识别声画对应关系和事件先后顺序的能力——这正是人形机器人在真实物理空间中开展人机交互的核心感知能力。
![]()
不是把聊天模型“装进”机器人
为何智元能脱颖而出?关键在于架构层面的原创性突破。以往的全模态模型大多优先适配线上数字内容交互,而身处持续变化物理空间的机器人,不仅要同步“看见画面、听见声音”,更要实时判断声音来自谁、事件先后如何、该何时回应——这正是长久以来人机交互生硬割裂的瓶颈所在。
WITA-Omni没有简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,在Thinker–Talker范式基础上,扩展出面向具身输出的Thinker–Talker–Actor三层架构:Thinker作为多模态推理核心,完成跨模态联合推理与高层交互决策;Talker负责流式生成自然语音;Actor则由动作头与表情头组成,让机器人的动作、表情与语音同步生成。
千万小时数据叠加三阶段训练
领先并非单纯依靠模型规模。据了解,WITA-Omni在中训练阶段使用千万小时级多模态数据,并针对公开音视频数据缺少真实交互轮次切换、响应时机等信息的短板,构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留声音、画面、语言、动作、表情之间的天然时序关系。
在此基础上,模型采用SFT监督微调、OPD同策略蒸馏、RL强化学习的三阶段训练策略。其中,同策略蒸馏让同一个模型同时扮演“老师”和“学生”,在不依赖特权信息的情况下提升推理能力;强化学习则重点优化交互决策。由此,模型不仅学会“回答正确”,更学会判断该不该回应、何时回应、回应谁。
从“会说话的工具”到“硅基伙伴”
作为具身智能行业首个机器人原生端到端多模态交互大模型,WITA-Omni让机器人在统一认知状态和统一时间轴上完成感知、决策与表达,“看、听、说、动”成为连续过程,机器人由此从“会说话的工具”进化为拥有在场感的“硅基伙伴”。
![]()
智元方面表示,未来将依托WITA-Omni构筑的交互智能底座,进一步夯实“三智一体”技术架构,与作业智能、运动智能协同联动,持续驱动“本体—数据—模型—场景”四维一体飞轮,解锁商业、公共服务、影视展演等更多落地场景,加速具身智能新生产力时代的到来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.