7月28日,记者获悉,近日,具身全模态理解权威榜单DailyOmni最新评测结果揭晓,智元自研的具身原生全模态大模型WITA-Omni Preview,凭借音视频联合理解与时序推理能力,以85.21分综合成绩登陆榜单首位,在八项细分指标中的六项取得第一。
对于人形机器人交互能力来说,以往的全模态模型大多优先适配线上数字内容交互,而机器人身处持续变化的物理空间,不仅需要同步“看见画面、听见声音”,更要实时判断声音归属主体、事件发生顺序,识别交互对象、找准响应时机,传统模块化机器人方案很难完成这类时序耦合的复杂推理任务,也是长久以来人机交互生硬割裂的关键瓶颈。
对具身智能机器人而言,“理解”和“回应”并不是两个割裂的步骤,而是一个持续发生的物理过程。机器人需要一边观察环境、一边接收声音;一边组织语言、一边配合动作和表情。在多人、开放且持续变化的真实环境中,它还必须进一步判断:是否应该回应、什么时候回应,以及正在与谁交互。
据智元方面介绍,WITA-Omni并不是简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达。
同时,WITA-Omni一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。在中训练阶段,WITA-Omni 使用千万小时级多模态数据,将强文本、视觉底座进一步升级为能够“听得见、看得懂,并进行音画联合推理”的全模态模型。模型不仅学会“回答正确”,还进一步学会在真实场景中判断:该不该回应、何时回应,以及回应谁。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.