![]()
逛热闹的展厅,一群人围在一起闲谈,机器人站在人群中间,该如何分清嘈杂环境里谁在呼唤自己?与人交谈时,能抓住对方说话停顿的空隙顺势接话,被中途打断后顺畅衔接没说完的内容,开口作答的同时,配合语气做出抬手、点头、浅笑的神态动作……这些普通人日常聊天再平常不过的细节,恰恰是过去人形机器人最难翻越的大山。
长久以来,机器人行业陷入了一个尴尬困局:视觉识别、语音转文字、肢体运动每一项单独拉出来都成绩亮眼,可把看、听、说、动整套动作连贯融合,复刻人类自然交流状态,始终差着关键一截。各个感知模块各自运转,没法在同一时间线上协同配合,交互生硬、反应迟缓成了所有商用机器人的通病。
2026年7月,这一行业短板迎来重大突破。智元自研具身原生全模态大模型WITA-OmniPreview,拿下全球具身全模态理解权威榜单DailyOmni综合第一名,85.21分的总分超越千问、Gemini、豆包、英伟达等一众通用大模型厂商产品,八项细分评测里六项斩获榜首。一家深耕人形机器人本体的企业,反倒在全模态交互赛道跑赢了主流AI大厂,也为人形机器人走进家庭、工厂、线下服务场景打通了交互最后一关。
![]()
一、DailyOmni硬核大考:拼的不是看图听音,是声画同步理解
市面上绝大多数AI大模型评测,大多停留在静态图文问答、短视频内容解读层面,只需要AI看懂一张图片、一段剪辑好的短片给出答案就行,适配的是手机、电脑上线上刷内容的场景。但DailyOmni评测标准完全贴合机器人所处的真实物理世界,堪称人形机器人交互能力的摸底大考。
这份榜单全程采用商场、展厅、居家等开放空间的原生音视频素材,环境里充斥多人交谈杂音、背景响动、连续发生的各类琐事,核心考察三项硬核能力:精准匹配说话人与画面声源、理清整件事情发生的先后时序、结合画面与声音完成综合推理。简单来讲,就是考验AI能不能身临其境看懂、听懂动态环境里正在发生的一切。
WITA-Omni交出的答卷足够亮眼:音视频对齐、事件时序判断、长视频理解、综合推理等核心维度全线领跑。最值得行业深思的一点是,榜单前列几乎都是互联网大厂打造的通用全模态模型,主打线上数字内容交互;唯有智元是纯粹的具身智能玩家,所有技术打磨都围绕机器人面对面人机交互场景展开。
以往大家提起智元,最先想到的是可量产人形机器人整机、工厂作业机器人落地能力;这次登顶全球榜单意味着,智元早已不止是硬件制造商,底层AI大模型能力正式跻身全球第一梯队,从造机器人身体,进阶到打造适配物理世界的智能大脑。
二、重构底层架构:摒弃流水线模式,实现边想边说边动
过去机器人交流生硬,根源在于老旧的串行流水线架构。传统交互流程是死板的先后顺序:先收录语音→解析文字语义→生成回答文本→合成人声语音→最后下达指令调动肢体做出动作。一环传递给下一环,层层叠加延迟,信息流转中还会不断丢失细节。
最终呈现出来的效果十分割裂:机器人听完话要愣几秒才开口,话说完半天,手势和面部表情才慢悠悠跟上;开心的语气搭配紧绷的面部,讲述内容时手部动作杂乱无章,全程充满机器感。
WITA-Omni彻底推翻了这套串行逻辑,在经典Thinker-Talker双模块基础上新增Actor动作表情模块,搭建起三位一体同步运行架构,让思考、说话、肢体表达三件事在同一时间轴并行推进。
Thinker作为核心推理中枢,把画面、声音、文字全部转化为统一信息维度,实时判断当下该回应谁、何时开口;Talker流式输出语音,随时感知停顿、重音、情绪起伏;Actor模块不再是语音的附属品,会跟着说话语速、语气变化实时调动手臂动作、面部神态。
![]()
得益于跨流同步机制,机器人开口讲话的瞬间,抬手、点头、挑眉等动作同步启动,语速放缓时肢体动作随之舒缓,被人打断讲话可以立刻收住话语,待对方说完无缝接续前文。理解、表达、动作不再是割裂步骤,而是融为一体的自然输出,从根源上消解了机器人交互的迟钝与割裂感。
三、千万小时数据打磨:让机器人从真实对话里学会聊天分寸
大模型比拼早已不再是单纯堆砌参数,尤其面向具身交互的模型,高质量时序交互数据才是核心壁垒。网络上公开的音视频素材大多没有对话轮次、回应时机、肢体动作匹配标注,用这类数据训练出的AI,永远拿捏不好聊天节奏,分不清什么时候该倾听、什么时候该发言。
为适配机器人交互需求,智元搭建了专属分层数据训练体系。前期千万小时级多模态数据打底,音视频联合素材占比四成,重点训练声画对应与时序认知;音频、视觉、文本素材合理配比,夯实视听语言基础。更关键的是,团队自建了以人为核心的专属交互数据集,收录海量人与人、人与机器人面对面沟通画面,完整标注对话切换节点、回应时机、手势表情搭配逻辑。
除此之外,模型采用SFT监督微调、OPD同策略蒸馏、RL强化学习三段式后训练流程。强化学习阶段设置多重奖励标准,不仅要求回答内容准确,还会考核是否随意插话、停顿把控、打断衔接效果。日复一日训练下来,AI不再只会机械作答,慢慢掌握了人际交往里的分寸感:别人倾诉时安静聆听,对方短暂停顿适时接话,不会自顾自滔滔不绝。
四、全双工对话领先:聊天节奏自然,才算交互合格线
回答准确只是人机交互的基础门槛,舒服的对话节奏,才是普通人感知最直观的体验。为验证语音交互硬实力,智元将WITA-Omni放在国际权威SpeechArena两大语音基准里测试,最终在音频推理、全双工对话两项评测中拿下第一,成绩超越GPT-Realtime等海外顶尖闭源语音模型。
全双工对话能力,就是我们日常聊天“一边听一边说”的状态:交流过程中始终保持收音,既能实时接收对方话语,又能同步输出自己的内容,灵活把控对话轮次。很多大模型离线答题正确率很高,一旦进入实时对话场景短板尽显:要么不停抢话打断对方,要么过度沉默迟迟不回应,被打断之后直接丢失上下文,对话彻底中断。
WITA-Omni补齐了这块短板:多人嘈杂环境里精准锁定专属交谈对象,过滤无关背景噪音;交谈中途可以接收附和话语,调整自身表达节奏;突发打断发生时,快速记忆前文内容,自然延续话题。放到线下门店接待、居家陪伴、展厅讲解场景中,用户不会觉得自己在和一台机器对话,更像是和一位反应温和、懂得倾听的伙伴闲谈。
![]()
五、三智一体成型,具身智能迎来落地新阶段
一直以来,智元围绕运动智能、作业智能、交互智能打造完整技术版图,也就是“三智一体”体系:运动智能保障机器人顺畅行走、灵活活动;作业智能让机器人能够完成搬运、装配等各类劳作任务;此次交互智能登顶全球榜单,补齐了最后一块拼图,整套自研能力闭环彻底成型。
此前智元世界模型拿下WorldArena赛道冠军,作业、运动基座模型早已批量搭载在量产工业机器人上;如今交互大脑迎来突破,三大智能协同运转,刚好契合2026年具身智能行业从实验室研发转向线下规模化部署的大趋势。
未来走进工厂车间,机器人可以听懂工人指令、配合手势协作干活;入驻商场门店,能热情接待顾客、答疑讲解;走入普通家庭,陪伴老人闲谈、协助打理日常琐事。衡量人形机器人优劣的标准,早已不再是单项技术参数高低,而是整体协同带来的自然体验。WITA-Omni的突破,不止是一次榜单上的胜利,更让机器人真正融入普通人生活,迈出了坚实的一大步。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.