在人工智能技术快速发展的当下,人形机器人正逐渐从实验室走向实际应用场景。然而,当前多数人形机器人在人机交互方面仍存在明显不足,展厅里的人形机器人常被观众围得水泄不通,可当人们从不同方向提问时,机器人却常常对着空气回应;与用户对话时,其语音、表情和肢体动作总是慢半拍,话都说完好久了,手才缓缓抬起。这种“生硬感”,成为人形机器人落地应用时难以回避的交互难题。
近日,具身全模态理解权威榜单DailyOmni公布了最新评测结果,智元自主研发的WITA - Omni Preview模型以85.21分的综合成绩荣登榜首,超越了千问、Gemini、豆包以及英伟达等18款国内外主流模型,并且在八项细分指标中斩获六项第一。这一成绩的取得,为解决人形机器人交互生硬的问题带来了新的希望,也让行业看到了具身交互从“能用”迈向“自然”的可能性。
与常规的图文大模型榜单不同,DailyOmni榜单的考核方向紧密贴合真实物理世界的交互场景。常规多模态榜单多以图文问答为主,重点考察模型识别图片内容并回答文字问题的能力,更偏向于线上内容消费场景。而DailyOmni的测试集大量采用开放环境的真实音视频素材,着重考核模型三个方面的能力:能否将画面中的人与其发出的声音准确对应;能否理清事件发生的先后顺序;能否结合视听信息进行跨模态推理。打个形象的比喻,普通榜单考核的是“看图说话”,而DailyOmni考核的则是“察言观色”,就像真人在社交场景中,需要分清谁在说话、说了什么、话里的意图是什么,还要判断自己该不该接话以及何时接话。这些能力正是人形机器人在家庭、工厂、公共服务等场景中最急需,也是目前最为欠缺的感知基础。
过去,模块化机器人方案存在诸多弊端。视觉、语音、决策等模块相互独立,数据需要在多个系统之间流转,这不仅导致延迟较高,还经常出现“声画错位”的情况。例如,画面中的人已经走到左边,语音识别却还停留在上一个指令,机器人的反应总是慢半拍。在多人同时说话的场景中,机器人更是难以精准定位交互对象,常常答非所问。因此,DailyOmni榜单被业内视为具身智能感知能力的“试金石”。智元WITA - Omni能够登顶,意味着其在机器人急需的视听时序理解能力上取得了领先优势。
WITA - Omni之所以能在时序推理方面表现出色,关键在于它摒弃了“把聊天大模型装进机器人”的传统思路,重新构建了一套面向具身场景的三层架构,即Thinker(思考) - Talker(说话) - Actor(动作)。以往的机器人交互如同一条流水线,视觉模块处理画面,语音模块转写文字,大模型生成回答文本,最后运动控制模块将文本转化为肢体动作和表情。各个环节依次进行,前一个环节未完成,后一个环节就无法启动,这不仅导致延迟高,各模块之间还容易“配合失误”,出现语音说完,表情和动作才启动的生硬现象。
而WITA - Omni将感知、决策、表达整合到同一个端到端模型中,共享同一套认知状态。Thinker作为核心,将视觉、音频、文本统一映射到同一个语义空间进行联合推理。在此基础上,Talker流式生成语音,Actor同步输出动作和表情,三者并行推进,共用同一套时间轴。简单来说,以前的机器人是“想完再说,说完再动”,现在的它则是“边想边说,边说边动”,更接近真人聊天的状态。比如,用户喊机器人名字时,它能一边顺着声音方向转头,一边开口应答,眼神和动作同步跟上;讲解物品时,手指指向的位置和嘴里说的内容能精准对应,不会出现“指东说西”的错位感。这种一体化设计有效解决了长期困扰行业的“交互割裂感”,在多人对话场景中,模型能通过声画同步判断谁在说话、目光朝向哪里,从而决定回应对象,避免对着空气作答;在持续交互中,它还能判断何时该倾听、何时该插话,更符合人类的社交习惯。
很多人会好奇,为什么同样是多模态大模型,专门做具身的会在时序交互上更具优势?这背后的原因在于数据和训练方法。普通的公开音视频数据集大多只包含画面和语音内容,标注的也是“说了什么、发生了什么”,而不会标注“什么时候该回应、该对着谁回应、该做什么表情动作”。用这类数据训练出来的模型,虽然能答对问题,但却不懂交互的“分寸感”,就像一个只会背书却不懂聊天时机的人。为了解决这一问题,智元构建了一套以人为中心的全模态数据集,完整保留了真实交互场景中声音、画面、语言、动作、表情之间的时序关系,将人类社交的“节奏”融入训练数据中。
在此基础上,模型采用了三阶段训练策略。首先通过监督微调打基础,让模型学会基础的视听理解和表达;接着采用同策略蒸馏的方式,使模型在“有额外信息辅助”和“无辅助”的状态下对齐,提升在复杂上下文中的推理精度;最后运用强化学习优化交互决策,奖励信号不仅包括“答案正确”,还涵盖时间点是否准确、交互对象是否找对、该不该主动回应等社交维度的指标。这就如同教一个人社交,不仅要教他说正确的话,还要教他察言观色、把握时机。这也是WITA - Omni与普通全模态模型最核心的区别,其训练目标从“回答准确”升级为“交互自然”。
随着人形机器人运动能力逐渐成熟,行业竞争的重心正从“走得稳、抓得准”向“交互自然、能融入人类场景”转变。此前在WAIC 2026上,多家厂商展出的人形机器人已能完成行走、抓取、搬运等动作,但人机交互普遍仍显生硬,多数停留在“指令 - 执行”的初级阶段。不过,高质量具身交互训练数据的稀缺仍是行业面临的瓶颈。智元千小时级的专项数据集虽覆盖了一些典型交互场景,但面对家庭、工厂等复杂多变的真实环境,数据的丰富度和泛化性还需在实际落地中不断扩充。
智元WITA - Omni登顶榜单,释放出一个重要信号:具身智能的竞赛已从单维度的运动能力比拼,进入综合交互能力的下半场。如今主流产品已基本实现平稳行走、基础抓取,运动能力达到可用门槛,接下来谁能让机器人更自然地融入人类环境,谁就能在下一阶段竞争中占据优势。从全球范围看,特斯拉Optimus、Figure 01等产品都在加速端到端多模态交互的研发,试图让机器人从“执行命令的工具”转变为“能协作的伙伴”。智元此次在具身全模态榜单上领跑,表明中国厂商在具身认知算法层面已进入全球第一梯队。
对于智元自身而言,WITA - Omni是其“三智一体”架构中交互智能的核心底座,后续将与运动智能、作业智能联动,支撑机器人在更多场景落地。但从榜单成绩到真实商用,还有漫长的工程化路径要走。算力成本能否降低、真实场景的稳定性能否达标、量产时能否保持一致的体验,这些都是比跑分更现实的考验。不过,这份榜单第一的意义在于验证了一条道路:机器人原生的端到端全模态架构,确实能显著提升交互自然度。当越来越多厂商沿着这个方向迭代,人形机器人走出展厅、走进普通人的生活才有可能成为现实。毕竟,人类需要的不是一个只会执行指令的机械装置,而是一个能自然沟通、默契协作的伙伴。












