在世界机器人大会(WRC)的现场,一场关于具身智能未来走向的讨论正吸引着众多目光。银河通用创始人兼CTO王鹤在由公司主办的“具身智能大模型的进化之路”分论坛上,抛出了一个备受关注的问题:究竟该如何定义具身智能的ChatGPT时刻?他给出的答案是,机器人要能对未专门学习过的常见技能实现零样本泛化,普通用户无需算法背景就能教会它新动作,而这需要人形机器人拥有一颗能理解物理世界、控制全身和双手且持续学习的大脑。
银河通用最新发布的小人形机器人Galbot ET1(“银河星仔”)成为了这一设想的载体。作为全球首款具备自主学习能力的智能体人形机器人,它搭载了银河通用自研的AstraBrain-Agent。这一系统赋予了机器人实时观察环境、理解人类指令并动态规划行为的能力,人类无需准备动作视频,通过互动就能让它学习新动作技能。
“银河星仔”的出色表现源于其背后的具身大模型——银河星脑AstraBrain的进化。当具身智能行业还在激烈竞争身体性能时,银河通用已将重点放在了具身大模型上,而这个模型正决定着机器人的能力上限,这也是银河通用成为本届WRC焦点公司的原因。
Agent概念在AI行业已火热两年,数字世界里的Agent能在软件间调用工具、查找资料、执行线上任务。但物理智能体面临的是不断变化的现实环境,物品形状、光线和位置的变化都要求模型迅速理解并驱动身体做出反应。银河通用将AstraBrain-Agent定义为“物理世界原生智能体”,其感知和规划直接面向现实空间,思考结果转化为身体动作,执行动作后环境改变,新反馈又影响下一步判断。
基于这样的逻辑,“银河星仔”具备了互动自学习能力。它能实时识别人类舞者的运动轨迹,跟随完成街舞动作,面对撑地和倒立等高难度动作也能保持身体稳定,这得益于银河星脑通用小脑AstraBrain-WBC的支持。该模型背后有超过10万小时的人类动作数据,一部分来自高精度动作捕捉,另一部分由互联网人类视频转换而来。借助这些数据,模型学习人类维持平衡、协调关节和完成连贯动作的方法,并将运动能力迁移到机器人身上,无需提前写好整套动作轨迹。
过去,机器人增加一项技能通常需要专业团队重新采集数据并训练,技能还容易与特定本体和场景绑定。而AstraBrain-Agent希望保留模型已获得的通用能力,借助少量互动适应新任务,让机器人每学会一项新技能都在扩充同一颗大脑。围绕银河星脑,银河通用构建了包含大脑、脑桥和小脑的全脑架构。大脑负责理解环境并规划行动,小脑负责控制全身及双手,脑桥将高层意图传递到具体动作中。其中,大脑采用的世界—动作模型WAM架构,把根据视觉和语言生成动作的VLA能力与擅长推演环境变化的“世界模型”能力纳入统一模型,让机器人理解动作的物理结果并决定下一步行为。
AstraBrain WAM的核心突破是将跨本体、跨场景和多任务能力收进同一套基模。同一颗大脑既能驱动G1机器人使用灵巧手在商超取货、完成叠衣服等柔性操作,更换机器人本体后还能执行全新搬箱任务,模型积累摆脱了硬件和场景限制,这种能力迁移在行业中尚属首次。“银河星仔”搭载的AstraBrain-WBC通用小脑基模基于大规模人类运动数据训练,能把AstraBrain-Agent生成的意图转化为稳定、连贯的身体动作,面对训练中未出现过的动作也有出色泛化能力。网球场景就是检验其技术能力的典型,这项运动对抗性强、留给机器人反应时间短,机器人要预测来球轨迹、调整站位、保持平衡并精准击球。“银河星仔”搭载的银河通用LATENT高动态网球对抗规控框架,在实际演示中已能根据真人来球实时调整动作,完成拟人化对打。
在银河通用的展位上,“银河星脑”接受了不同任务的检验。早餐任务中,机器人要连续完成取面包、倒水和摆盘等步骤,过程中常出现杯子被观众拿走或目标物体被遮挡等偶发状况,但机器人能根据新状态重新规划,自如完成剩余工作。传统机器人在固定环境中执行预设流程,一旦条件改变任务就容易中断,而真实世界充满变化,机器人需在执行过程中不断更新对环境的理解并保持对整项任务的记忆。叠衣服任务则考验了具身大模型对柔性物体的理解,衣物形态不固定,每次抓取后布料褶皱改变,模型需重新判断衣服状态、寻找合适抓取点,任务能否继续取决于模型能否在每一步操作后更新判断。
对于真实产业场景,一次演示成功远远不够,每天大量重复作业中的准确率才决定客户是否愿意持续为机器人买单。银河通用已将产品规模化应用于智慧药房和即时零售,机器人要在上万种商品中准确找到目标并完成抓取交给骑手,每天重复大量次数,准确率、运行稳定性和异常处理能力直接影响业务。在工业场景中,银河通用的Galbot S1双臂最大负载达50公斤,能承担重型物料搬运,负载增加后机器人需重新调整身体姿态和出力方式,并判断周围人员位置确保协作安全。不同场景的机器人形态和问题差异很大,但它们共享银河星脑的技术底座,验证了其泛化能力,这也是具身大模型具备通用性的起点。
模型进入产业还有另一层价值,智慧药房、即时零售和工业产线会持续产生真实数据,这些数据记录了仿真环境难以覆盖的问题,如包装材质变化、设备长期运行偏差和现场人员随机干扰等。模型经过新一轮训练后,更新的能力会回到机器人身上。在论坛上,银河通用宣布将向科技企业和产业伙伴开放仿真平台、数据采集设备、具身基模及强化学习后训练管线,普通开发者也能围绕“银河星仔”创造新动作和应用。当生态越开放、参与者越多,大模型接触的真实问题越丰富,进化速度也会加快,模型只有进入真实世界,技术成果才能转化为持续生长的生产力。
过去几年,人形机器人行业的焦点多在身体上,宇树科技在机器人运控和工程能力上表现出色,8月19日上市首秀便拿下超过629%的涨幅,市值一度达到4449亿元,资本市场用热烈的首秀为人形机器人本体的商业价值给出了高价。机器人跑得快、跳得高、承受巨大冲击是技术进展的直观体现,但当机器人进入药房、商超和工厂,仅“能动”已无法满足需求,它要理解模糊指令、处理未见过物体、应对人员走动和物品移位。身体决定机器人能到达的地方,大脑则决定其能力边界,具身大模型成为行业新的分水岭。
本体性能可通过供应链和工程投入加快提升,而一颗通用大脑的成长周期更长,它需要在大量任务中学习物理规律并进入真实场景检验。模型经历的任务越丰富,处理新问题可调用的经验越多,后来者即使采用相近硬件也难迅速补上这种know-how。宇树上市彰显了机器人身体的商业价值,具身大模型的竞争则正在定义行业下一阶段的能力坐标。
银河通用很早就将数据基础设施视为具身大模型的核心,构建了五层数据金字塔。互联网数据助模型理解语义,人类动作数据提供操作经验,仿真平台大规模生成训练样本,真机遥操作数据校准精细动作,机器人进入实际场景后产生的问题又回到训练体系。王鹤披露,银河通用已积累100万小时人类数据和8万小时真实场景回流数据,早在2021年团队就开始建设第一视角人类—物体交互数据集,如今数据采集设备、仿真平台和模型测评系统已接入同一套基础设施。当更多机器人进入真实场景,银河星脑能获得更丰富物理经验,模型能力提升后新机器人和新任务适配成本也会下降,部署规模与模型能力相互推动,形成不断生长的数据飞轮。
回到本届WRC讨论度最高的问题,王鹤认为具身智能的ChatGPT时刻到来需满足两个标准:机器人面对人类无需专门学习的常见技能,零样本泛化成功率达到70%至80%;普通用户能低成本完成后训练,让模型快速适应工作环境。模型能力达到七八成只是第一步,现实中客户仍需算法工程师采集机器人动作数据并完成标注和调试,高昂适配成本会将机器人挡在大量中小企业和普通用户门外,具身大模型要普及还需解决“谁都能教、谁都能用”的问题。王鹤介绍了WAM-TTT测试时训练方案,用户佩戴第一视角相机拍摄自己工作过程,模型就能利用无标签视频进行部署,无需重新采集机器人动作数据,这又把具身智能的通用化向前推进了一步。统一基模积累物理世界通用知识,人类展示工作机器人就能快速获得对应能力,当教授机器人过程足够简单,具身大模型才能真正进入千行百业。












