新闻中心
外滩大会举办具身科学家论坛,行业专家、头部企业首席科学家围绕具身大模型、物理世界数据采集、产业生态协同三大核心议题展开深度讨论。论坛核心观点直指当前行业痛点:具身智能产业不能持续陷入 Demo 内卷,漂亮的舞台演示意义有限,产业长期价值在于降低真实场景部署成本,解决物理世界任务。
数字大模型已经取得巨大成功,ChatGPT、多模态大模型能够理解文字、图片、视频,但这些模型运行在数字空间。具身大模型则需要驱动实体机器人,处理来自摄像头、触觉传感器、IMU 惯性传感器源源不断的连续物理信号,把语言指令转化为稳定、安全、可执行的肢体动作。蚂蚁灵波首席科学家沈宇军在论坛上提出,不能简单把数字多模态大模型直接搬到机器人身上。数字模型处理静态图像,而机器人身处动态物理世界,物体受力、摩擦、形变都会影响动作结果。具身模型必须完成三件核心工作:原始传感器信号表征提取,视觉、触觉多模态信息对齐融合,生成可落地动作序列,这是和纯数字大模型最本质区别。
当前行业有两种主流技术路线:一种是仿真预训练 + 真机微调,在虚拟仿真环境中训练机器人抓取、移动、操作物体,再迁移到实体机器人上;另一种是以真机采集真实世界数据,通过强化学习持续优化动作。两条路线各有利弊。仿真平台数据量大、成本低、安全可控,但仿真世界和真实世界存在 “现实鸿沟”,仿真训练好的机器人落地真机容易失效;真机采集数据真实性高,但采集昂贵、存在安全风险,大规模采集难度大。
论坛嘉宾香港中文大学薛天帆提到,行业评测体系同样需要重构。过去大家比拼机器人能不能完成单一炫酷动作,未来评测标准需要面向真实任务,考核机器人长时间作业稳定性、陌生环境零样本泛化能力、故障自恢复能力。单一 Demo 成功不代表技术可行,产业需要标准化评测基准,服务研发迭代,而不是单纯用来做宣传对比。上海交大李永露补充,现在很多企业评测指标五花八门,缺少统一标准,导致技术成果很难横向对比,行业重复研发成本居高不下。
数据已经成为制约具身智能发展的核心瓶颈之一。AI 大模型依靠海量文本、图像数据训练,而物理世界机器人数据获取难度高出几个量级。每一次机器人抓取、移动、交互,都需要昂贵硬件、人工标注,还需要考虑安全风险。现场企业代表介绍,目前行业内机器人数据大多是企业自建私有数据集,数据格式、标注标准不统一,数据孤岛现象突出。不同厂商机器人硬件不同,传感器参数不一样,数据集很难互通复用。
针对数据难题,国内已有企业探索新方案。觅蜂科技推出具身数据众包采集平台,打造 “机器人训练师” 新型岗位,面向全行业按需定制机器人训练数据集。世界人形机器人运动会现场发布开放数据集,将数千小时机器人运动数据、上万次动作捕捉数据免费对外开放,降低中小企业与科研机构的数据获取门槛。开放数据生态被认为是加速整个行业迭代的关键手段,依靠单个企业闭门采集数据,迭代速度很难提速。
在生态协同层面,论坛嘉宾一致认为,具身机器人是典型长链条产业,涵盖芯片、传感器、减速器、伺服、本体硬件、仿真平台、大模型算法、场景运营,任何一家企业很难全栈包揽全部环节。当前行业存在重复造轮子现象,各家企业自研全套系统,硬件接口、通信协议不兼容。未来产业需要建立开放标准,统一硬件接口、数据格式、安全规范,打造分工协作生态。硬件厂商专注本体与零部件,算法公司专注具身大模型与感知控制,场景服务商负责行业落地与运营。
当然,生态建设并非一蹴而就。企业之间存在商业竞争,开放数据、开放接口意味着需要平衡商业利益。有企业代表提出,可以采用分层开放策略:基础底层评测数据集、通用仿真接口开放共享;行业私有场景数据保留,兼顾公共创新与商业知识产权。
展望行业发展,专家认为具身模型发展分为三个阶段。第一阶段:模型具备基础感知与动作复刻能力,完成已知场景任务;第二阶段:机器人拥有通用智能体能力,拆解长任务,自主规划,遇到问题自主调整方案;第三阶段:真正物理世界通用具身智能,能够在完全陌生环境自主完成复杂任务。当前国内产业整体处于第一阶段向第二阶段过渡。
论坛最后形成共识:产业需要跳出 “比动作、比外观” 的浅层竞争,回归技术本质。未来竞争核心不是谁的机器人演示更炫酷,而是谁的系统部署成本更低、容错能力更强、能够持续稳定创造商业价值。只有模型、数据、生态三者协同突破,具身机器人才能真正走出实验室,走进工厂、园区、楼宇,释放产业价值。



