过去一年,具身智能赛道经历了资本狂飙与理性审视的双重洗礼。8月19日开幕的2026世界机器人大会,为产业观察打开了最立体的窗口。资本市场端,“人形机器人第一股”宇树科技上市首日高开629.44%;展会内外,看热闹的人少了,懂行的人多了,应用落地被频繁提及,一个更本质的问题也正在被产业链上下游反复追问:机器人的“大脑”够用吗?
莫刻机器人CEO池晓威:
硬件更多是工程命题
“大脑”的价值尚未被充分认知
当前中国机器人产业在本体制造层面已展现出显著的供应链优势,硬件问题基本可视为工程性可解的问题,相关头部企业上市后的强劲表现也印证了市场对此的认可。然而,具身智能的“大脑”才是机器人真正落地真实场景中最关键且目前最缺失的一环。
具身大脑的发展受制于数据、模型范式和评价指标三个核心要素。
其中,数据与模型的发展极度强耦合且不可分割。目前全球数据行业正快速推进,明后年(2027—2028年)数据规模预计将达上亿小时,数据层面的瓶颈正在被逐步打通。更关键的挑战在于,我们需要什么样的模型架构才能有效消化这些数据,并转化为具备足够泛化能力的具身“大脑”。
“大脑”的价值被低估不仅来自外部认知,也源于行业从业者自身。今年大量被称为“AI Native”(AI原生)的年轻公司正在快速成长,中国物理世界的具身“大脑”有望从这一代人中真正诞生。这一代“大脑”需要摆脱过去框架的束缚,不应仅聚焦于如何更快进入封闭场景的工业闭环,而应更加专注、真诚且极致地聚焦于如何真正解决具身“大脑”的核心问题。
合十思维创始人赵普:
堆算力的仿真狂欢
落地即“翻车”
1993年钱学森给戴汝为院士的一封信中提到:“智能机器人之所以智能,可能就在于能干点复杂些的事;所以要紧的是适应并反映比较复杂的环境。机器人本身是比较简单的,不是复杂巨系统,连简单巨系统都够不上,至多至多是个‘小型大系统’而已。AI进化主义派的论点有局限性。”
时隔三十三年,钱老这段话恰好戳破了当下具身智能行业最大的泡沫:堆砌算力只能完成标准化预设动作,仿人脑感知推理,才能应对现实世界里层出不穷的突发状况。
仿真环境里机器人成功率能做到89.4%,一到真实场景就跌到12%左右。主流VLA(视觉—语言—动作)大模型动辄百亿参数,推理延迟高、算力消耗大,单一场地部署成本达数十万元。换一个场景就要重新采集海量数据重新训练。
行业主流大模型的逻辑是:喂给它海量数据,让它记住尽可能多的“标准答案”。但真实世界的复杂在于——没有两个完全一样的场景,没有一个突发状况是标准的。
超维动力联合创始人兼硬件负责人郑存远:
软硬件需要同步进步
当下硬件需要等“大脑”半年左右
机器人一定是个系统工程,软件硬件必须同时掌握。接下来具身智能还要发展十年、二十年。关键在于,每个技术更新的前沿阶段,如何同时匹配最符合前沿的算法和最符合前沿的硬件——这跟手机和汽车每年迭代是一个模式。
现阶段从工程维度来评价,硬件比算法发展略快,但不是代际性的快,纯粹是因为硬件更多在解决工程性问题,而算法还有待解决的底层技术问题。不过硬件的工程性问题也有周期性,解决完之后也会再次回到底层技术问题,所以这是一个不断解决新问题的阶段。如果对标手机和车来做商业化产品,机器人硬件上不成熟的地方还有很多。大体上,每一代硬件大概要等“大脑”半年左右。
行业对机器人技术水平的认知基本在正常范围内。绝大部分企业还是比较纯粹的工程师状态,希望大家能正视客户预期与真实技术水平之间的差距,不要过度高估今天机器人能做什么,也不要过度低估未来能做什么。
人类数据是最高质量、最可规模化的数据。今天的问题只是还没有很低成本地把人类数据采集起来而已。
光象科技创始人兼CEO张涛:
具身模型
需要物理认知而非模仿
具身智能和物理AI的长期目标是能够完成各种生产和生活任务的通用智能。最大的挑战在于具身模型的泛化能力,无论是VLA,还是世界模型,技术范式都是数据驱动的,获取高质量、大规模的数据,是提升模型泛化性的关键。
然而,数据是当前具身智能行业紧缺的原料,工业场景的具身数据尤其稀缺,既没有能被广泛传播的互联网视频,也没有被采集的物理信号。然而,工业制造企业在数字化转型过程中已经建立了工业数据的基础,包括数据模型、产线工艺仿真模型、仿真数据等,这些都能够为具身模型的仿真训练提供支持。
具身模型不能只停留在动作模仿,通过采集大量数据让机器人模仿人类动作,本质上并没有真正理解物理世界如何运作,遇到新环境、新场景、新对象,模型的泛化能力不足。真正能够理解物理世界、在物理世界中产生泛化行为的具身模型,无需让机器人见过所有场景,而是基于对物理世界的认知,在面对新场景时自主产生对应的动作和行为。
橡木果机器人发起人姜峣:
卡住具身
智能发展的是“操作执行”而非“大脑”和硬件
具身智能的发展不是“大脑”等硬件或硬件等“大脑”,而是缺了操作执行这一层。人类操作是亿万年自然选择筛选出的本能——触觉信号在脊髓层就被反射处理了,根本不需要传到大脑。行业最大的误区,是把操作当成了认知问题。
VLA的底层逻辑在真实物理世界难以泛化,数据堆得越多,模型越脆弱。纯VLA已明显“失灵”,数采公司涌现、世界模型爆火,都是行业在找补这条路的结构性缺陷。
当前来看,解决数据比发展“大脑”更急迫,但路径不是先采数据,而是先让机器人“零数据冷启动”——先在真实世界里干起活来,数据自然从真实场景中生成。
语言和视觉上的通用智能可以靠更大规模数据+算力逼近,物理操作的通用智能需要的是对物理世界第一性原理的深刻理解,不是靠堆数据能解决的。
大脑擅长符号推理,不擅长物理交互,规划再强,到“最后一厘米”也会全失效。具身“大脑”会进入新阶段,但不是更大的数据训练出的模型,而是行业重新思考物理操作的本质是什么。
星灿智能创始人兼CEO李战斌:
每家都缺少关于空间智能
特别是3D模型数据
智能体要融入生活,不能只靠二维认知,得理解三维空间。但现实是,无论哪家公司,语料库里都缺空间智能,尤其是3D模型数据。激光雷达普及才十年,高质量三维语料严重不足。所以我们换了个思路:把采集设备做成消费者产品,直接放进用户家里。以轮椅为载体,360度高保真采集。自动驾驶靠众包地图把路跑通了,家庭空间的数据采集也可以走这条路。
我们避开了“为造人形而造人形”的陷阱。硬件形态应该服务于场景,所以我们把成本压到2000元以内,同时让模型效果逼近万元级芯片——只有成本下去,才能规模化进家庭。
长期智能体不能只有世界表征和任务执行能力,还得有长期记忆。我们做的World2Mind和NavMind,核心是把视觉、点云等整合成“心智地图”,让机器在内化空间结构后再去行动。
8月19日发布的Mate X,我们把上万元的光谱技术做到了百元级别。光有坐标和语义还不够,物质模态也得被感知到。多模态感知往前一步,机器对物理世界的理解才能更扎实。
北京商报记者 魏蔚
本网站所有内容属北京商报社有限公司,未经许可不得转载。 商报总机:010-64101978 版权合作:010-64101871
商报地址:北京市朝阳区和平里西街21号 邮编:100013 法律顾问:北京市中同律师事务所(010-82011988)
![]()
网上有害信息举报 违法和不良信息举报电话:010-84276691 举报邮箱:bjsb@bbtnews.com.cn
ICP备案编号:京ICP备08003726号-1
京公网安备11010502045556号 互联网新闻信息服务许可证11120220001号