服贸会的人流涌进首钢园,一场关于“具身智能”的产业潮汐也向这里汇聚。
9月11日,2026年中国国际服务贸易交易会配套活动——物理AI与具身智能机器人创新生态交流会在此启幕。开幕式论坛以“万物具身・智能交互・生态共建”为主题,产业链齐聚京城,如百川汇海,共同涌入具身智能与物理AI的广阔海域。
具身智能外在呈现为一台或无数台机器人,但其背后并非一家或几家公司的闭门造车——数据、算力、模型、本体……产业链各环节环环相扣、协同共生。底层,需要一颗敏锐的“眼睛”,感知物理世界的图像与交互;上层,需要一个足够聪慧的“大脑”,支配一具足够可靠的“身体”,共同构成走入工业、商业、生活各类场景的各式机器人。
交流会上的每个企业,几乎都代表着产业链的某个切面。例如,晰见科技源于清华大学类脑计算研究中心。公司首创类脑互补视觉芯片“天眸芯”,并以此为核心构建“芯片—协议—大模型”三位一体的全栈技术体系,推动类脑视觉技术走向规模化应用,重塑物理AI时代的视觉基础设施;聆动通用搭建了覆盖大脑、小脑与本体的全链路自主可控技术体系,深耕物流、汽车、3C等泛制造业场景,推动具身智能在工业领域的规模化落地;北京本地具身智能企业银河通用自主研发了集大脑、小脑、神经控制于一体的具身基座大模型“银河星脑”AstraBrain,并通过模型统一旗下消费级与工业级各式机器人本体,在医疗药房、零售文旅、智能制造等领域已实现应用落地……
芯片、大脑,本体层层接力,产业链同赴一片海。

01.视觉芯片与Token相机
一个少有人提及的问题是:为什么已经有了参数规模动辄数万亿的大语言模型,却几乎没有所谓的“大视觉模型”?在端侧、在机器人身上运行的视觉模型,往往只有数十亿参数。
晰见科技创始人兼CEO杨哲宇告诉北京商报记者,其矛盾源自硬件层的图像传感器。
杨哲宇解释称,今天几乎所有的摄像头,本质上都是为服务于人类的眼睛,它们均匀记录画面中的每一个像素,追求分辨率、帧率和画质的极致。但这三个指标天然相互掣肘,做高其一,另外两个就得让步(下降)。这也是为什么手机背面要排布好几个摄像头——没有任何一颗图像传感器能同时搞定所有场景。
但这实际上并非人眼的工作模式——人们看东西时,盯着某处,那里就会更清晰,周围则相对模糊,因为大脑只对画面中关键的信息投入注意力。杨哲宇称,公司在做的事,就是把人眼这套注视点机制搬进芯片。
据悉,天眸芯并不均匀采样所有像素,而是像人一样捕捉画面中的关键信息——哪里在变化、哪里是边缘、色彩和深度如何分布,再以稀疏量化的方式完成编码。效果以一次射箭为例:传统相机以30帧拍摄高速运动的箭矢,慢放下来只能捕捉零星几帧;天眸芯能完整还原飞驰的箭、振动的弦甚至衣角的抖动,而且功耗更低、带宽占用更小。
表象的好处是,可以把重要内容拍出来、拍得更清楚,而更深层也更重要的好处是,这样处理,算力芯片才更“算得动”。
杨哲宇提到,视觉和文本是两种不对等的模态。人说话每秒只产生几个Token,但一张1080P图像就有约8000个Token,要看得连续,每秒30帧就是24万个Token。端侧最好的GPU(图形处理器)跑一个7B模型,每秒也不过处理数百个Token——应付语言绰绰有余,面对视频则捉襟见肘。这又回到前述大视觉模型迟迟跑不起来的根本原因:数据量太大,有效信息却太少。
基于天眸芯,晰见科技希望重新定义一种“Token Camera(词元相机)”,通过芯片进行视觉感知稀疏计算,判断每一个信息单元的价值,再经过内存重排,输出一种人眼可能已经看不懂、却天然适合大模型处理的数据格式。基本单位不再是传统帧和像素,而是更契合“视觉”的有效Token。
杨哲宇判断,给人看的视觉方案和给AI看的视觉方案在未来数年将彻底分化,成为两条截然不同的路径:眼镜、胸口、耳机上那些无法调整构图的摄像头,对于物理AI产业本身价值有限,可一旦直接接入大模型,它们将成为物理AI的“眼睛”。
这种技术变革,或将带来更大的想象空间——视觉如果拥有了通用性,控制相机的方式就不再是写代码、做标注,而是自然语言——告诉它数一下跳绳跳了多少下,它就能完成观察与计数。那些过去因为碎片化、逐案定制而没有公司愿意做的场景:门有没有锁好、卷饼少没少放酱料、产线上的操作流对不对,在大模型时代都将回归标准化的产品模式。
02.深耕产线的全栈派
在本次物理AI与具身智能机器人创新生态交流会上,聆动通用生态负责人黄志冉分享了一线落地的真实经历。
与很多厂商广泛铺场景不同,聆动通用选择深入沉淀在少数几个场景中,把链路打通、方案闭环后再迁移到其他场景。
物流分拣是其中颇具代表性的一个。黄志冉告诉北京商报记者,公司已经跟头部物流客户陪产了大约两年,客户晚上9点开工到凌晨4点,团队需要把大量工程师部署到现场。实验室里推理能力很强的Demo(演示),到了真实场景里却发现完全不一样,“后来排查出是速度原因导致推理泛化能力不行”。
据称,团队当场跟客户聊明问题,AI工程师和大模型出一版初稿,第二天工程化团队商讨方案后重新部署,冻结需求反复实验,直到符合客户的节拍和要求。
客户真正认可的标准远不止分拣速度。黄志冉坦言,物流行业机器人应用常提的“每小时多少件”只是很简单的一项指标,真正满足客户要求的有五到六种以上,包括面单识别率、抓取可靠性,以及回流率、抓伤率等负面指标必须低于百分之几,机器人才算从PoC(概念验证)走向可复制、可量化。
可靠性是另一道门槛。黄志冉提到,CR认证是机器人进入规模化的基本通行证。其他指标方面,其机器人重复精度达0.01千克,无故障持续工作寿命超7000小时,具备IP54防尘防水。
安全可控同样是重中之重,一旦机器人在工业场景中伤人或因节拍问题造成流水线损失,危害可能远超部署成本本身。“业务永远停留在拍视频和做宣传上,对整个行业是不利的。”
黄志冉强调,模型、本体、数据最终都要沉淀在客户的业务场景中,让客户算得过来投资回报的账,商业化路径才真正成立。
03.赛场与“进厂”
刚刚结束的北京人形机器人运动会上,田径领域机器人突破人类世界纪录吸引大量目光。但在另一片场地,场景赛的难度或许更接近具身智能的真实考题。
据称,赛制设置之初就给机器人提出了“像人一样工作”的挑战——项目难度较高,赛会仍允许部分团队采用遥操作方式,自主操作的团队则获得更高激励,银河通用是其中为数不多坚持用具身智能大模型全程自主参赛的公司。
“(技术)试金石确实需要像这样一些有挑战的赛道。”北京银河通用机器人有限公司首席战略官赵于莉会上说。
她回顾了参赛的三个环节——家庭、餐饮、商超,均属难度较高的场景赛,银河通用全部夺金,其中餐饮和商超以全满分拿下。家庭场景中,机器人需要完成衣物折叠、响应门铃取放包裹、操作微波炉和柜门等精细化任务;商超环节中,裁判员在机器人进场前随机摆放错乱物品,银河通用的机器人基于视觉感知自主完成了纠正。
赵于莉告诉北京商报记者,在赛场和展示检验技术之后,银河通用的目标始终是用具身智能实现产业落地,目前行业拐点已经出现,正进入规模化应用的飞速增长期。在她看来,机器人规模化落地的三道门槛分别是:从真实应用场景出发设计产品逻辑、基于数据闭环驱动大模型实现泛化通用性、硬件可靠性和量产一致性经过长期验证。
药房方面,2024年9月银河通用与美团合作开出第一家智慧药房,目前已覆盖全国33个城市、近100家门店,最早投入的机器人连续7×24小时工作已近两年。零售文旅方面,银河太空舱已部署全国50个城市、200个点位。工业方面,重载机器人进入西门子工厂承担搬运工作;在宁德时代智慧产线,银河通用是首个实现常态化自主工作的人形机器人公司;长城汽车工厂也已完成规模化部署。
技术层面,银河通用今年5月发布世界动作模型,将VLA的物理交互能力与世界模型的环境感知预测能力相结合。赵于莉判断,具身智能领域的Scaling Law已经得到验证,行业的ChatGPT时刻在未来两到三年内到来“非常有可能”。
北京商报记者 王天逸
本网站所有内容属北京商报社有限公司,未经许可不得转载。 商报总机:010-64101978 版权合作:010-64101871
商报地址:北京市朝阳区和平里西街21号 邮编:100013 法律顾问:北京市中同律师事务所(010-82011988)
![]()
网上有害信息举报 违法和不良信息举报电话:010-84276691 举报邮箱:bjsb@bbtnews.com.cn
ICP备案编号:京ICP备08003726号-1
京公网安备11010502045556号 互联网新闻信息服务许可证11120220001号