北京商报讯(记者 魏蔚)7月8日,北京商报记者获悉,智源研究院近日公开具身大脑悟界·RoboBrain Orca的技术报告。根据报告,大语言模型学会了预测“下一个词”,于是有了会写代码、会做题、会对话的ChatGPT、DeepSeek、Qwen。视频生成模型学会了预测“下一帧”,于是有了越来越逼真的图像和视频生成模型,例如Seedance、Sora。具身模型学会了预测“下一个动作”,于是机器人开始能完成越来越复杂的任务。而悟界·RoboBrain Orca的目标是做一件更底层的事:让AI在“脑海中”形成一个表征,该表征是对当前世界状态的高度“浓缩”,基于该表征,AI能够建模向前和向后世界状态的演变。这就是悟界·RoboBrain Orca作为“多模态表征世界模型”的核心哲学:The World is in Your Mind(世界尽在脑海)。
悟界·RoboBrain Orca在看到一段视频、一张图、一个指令、一段事件描述后,先在内部形成一个统一的世界潜在表征空间。这个世界潜在表征空间就像AI的“脑海中的世界”,它把视觉、语言、事件、任务意图等多模态的信号组织起来,学习物体如何运动、场景如何变化、动作会带来什么后果、事件之间有什么因果关系;当前状态如何走向未来状态;甚至在某些条件下,世界会不会朝另一个方向演化。悟界·RoboBrain Orca的核心变化:从Next Token/Next Frame/Next Action,走向Next State Prediction(从预测下一个词/下一帧/下一个动作,走向预测下一状态)。
悟界·RoboBrain Orca随着训练数据的增加,下游任务能力可随之提升,且具备持续Scaling的潜力。悟界·RoboBrain Orca学到的表征可通过多种解码器读出。在文本读出上,悟界·RoboBrain Orca更擅长状态转移的理解和动态运动的推理;在图像读出上,悟界·RoboBrain Orca更能展现真实场景的交互预测能力;在动作读出上,悟界·RoboBrain Orca没有在预训练中学习动作标签,也能帮助下游机器人更好地泛化。
本网站所有内容属北京商报社有限公司,未经许可不得转载。 商报总机:010-64101978 版权合作:010-64101871
商报地址:北京市朝阳区和平里西街21号 邮编:100013 法律顾问:北京市中同律师事务所(010-82011988)
![]()
网上有害信息举报 违法和不良信息举报电话:010-84276691 举报邮箱:bjsb@bbtnews.com.cn
ICP备案编号:京ICP备08003726号-1
京公网安备11010502045556号 互联网新闻信息服务许可证11120220001号