您的位置: 首页 > 推荐

打工人陪练机器人

出处:北京商报 作者:王天逸 网编:王巍 2026-09-24

具身智能产业数据供给紧缺,数据商的“触手”开始伸向千行百业,伸向每一位普通打工人。

继海外Figure公司8月发布Index平台、通过向全球用户采集真实任务视频以构建训练数据集之后,9月23日下午,觅蜂科技“觅蜂派”具身数据众包采集平台在上海正式对外发布。觅蜂科技团队告诉北京商报记者,Index主要服务Figure自身的模型训练,觅蜂派则面向不同模型厂商和机器人企业,根据客户需求组织数据生产,覆盖更广的行业场景。

公司董事长兼CEO姚卯青的另一个身份,是智元机器人的联合创始人。从具身智能头部公司跨界,创办为具身智能等产业提供“原料”的物理AI数据服务平台,姚卯青告诉北京商报记者,团队希望把普通人日常工作中的操作动作采集下来,转化成机器人训练所需的数据,也就是机器人的“教材”。

随平台发布,“机器人训练师”这一职业概念同步推出。对参与者而言,这是本职工作之外的一份额外收入;对机器人产业而言,则是规模化填补数据缺口的一个解法。

图片来源:觅蜂科技

从实验室到工作间

过去三年,具身智能行业从开发态逐步迈入部署态,机器人开始从实验室走向真实场景,但行业始终绕不开数据瓶颈。

行业此前通行的做法是真机遥操——人通过手柄或VR(虚拟现实)设备操纵机器人,把任务“示范”给模型。这类数据与机器人本体对齐度高,但采集速度受限于机器人数量、操作人员和场地,硬件、人力与运营成本也随规模同步增长。

近段时间,一种分工模式被各具身智能本体及模型厂商频繁提及:无本体采集拓展规模与场景,真机遥操提供贴近本体的数据,真实部署帮助模型持续修正。

所谓“无本体”,即采集不依赖特定机器人,而是先记录人的真实操作,再经过轨迹重建和动作转换,适配不同模型和机器人。觅蜂派正是为满足这类需求而生。

平台由自研MEgo数采设备、觅蜂派App和数据治理引擎MEgo Engine三部分组成。用户通过App领取采集任务,佩戴数采设备在零售、仓储、制造、家庭等场景中完成指定操作,按审核后的有效时长获得报酬。

采集完成后,MEgo Engine负责数据处理、标注、质量评估和交付,把真实操作拆解为抓、拿、放、拧、按等120多种标准原子动作,再经过位姿重建与动作映射,转化为模型可训练的数据。

据觅蜂科技披露,觅蜂派目前已经覆盖22大类场景、5000多个任务和5万多个真实环境,涵盖物流、仓储、住宿、餐饮、零售、养老、医疗、农业、非遗等方向。8月31日,第2万套MEgo采集设备下线;公司累计生产超过100万小时真实世界无本体数据。

为何需要众包“机器人训练师”

在正式发布前,觅蜂派经历了为期一个月的内测。据披露,内测期间注册用户数达2万人,累计收到1.3万份采集任务提交。

经北京商报记者现场实测,觅蜂派App上的设备租金定价为39元/天,发布会推广期内折扣价为19元/天。觅蜂派业务副总裁张智富向记者表示,收取设备使用费并非为了盈利,而是设置一道门槛——如果设备免费发放,用户可能不会认真使用。后续平台或将根据采集者的有效时长和数据质量给予动态补贴,逐步降低活跃采集者的设备成本。

相比于业务推广环节的变量,团队更为看重众包平台在数据量层面带来的增量。

姚卯青向北京商报记者表示,百万小时级的数据存量对当下的市场需求已经不够用,不少模型公司的数据需求量已达数百万小时量级。当前阶段的瓶颈不只是数量,还包括场景丰富度——家庭场景中叠衣服这类数据已经趋于饱和,而修水管、修车、理发、美甲等专业技能场景,靠集中式团队去拓展效率偏低,众包模式则更为灵活。他同时表示,目前整套采集硬件和数据处理流程已实现标准化,基础质量有保障,众包主要解决的是“场景进得去”的问题。

此外,众包模式带来的商业化闭环也较为快速。姚卯青称,众包模式本身降低了采集端的人力成本——采集者是在日常工作中顺便完成数据记录,而非专职雇佣;后处理环节通过自研模型和自建数据中心持续优化,数据量越大,自动化程度越高,人工标注占比越低。他表示,目前数据产品对外销售已有不错的毛利率。

不过,众包模式下如何管理大量分散的C端采集者,仍是一个开放问题。张智富坦言,众包C端用户的管理本身难度很大;相比之下,外卖行业经过近十年迭代才建立起可靠的配套体系,觅蜂派的全链路体系仍在持续完善中。

数据质量仍是待解考题

众包模式能快速扩大数据产能,但质量控制的挑战仍无法回避。

对于业界关心的数据质量问题,姚卯青进一步解释称,采集任务上传后,平台会在一天内通过自动化方法完成初筛和结算,剔除明显无效的数据;结算环节通过后,还会经过轨迹提取、人工抽检等后续处理。他表示,通过结算环节的数据,最终可用率超过95%。同时,平台不会把数据简单分为“好”与“坏”、“0”或“1”,而是按质量分级,匹配不同模型训练阶段的需求。

行业此前普遍存在一个争议:部分第一视角采集要求参与者放慢动作、保持手部持续可见、按固定流程执行,因为这类数据更容易被现有算法解析。但当人开始“迁就算法”,真实世界中的快速运动、遮挡、自然纠错和非标准操作会随之减少,模型看到的行为分布可能被人为收窄,导致数据不够“真实”,也不够“现实”。对机器人而言,数据容易处理,并不意味着训练价值更高。

觅蜂科技对数据质量的应对包括两层。一是硬件层面,MEgo设备以多视角、多模态采集,尽可能减少视觉、触觉和姿态之间的偏差;二是软件层面,MEgo Engine完成位姿重建与动作映射,配合ManiEval多维度质检体系,从数据格式、任务完整性、传感器质量、语义准确性和动作可学习性等方面进行评估。

据披露,觅蜂科技的百万小时级无本体数据已开始服务腾讯Robotics X实验室、蚂蚁灵波等客户。中国信息通信研究院人工智能研究所具身智能与机器人部副主任张蔚敏在发布会上表示,众包数据平台的价值不只是汇集大量记录,更在于通过任务组织、数据工程、质量控制和闭环运营,将分散的数据转化为可训练、可评测的数据资产。

至于众包模式能否持续稳定地交付高质量数据,“机器人训练师”能否从发布会上的证书变成一份真正可持续的工作,还需要更长时间的检验。

北京商报记者 王天逸

图片来源:觅蜂科技

本网站所有内容属北京商报社有限公司,未经许可不得转载。 商报总机:010-64101978 版权合作:010-64101871

商报地址:北京市朝阳区和平里西街21号 邮编:100013 法律顾问:北京市中同律师事务所(010-82011988)

网上有害信息举报  违法和不良信息举报电话:010-84276691 举报邮箱:bjsb@bbtnews.com.cn

ICP备案编号:京ICP备08003726号-1  京公网安备11010502045556号  互联网新闻信息服务许可证11120220001号