- 时间:2026-10-10
- 来源:中国证券报
具身智能的数据缺口正在加速补齐,以推动行业迈向落地应用。一位从业者向中国证券报记者表示,机器人企业、大模型企业等不少客户的数据需求已经从百万小时迈向千万小时。
走访调研中,记者发现,作为支撑具身智能“脑力”(即作业能力)的关键环节,具身数据采集产业正在发生模式变革:众包采集模式涌现,集中式数据采集厂规模化落地。与此同时,数据采集的作业规范、数据质量评测标准有待建立,企业积极探索数据合规治理机制,挖掘具身智能数据的商业价值。
● 本报记者 郑萃颖
众包采集涌现
北京嘉合盛鑫企业服务有限公司的办公室内堆放着70多台具身智能数据采集设备,等待人们申领。10月8日当天,有十几台数据采集设备被登记领取,申领人将在日常生活中佩戴着设备完成整理桌面、炒菜、折叠衣物等日常劳作。设备采集的视频数据将记录人手行动轨迹、空间位置,成为具身智能模型训练的“养料”,帮助机器人开发“脑力”,适应更多任务。
嘉合盛鑫是具身智能数据服务公司上海觅蜂具身智能科技有限公司(简称“觅蜂科技”)的合作方。嘉合盛鑫合伙人侯晓敏告诉记者,每位设备申领人通过完成数据采集任务,每小时采集可获得10元至30元收入。同时,公司在自己运营的青年公寓、超市内,安排5名员工负责日常采集,每月基于数据质量和小时数获得补贴。
作为具身智能公司智元创新(上海)科技股份有限公司控股子公司,觅蜂科技今年9月23日正式开启具身智能数据采集的众包模式,允许普通人申领采集设备、完成数据采集任务并获得收入。截至目前,觅蜂科技在北京、广州、深圳、上海等40个城市落地众包业务。
众包模式的推广是为了扩大具身智能数据采集规模。觅蜂科技董事长兼CEO姚卯青表示,行业实现的百万小时级具身智能数据,已经无法满足目前的市场需求。“不少客户的数据需求已经达到千万小时级别。”他说,“我们希望通过众包的方式,更加灵活、便利地进入千行百业场景。”
多位从业者对记者表示,具身智能数据的需求方主要来自具身智能企业、世界模型公司、大模型厂商、科研院校。中国信息通信研究院报告显示,按大语言模型的缩放定律,机器人实现“ChatGPT”时刻,训练所需数据量约1.1万亿词元(Token)。京东相关技术负责人援引行业调研称,要使机器人的单个技能点达到可交付水平,可能需要2000至5000小时训练数据,现有数据供给仍存在数量级差距。
为此,京东计划发动内部超过10万名不同职业的员工,以及外部最多50万名各行业人员参与数据采集。其中,宿迁机器人数据采集中心计划发动超过10万名市民。公司制定目标,将于一年内积累500万小时人类真实场景视频数据,两年内突破1000万小时。采集人员通常按照合格数据或有效作业时长获得收益。
值得注意的是,众包采集往往采用头戴式设备,或者加配末端执行器,进行人类第一视角视频数据采集(Ego数据采集)或末端操作数据采集(UMI数据采集)。由于无需采买动辄十几万元、几十万元的机器人本体,采集成本大幅降低。今年以来,参与众包采集的供应商数量快速增长。数据显示,截至10月9日,国内具身智能数据采集相关企业共20家,主要分布在华东、华北、华南。
开展众包采集业务的灯塔数启(廊坊)网络科技有限公司创始人韩阳告诉记者,目前国内能获得一手数据采集订单的公司约几十家,而遍布各城市的数据采集下游分包商数量众多,已达数百家。数据采集设备开发商正在推动设备减重、配置更高性能的配件、增加续航,为众包模式的数据采集提供便利。
集中式采集已成规模
不同于分散在各地的众包采集,具身智能数据集中式采集产业已具备一定规模。据了解,目前全国已建成启用70多家具身智能训练场,在建、规划40余家。大量实训数据加速归集。
在位于北京亦庄的北京人形机器人创新中心具身智能机器人数据与训练基地,150台不同构型的机器人设备、100余台无本体采集设备,在30余个场景中进行数据采集作业。在其中一个遥操作的采集场景,工作人员在屏幕上点下“开始采集”,操作机械臂和夹爪灵活伸缩,将桌面散乱的书本、水果模具放置整齐,再按下“停止采集”,一条数据上传至后台,屏幕显示:今日有效产能130条,验证通过率100%。
基地负责人夏华林对记者表示,基地打通了数据采集、清洗、质检、标注、模型训练、真机评测、模型部署、数据回流完整链路,年产能可达18万小时,目前已对外交付近3万小时高质量数据,70%以上产能服务行业客户。
睿尔曼智能科技(北京)股份有限公司将具身智能训练场升级为具身智能数据实验平台。在常州,睿尔曼智能的工作人员化身后台指挥官,远程操控150台部署在各类真实场景中的RealBOT机器人完成工厂、仓库、客房等作业任务,在“真干活”中采集数据。“我们让机器人一边工作一边进行数据回收,后台工作人员对数据进行标注、清洗,完成模型的预训练和后训练。”睿尔曼智能产品研发中心负责人周韦对记者表示,每个场景中,经过半个月时间、几万条数据的训练,机器人有望自己完成单项任务。
在北京他山科技股份有限公司运营的数训创新中心,装配有触觉传感器的机械夹爪和灵巧手,反复进行着抓取餐具、拧开瓶盖、取放电子模块等精细操作。“触觉对于机器人实现精细操作至关重要,让机器人感受力的大小,直接影响任务的成功率。触觉、视觉信息互补,能支撑机器人完成更复杂的任务。”该数训创新中心负责人介绍。目前,该中心每日产出数千条有效数据,提供机器人设计、数据采集、模型训练的一体化服务。
上述负责人表示,中心锚定市场真实需求,按需搭建各类下游客户的作业场景:例如面向钢铁厂、电子厂的物料分拣需求,中心会复刻对应工况开展模型训练;训练完成后的模型部署至机器人,便可直接落地到真实产线投入作业。
建立数据采集行业标准
随着具身智能数据采集的“队伍”不断壮大,行业面临规范与标准不足的挑战。
韩阳向记者表示,当前数据采集领域缺乏统一规范,众包采集链条长、环节多,参与者广泛,其中存在大量无效数据,考验数据服务商的运营能力。此外,还存在数据重复度高问题。韩阳表示:“普通场景的数据已经接近饱和,但工厂、高危作业等垂类场景数据依旧稀缺。这类场景的数据采集,需要政府牵头、联合属地企业,交由第三方数据中心落地。”
数据采集规范与数据质量标准的不统一,也造成数据定价缺少参考基准。
帕西尼人工智能科技(北京)股份有限公司相关负责人称,现阶段数据定价多采用成本导向模式,采集成本低则售价低。但评判数据价值,核心要看场景真实性、多样性、模态丰富度、纯净度、可复用性与易用性。数据采集标准化建设,有赖产业上下游协同推进。
京东相关技术负责人认为,具身智能数据的商业价值,在于帮助机器人企业与大模型企业缩短研发周期、减少真机采集成本,提升模型在真实环境下的任务成功率与泛化能力。行业重心也将从单纯追求数据总量,转向关注数据对模型性能带来的实际增益,因此亟需搭建评测标准来量化数据价值。
姚卯青提出,行业亟需建立一套完整的数据标准体系:一是数据质量标准,明确“优质数据”的定义;二是采集验收规范,对任务拆解、采集、验收全流程建立统一准则,避免同等时长的数据质量差异巨大;三是定价与流通标准,形成数据估值、交易、权属界定的行业共识,盘活数据要素。
除此之外,安全合规标准同样不可或缺。姚卯青表示,从知情同意、端侧脱敏到分级存储的全链路规范,是行业获得公众认可的生命线。据他介绍,觅蜂科技在各环节均设置了合规关口:采集端,完成场景授权与相关人员知情同意;设备端本地加密,原始数据不出端即完成脱敏预处理;传输端,通过加密通道上传数据;云端进行二次脱敏与清洗,建立分级存储与访问权限;交付前进行合规审查,明确数据使用范围与授权边界。
帕西尼相关负责人也认为,应建立具身智能数据全生命周期治理规范。在数据采集与加工环节即建立分类分级管理机制,确保最终产出的高价值数据完成去个人化与敏感信息脱敏。打通“采集—加工—认证”的链路治理通道,结合自动化质检与规则评估,确保每一条数据可追溯、可审计,形成标准化的合规数据资产。



