机器人进居民楼采数据 具身智能面临数据饥渴困局
大湾区经济网9月5日讯 “得大脑者得大脑,得数据者得大脑”——智能机器人行业正在经历一场严峻的“数据饥渴”。据财闻报道,北京某头部具身智能企业为获得家庭场景数据,在和居民协商一致后,带着录像设备进入北京居民家中采集数据。“刚开始居民觉得新鲜,很配合,但数据采集效率极低,需要不断重复,后边居民开始'烦了'。”该人士透露,“我们带着团队去北京老旧小区敲门,采到老太太都要报警了。”

图片为AI生成。
数据采集的难度远超想象。机器人需要多模态数据——摄像头拍的画面、关节转动角度、手指施加的力,必须同步记录,任何一秒的偏差,整段数据作废。采集只是起点,十万小时的原始视频经过清洗、标注、重建,真正能用来训练的可能只剩几千小时。“采集12个小时,清洗出来能用的,超过1.5个小时就谢天谢地了,这已经是行业最高水平。”而训练一个好的机器人大脑,至少需要百万小时级的真实交互数据,目前行业能用的只有十万小时级,数据缺口超过500万个小时。
缺口之下,行业开始出现数据交易。有人戴着头戴设备在真实环境里采集“异构数据”,以7元一小时的价格卖给机器人公司。但不同品牌的硬件构型不同,采集的数据格式也不统一,“数据孤岛”现象严重。稍早前,宇树科技创始人王兴兴判断,泛化能力不够是当前机器人大脑能力的最大瓶颈。银河通用创始人王鹤也认为,当前具身基础模型能力大约相当于GPT-2阶段,2028年前后才可能迎来关键突破。
国内头部公司正各自搭建“数据工厂”。智元机器人在上海自建数据采集工厂,部署约200台机器人同时作业,2024年底开源了全球首个基于真实场景的百万真机数据集。宇树科技走开源路线,将人形机器人全身遥操作数据集放上Hugging Face,包含340小时、189万条动作轨迹。星海图坚持真实数据路线,发布了VLA基础模型G0.5。银河通用则走“仿真合成数据预训练+真实数据对齐”的路子。整个行业正处在“先建基础设施”的阶段,算力、人工、本体三样都在烧钱。
免责声明:
1、凡本网注明 '来源:大湾区经济网' 所有内容与数据,均属于大湾区经济网综合公开信息整理的数据(内容不构成投资建议,使用前请核实);欢迎转载、摘编使用上述作品,转载时应注明出处。
2、文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。
3、本网所有的图片为政企或百度图库公开检索及配图,版权归原权利人和单位;如政企单位投稿所配的图片均默认授权给大湾区经济网,并有权使用和存用资料库中。
4、凡本网注明 '来源:XXX(非大湾区经济网)' 的,均转载自其它媒体或平台,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。
5、如涉及版权问题,请作者持权属证明联系侵删。
※ 欢迎上市公司、政府、商协会合作投稿,邮箱:dwqce@qq.com


