电脑桌面
添加运营动脉到电脑桌面
安装后可以在桌面快捷访问

信通院2026具身智能训练场报告:全国超70家加速布局(附报告下载)

作者:中国信通院 2026-08-29 60
广告

中国信息通信研究院人工智能研究所联合人形机器人(上海)有限公司、具身智能测试实验室于2026年8月发布《具身智能训练场研究报告(2026年)》,系统梳理我国具身智能数据发展背景、训练场建设现状与共性挑战。报告指出高质量真实数据缺失已成为制约具身智能发展的首要因素,截至2026年6月底全国建成启用超70家训练场,本文拆解其核心数据与产业路径判断。

一、数据瓶颈:真实数据缺口是具身智能发展的首要制约

1.1 规模定律驱动,数据规模直接决定模型能力

报告指出,具身智能模型性能提升持续受益于数据规模扩展:2026年4月Generalist AI推出的GEN-13模型,使用超50万小时真实数据预训练,在折叠T恤、折叠纸盒、打包手机等任务上平均成功率已达99%;英伟达EgoScale研究亦表明,数据规模与模型验证损失之间存在清晰的对数线性关系。行业越来越倾向于认为,足够多的数据是具身智能享受规模定律红利的前提。

1.2 从零生产:需要2.12万台机器人连续工作一年

与大语言模型依托千年文字沉淀不同,具身智能所需的多模态交互数据此前从未被系统性采集,只能从零逐条生产。据测算,假设实现机器人"ChatGPT"时刻的模型参数量级为55B,训练所需数据约1.1万亿token——若全部由真机回流提供,约需2.12万台机器人连续工作一年,产出千万小时级有效数据。而当前全球高质量真实数据仅数十万至百万小时级,远未达到支撑智能涌现的门槛。

解读:数据缺口不是"差一点",而是差两到三个数量级。谁能以最低成本、最大规模地生产高质量真实交互数据,谁就掌握了具身智能时代的"算力底座"——这是训练场成为国家级基础设施的根本原因。

具身智能规模定律与数据缺口测算

二、采集技术:五大路线协同,成本与价值分层清晰

2.1 无本体采集:低成本、高规模,但映射有难度

行业正在多条路线探索真实数据采集:一是人类第一视角视频采集(头戴相机,单套数万元,规模最大但需动作识别与本体映射后处理);二是末端操作数据采集(UMI夹爪、数据手套、腕部相机,结构轻量、部署灵活,单套数万元,已成行业最受关注方案之一);三是动作捕捉(光学方案成本数十万至百万,惯性方案数万至数十万)。

2.2 真机采集:高一致性、高价值,但成本高企

四是遥操作数据采集,与本体结构一致性最强,规模化运营后单小时有效数据成本约275元(含设备折旧、人工、场景成本),小规模采集时可达数千元;五是自主作业回流数据,自动采集成功样本、失败案例与人工接管记录,长尾价值最高但受部署规模限制,短期内适合作为小规模高价值数据用于模型评估与持续优化。

解读:五大采集路线的本质是"成本-规模-价值"三角的权衡——无本体路线解决规模、真机路线解决质量、回流路线解决长尾。成熟的训练场必须五线并进、按数据用途分层供给,单一路线难以满足模型训练全周期需求。

真实数据采集技术路线对比

三、建设现状:超70家训练场,长三角京津冀珠三角三足鼎立

3.1 全国布局:18省覆盖,向三线以下城市延伸

截至2026年6月底,全国建成启用超70家训练场,在建或规划46家,覆盖18个省(自治区、直辖市),形成长三角、京津冀、珠三角三大集群。长三角依托上海龙头带动(上海麒麟训练场、智元数据采集工厂、银河通用苏州中心等,总占地超7万平方米);京津冀依托北京科研资源(石景山三期训练场超1万平方米、数据年产量近千万级);珠三角依托制造业场景需求。训练场选址正从人才资本驱动转向真实场景、数据供给与运营效率为核心的资源配置模式,向三四五线城市延伸。

3.2 模式格局:政府引导+企业主导,综合场占60%以上

建设模式上呈现"政府引导+企业主导"双线推进:综合类训练场(覆盖3类以上行业)占比60%以上,其中"工业+家庭+商业零售"场景组合占综合类44%;行业垂类训练场不足20%。组织模式上,上海麒麟训练场"1+N"区域协同、广东"1+1+N"全省训练网络等模式正在成型。政策端,2024年至2026年6月已有18个省市发布超40份政策文件支持建设。

解读:70家训练场的数量已说明"建起来"不是问题,真正的命题是"用起来、转起来"。综合场占比超六成反映行业仍在通用化探索期,垂类训练场不足两成意味着贴近行业know-how的数据供给仍是稀缺能力——先扎根垂直场景的玩家将获得先发优势。

全国训练场分布与三大集群

四、共性挑战:同质化与商业模式待解,标准化需求迫切

4.1 四大挑战浮出水面

报告直言,训练场快速推进过程中存在四大问题:一是场景任务建设同质化,大量训练场堆砌相似场景,数据多样性不足;二是数据实际产能有限,规划产能与实际产出差距大;三是数据流通性不足,跨场域、跨主体的数据共享机制缺失;四是可持续商业模式尚未形成,多数训练场依赖政府投入,自我造血能力弱。

4.2 数据飞轮闭环是出路

对比国外实践,特斯拉依托自有工厂构建"数据飞轮"闭环(Optimus Gen3在德州工厂执行搬运、质检、分类任务回流数据);Figure AI与宝马合作部署Figure 03进入生产物流环节;国内银河通用进入宁德时代、博世、丰田产线,智元在南昌龙旗完成流水线全闭环操作——真机作业回流数据正在成为模型持续进化的核心燃料

解读:训练场的终局不是"数据加工厂"而是"数据飞轮"——只有与真实产业场景深度绑定、让机器人在实际作业中持续回流数据,才能同时解决同质化、产能与商业模式的三大难题。谁能拿到头部产业的真实场景,谁就拥有不可替代的数据资产。

训练场建设模式与组织协同

五、产业启示:三个确定性方向

对产业参与者,报告指向三个确定性机会:一是标准化与数据流通,训练场数据格式、评测基准、安全规范的标准化需求迫切,先参与标准制定的机构将获得生态位优势;二是垂类深耕,聚焦制造、医养、清洁、零售等单行业做深做透,用行业场景数据筑墙;三是数据服务化,把数据采集、标注、评测能力产品化,向中小机器人企业输出,形成"卖铲子"的商业模式。

对政策制定者,报告建议推动"1+N"区域协同、开放公共场景、建立数据交易与安全流通机制,避免重复建设、引导训练场从"规模竞赛"走向"质量竞赛"。

解读:具身智能训练场正处于"跑马圈地"向"精耕细作"的转折点。未来的赢家不是建场最多的城市,而是拥有最大规模高质量数据、最深入行业场景、最可持续商业模式的运营者。

数据飞轮与产业落地路径

六、常见问题解答(FAQ)

1. 为什么具身智能需要训练场?

具身智能所需的多模态交互数据无法从互联网获取、只能从零生产,全球高质量真实数据仅数十万至百万小时级,训练场是解决数据缺口的关键基础设施。

2. 全国已建成多少训练场?

截至2026年6月底建成启用超70家、在建或规划46家,覆盖18个省级行政区,集中在长三角、京津冀、珠三角三大集群。

3. 采集真实数据有哪些技术路线?

五大路线:人类第一视角视频、末端操作(UMI/数据手套)、动作捕捉、遥操作、自主作业回流;前两者低成本高规模,后两者高质量高价值。

4. 训练场面临的最大挑战是什么?

场景同质化、数据产能有限、流通性不足、可持续商业模式未形成;破局之道是与真实产业场景绑定构建数据飞轮闭环。

5. 训练场建设对产业有什么机会?

标准化与数据流通、行业垂类深耕、数据服务产品化(采集/标注/评测外包)是三大确定性方向,先发者将获得生态位优势。

想系统阅读信通院及各大机构的具身智能、人工智能与机器人产业报告,运营动脉(www.yydm.cn)提供精品报告库、课件库与模板库,7W+精选资料每月更新1000+份,是持续跟踪AI产业前沿资料的好去处。

【中国信通院】具身智能训练场研究报告(2026年).pdf
中国信息通信研究院人工智能研究所人形机器人(上海)有限公司具身智能测试实验室2026年8月具身智能训练场研究报告(2026 年) 版权声明本报告版权属于中国信息通信研究院、人形机器人(上海)有限公司和具身智能...
56 页 21 次下载 1.93 MB
广告

声明:除非特别标注,否则均为本站原创文章,转载时请以链接形式注明文章出处。如若本站内容侵犯了原著者的合法权益,可联系本站删除。

确认删除?
会员
教程
收藏
足迹
联系
  • 站长微信
回到顶部