CCTLCCTD赛迪智库前瞻CCTD赛迪智库2026年3月10日第11期总第939期我国具身智能数据集工程化落地亟待D赛破解四大瓶颈具身智能包括本体、数据集、模型、场景四大组成要素,其中,数据集关系到具身智能的智能涌现和能力泛化当前,本数据集领域,国家级数据训练场、行业级开源社区与企业级数据开发平台协同发力,形成了“真机遥操+灵巧手采集+仿直数据"三层数据供给体系,支撑视觉-语言-动作(VIA)模型与世思模刑讲式发展,具身智能数据集供给仍呈现点状分散格局,受限于标注工具不足、采集成本高晶、多模态技术滞后与标准体系缺失-1.智库
智库套工具链,地瓜机器人等也积极打造开发者社区北京国家地方共建具身智能机器人创新中心上线了开源社区,提供具身天工机器人本体、彗熙开物SDK。RoboMIND数据及训练工具链等资源三是机器人本体企业和技术服务平合企业推动企业级数拒研发和服务。机器人本体企业基于自有硬件进行真机数据的采集积累,如智元机器人AgiBot World真机数据集、宇树科技G1机器人操作数据集、帕西尼OmniSharing DB全模态具身智能数据集、技术服务平合企业则提供数据采集平台、仿真工具、数据标注服务等数据服务,助力企业数据集开发,如群核科技提供虚拟数字道场平台SpatialVerse,通过生成可交互的三维合成数据,支持机器人进行避障、抓取及紧急制动等任务的仿真训练:智源研究院则打造高保真仿真框架AgiBotDigitalWorld,为机器人设计提供仿直数据牛成解决万案从技术路径看,形成了数据供给“直机遥换+灵巧手采集4位真数据”三层体系,规模化采集能力初步建成。一是真机遥操智元机器人、傅利叶智能等企业,通过复盖单壁、多臂、人形四只笔名形太机票人,可在家层、餐饮、工业、办公等200多个真实场景中执行复杂操作,积累大量真实交互数据,二是灵巧手采集,通过触觉传感器精准记录人手精细动作,为精密装配、丞.3-山智库
CCIL电智库性物体操控等任务提供关键数据。灵巧智能DexCanvas数据集汇聚了22类人手操作模式、超1000小时真人多模态演示数据驱动五指灵巧操作模型,三是仿真数据、银河通用、光轮智能深信科创、云道智造等企业,借助物理引擎和图形学构建虑拟环境,可低成本生成大规模数据从建设成效看,具身智能数据集支撑VLA与世界模型发展涌现一批典型模型,一是在VLA模型方向,大规模、多模态数据集为其提供了训练基础,使机器人能够融合视觉感知、语言理解与动作控制,高效执行复杂任务,比如银河通用机器人依托具身大模型GraspVLA,通过十亿帧数据训练,掌握机器人泛化闭环抓取能力。星动纪元发布VLA模型ERA-42驱动的双足机器人,学习人类操作视频和真机数据,可实现4m/s疾速奔跑、3609旋转跳及工业级精细作业。二是在世界模型方向,机器人通过海量视频数据,学习环境中物体与事件的演变规律,提升其对未来状态的预测与因果推理能力如智元机器人的GenieEnvisioner世界模型平台,,基于3000小时的真机操控视频数据,赋能机器人实现“制作三明治”"倒茶""擦拭桌面”等任务。宇树科技基干5个涵盖机械劈和人形机器人的任务数据集,搭建UnifoL.M-WMA-0世界模型架构。三是技术架构正从分层架构向迪智库
智库端到端演讲,VLA与世界模型或将融合,当前具身智能仍以分层架构为主,随着仿真与真实数据的进一步融合,“世界模型为大脑、VI.A为手眼”的融合架构将成为新趋垫一、且自智能数据焦工程化落地存在四大瓶颈当前,我国具身智能数据集建设已形成多主体协同、多层次供给的格局,但仍呈点状分散状态。要实现具身智能领域的技术迭代与规模化商业落地,必须加快推进数据集工程化落地—即构建复盖数据采集、标注、应用、评估全流程的标准化和产品化实现数据集的高效生产与可靠复用,为具身智能模型训练与场景沽配提供系统化支撑目前该进程仍面监四大瓶劲制约(一)数据标注工具制约高质量数据集构建一是具身智能标注工具仍显匮乏。VLA模型要求对视觉场景、语言指令及动作轨迹进行时空关联标注,世界模型更需要标注视频序列中的物理属性、物体状态变化及潜在的因果联系。然而,现有工具多侧重干静态图像或简单视频标注,难以高效支持VIA模型和世界模型对长序列、3D空间和物理动态标注的需求数据标注...