且身智能科技前瞻探索(第期)2025/03/01/
《具身智能科技前瞻探索》第1期目录/CONTENTS51【具身大模型)HALO:面向具身多模态思维链推理的统一VLA模型02【轻量化部署OuantVLA:面向VLA模型的尺度校准后训练最化方法03【椎理性能分析】VLA-Perf:解密VIA模型推理性能的分析框车a1【虚实协同训练]RL-Co:基于强化学习的虚拟+真实数据协同训练框架05风险提示31
《具身智能科技前瞻探索》第1期01【具身大模型】HALO:面向具身多模态思维链推理的统一VLA模型
《具身智能科技前瞻探索》第1期1.1HALO:面向具身多模态思维链推理的统一VLA模型具身大模型CHALO:AUnfiedVision-Language-ctfon ModeforEmboded Multimodal Chain-of-Thought Reasoing)202672/2香港科技大学等研究团队提出HALO,一种统一的VLA模型,通过具身多模态思维链推理(包含文本推理、视觉子目标预测与动作预测),显着提升了机器人在复杂操作任务中的表现,在RoboTwin2.0模拟基准上平均成功率达到80.5%,超越基线模型n0达34.1个百分点。口主要贡献:口影响展望1:提出具身多模态思维链EM-CoT推理框架:在统一VLA模型中实现文本推理、视觉子目标预测、增强型动作预测的序列式推理,为解决现有模型设计思路,为空破传统感知,动作直接肿射局限提供*人认知设计会老、主宣7且自智能推理机制研空维度:提出的MoT架构、白动化数地模型多模态推理框架缺失问题提供新方向。2:设计混合Transformer(MoT)架构:解耦语义推理、视觉生成合成方案和两阶段训练范式,为解决领域内多模本融合、推理数据税制动作预测模块并通过共享白注意力实现协作,缓解多模本融合显的冲空。模型能力失衡等痛点提供可借鉴思路,积累了实验经验。3:构建自动化EM-CoT数据合成流水线:通过动作基元提取、VLM机注、视觉子目标筛选等步骤,将原始机器人轨迹转化为带文本推理、子任2:对具身智能产业界发展的参考意义:模型在复杂操作、部分分布外场务、视觉子目标的结构化训练数据景的性能表现,为人形机器人应对实际复杂任务提供阶段性技术探索方向;4:提出两阶段训练方案:先通过通用VOA、视觉牛成、动作预测多源数据预训练,再结合EM-COT数据与通田VOA数掘微调。智能模型提供甚础设计参者:基干开源组件的技术路线兼容性强、落地门4:性能:在RoboTwin2.0取得SOTA性能,相比m0平均成功率提升槛低。利干产业技术积累:模型显式的推理预测流程计机器人决策可追溯34.1%,强环境随机化、视觉干扰、新物体等分布外场景中具有强鲁棒性。为产业端提升人机协同产品的操作安全性与可解释性提供初步设计思路。
《具身智能科技前瞻探索》第1期1.2面向具身多模态思维链推理的统一VLA模型HALO:口图1:HALO方法整体框架原文摘要:视觉-语言-动作(VLA)模型在机器人操作任务中已展现出优异性aTextualReasoning&PlanningG)SubgoallmageActionChunk能,但由于缺乏显式的多模态推理机制以及对动作作用下环境演化Actio的预测能力,这类模型在长时程任务或分布外场号中往往表现不佳近期相关工作在VLA模型中引入文本思维链或视觉子日标预测以立现推理。但仍未能构建出统一的、类人化的推理框架,来联合完成NextTokenPredictionVisual Velocity PredictionActionVelocilyPrediction文本推理、视觉前验与动作预测、为此,本文提HHalo模型~种统一的视觉-语言-动作模型,它通过文本任务推理田干细始SharedSelf-Attention度指导的视觉子目标预测,以及融入且身多模太思维链FMCoTQKV增强的动作预测这一序列流程。实现具身多模态思维链推理,本女ActionPredictionExpert采用混合Transformer(MOT)架构实现Halo模型,将语义推理,NoisyActionChunk视觉前瞻与动作预测解就为不同的专用专家楷地,后时古插造协面的无缝协作。为实现Halo模型的规模化学习,本女提出一套白动化流程用干合成具身多模态思维链训练数据,并设计了精细的训练方案。大量实验表明:Halo模型在仿真与真实环境中均取得优异性能,在RoboTwin基准上相较干基线部路m0增升3410%.洲车六军与且身多模态思维链(FM-CoT》中的所右设计模块均能右效提lALO first performs textual reasoning andndesanding oxpr, a tional gonceation cxport, and...