电脑桌面
添加运营动脉到电脑桌面
安装后可以在桌面快捷访问

英伟达说自动驾驶的ChatGPT时刻来了,这话到底靠不靠谱

作者:无敌大菠萝 2026-10-10 17:34 2
广告

这份材料来自英伟达自动驾驶研究高级总监 Marco Pavone 的一场演讲,标题就叫《自动驾驶的 ChatGPT 时刻》,时间是 2026 年 6 月 4 日,场合是 CVPR 2026 的 Alpamayo Summit。

他开场先给自动驾驶定了个位:到今天为止,自动驾驶仍是 Physical AI(物理世界的 AI)最好的例子之一,而过去这些年的进步,用他的原话说是"mind-blowing"——令人瞠目。

画面里放着两张对比照片,左边是 2005 年,右边是 2026 年,中间隔了整整二十年。真正让这场演讲值钱的,是后面那一串拆开讲的架构、数据和评测。

"ChatGPT 时刻"这四个字很抓人,但英伟达要证明的其实是另一件事:自动驾驶已经走完了从"能开"到"会想"的那一步。

下面按演讲的顺序,把全栈方案、基础模型、VA 到 VLA 的演进、推理模型和开放生态依次拆开讲。

英伟达《自动驾驶的 ChatGPT 时刻》演讲封面,主讲人为自动驾驶研究高级总监 Marco Pavone

图源:《英伟达》(第1页) · 查看完整报告

一、先把话放这儿:自动驾驶是 Physical AI 最好的样本

演讲的前三页都在讲同一件事,就是自动驾驶在 Physical AI 里的位置。Pavone 的判断是,自动驾驶不只是一个应用场景,它是 Physical AI 到今天为止最完整、最有说服力的一个范例。

理由也不复杂:它同时要求感知、预测、决策和执行,而且每一步都在真实世界里被验证,出错就有代价。为了说明这个变化有多大,他放了一组跨度二十年的对比图——2005 年和 2026 年各一边。

演讲没有给出更多细节,但把这两页放在开篇的位置,态度已经很清楚了。

二十年里,自动驾驶解决的问题已经从"能不能动"变成了"能不能像人一样判断"。

二、L4 全栈:一颗芯片架构,十年往里砸了数十亿美元

从第四页开始进入具体方案,讲的是 NVIDIA 自动驾驶解决方案的几根支柱。演讲里的定位很明确:这是一个面向 L4 自动驾驶的全栈项目,十年间投入了数十亿美元。

构成上,芯片这一层列了 Orin 和 Thor 两代产品;软件这一层是 Drive SDK,包含操作系统、工具链和 DriveWorks。再往上是 DRIVE AV Stack 与车队能力,最后压着三条横向要求:可扩展的统一芯片架构、功能安全,以及从云端到边缘的 AI/深度学习基础设施。

另外还单独标出四块能力——仿真、AI 工程、自动驾驶研究,以及 AI 与深度学习的基础设施。把这些拼在一起看,英伟达想做的显然不只是卖一颗芯片——从芯片、SDK 到车队,它把整条链路都握在自己手里,这才是"全栈"两个字的份量。

换个角度看同一件事,《亿欧AI芯片报告:2029年冲击1.34万亿》算的是另一笔账。

《具身推理的浮现》:演讲从本页开始转入 Alpamayo 具身推理部分

图表来源:《英伟达》(第7页) · 下载报告全文

三、Cosmos 世界基础模型:让 AI 先在"想象"里把车开一遍

接下来是整场演讲里最技术的一段,讲的是 Physical AI 的基础模型。演讲先给"基础模型"下了定义:在广泛数据上训练、用互联网规模的自我监督、并且能适配到下游各种任务的那种模型。

英伟达的答案叫 Cosmos,一套世界基础模型(WFMs),拆成四种能力,对应四个英文动词。

第一个是 Embed,一个专为物理 AI 定制的视频-文本联合嵌入器。演讲里举的例子是一句"一辆车正在超越卡车",输出一串向量数值,用来做文到视频检索、反向视频搜索、语义去重和数据筛选。

第二个是 Predict,从多模态输入生成未来的世界状态。第三个是 Transfer,结合 NVIDIA Omniverse,生成符合物理规律的照片级真实输出。第四个是 Reason,用思维链推理回答"下一步该干什么",既可以开箱即用,也能用来做具身智能模型的后训练。

这四块能力往下走,就串起了一条完整的开发链路。

仿真数据不再是"凑数量",而是被拆成了可检索、可生成、可推理的四道工序。

四、从数据生成到运行时监控,基础模型串起整条开发链路

第六页把上面这些能力按开发流程重新排了一遍,这一页信息密度最高。先是一个总判断:靠常识推理,可以把长尾场景的泛化能力拉起来。

然后分成左右两栏。左边是云端:数据生成、数据筛选、传感器与交通仿真、速率估计与安全验证,跑的是又大又聪明的模型。

右边是车端:端到端栈、交互式车辆界面、从视觉到动作的可解释性,还有运行时监控,跑的是又小又高效的模型。同一套基础模型,在云上做训练和验证,在车上做推理和兜底。

这种"云上大模型、车端小模型"的分工,正在成为自动驾驶行业的默认架构。

五、Alpamayo VA 模型:动作被拆成 token,跟图像一起预测

第七页是一句过渡语——"具身推理的浮现",之后正式进入 Alpamayo 的部分。第八页讲的是 Alpamayo Vision-Action 模型,它是 Alpamayo 产品线的底子,服务于英伟达内部的端到端项目 NDA。

这套架构分四层。视觉层是时空上下文编码器,用 ViT 做高效的多摄像头、多帧 token 化,把 token 序列长度压下去。语言层是 LLM 骨干,用的是 Llama2,而且在设计时就挑了适合嵌入式部署的尺寸。

动作层是一个自回归的轨迹解码器,把动作也当成 token 来预测。训练方式是关键:整条流水线用"下一 token 预测"跑完整的多模态序列——图像和动作放在一起学。另外还带一个只在训练阶段使用的视频解码器,配合重建、克隆和行为三类损失函数。

把方向盘动作当成一门"语言"来预测,这是这套模型和传统规划器最根本的分歧点。

Alpamayo VA 实车演示:无保护左转、礼让行人、绕过垃圾桶等复杂场景

图片来源:《英伟达》(第9页) · 查看完整报告

六、路上的样子:无保护左转、礼让行人、绕过垃圾桶

第九页换成了实拍画面,全是两倍速播放的行车视频,标题是"Alpamayo VA 在路上"。场景列得很杂,也正因为杂才说明问题:无保护左转、有行人穿过;为了避开路上的小推车而微调方向,再因为减速带放慢速度。

还有在拥堵路段赶最后期限变道,为了有人开门而减速;为垃圾桶微调方向;在支路汇入主路时蠕行并让行。

再往下看:为一辆停着的车微调方向,为避让来向公交车而减速等待;为一辆停靠的卡车让行、从被遮挡的左转路口和停车标志前通过。

最后两条的场景更极端——为 VRU(弱势道路使用者)微调方向,在停车标志前停车再起步。

这些不是实验室里的标准场景,而是真实道路上最难讲清楚"为什么这么开"的那些瞬间。

七、从 VA 到 VLA:加上语言预训练,模型收敛更快也开得更稳

第十页讲的是从 Alpamayo VA 到 Alpamayo VLA 的升级,核心是"互联网规模预训练到底值不值"。结构上的改动有三处:语言层从 Llama2 换成互联网预训练过的 LLM 骨干,再蒸馏到适合嵌入式部署的尺寸。

动作层换成多模态轨迹解码器,训练时引入自动标注的元动作,用来提升轨迹的多模态性和可解释性。视觉层保留高效的多传感器 token 化,同时原生支持更高分辨率和更多传感器数量;另外加了文本编码器,可以直接吃导航指令。

第十一页是结果页,也是整场演讲最硬的一组数据。结论一句话:语言预训练和驾驶任务是相互促进的。相比从零训练,用语言预训练的版本收敛更快,稳态也更好。

评测覆盖美国和欧洲的 25600 个场景,闭环评测也印证了同样的结果,曲线上的两个版本差距一直保持到八万步。演讲还补了一句:这不是第一次看到这种结果,团队在 COLM 2024 的语言智能体工作里就见过——语言预训练的价值已经被反复验证。

"会说话"的模型开车开得更好,这件事正在从直觉变成可复现的实验结论。

Alpamayo VLA 收敛更快、驾驶更好:语言预训练与驾驶任务相互促进

图源:《英伟达》(第11页) · 阅读原文与全部图表

八、Alpamayo-R1:先想清楚因果,再决定怎么打方向

演讲的后半段转到了推理,第十二页给出了 Alpamayo Reasoning VLA 的整体架构。它把动作换成"推理引导的轨迹扩散",用轻量的条件流匹配做轨迹解码,同时上强化学习后训练,让推理和动作对得更齐。

骨干换成了 Cosmos-Reason,一个互联网规模预训练过的推理骨干,并用带可验证奖励的强化学习来提升因果推理能力。训练信号一共三种:模仿学习、监督微调、强化学习。

第十三到十五页是配套的论文与验证。作者之一就是 Pavone 本人,论文标题是《Alpamayo-R1:打通推理与动作预测,让长尾场景下的自动驾驶更可泛化》,日期 2025 年 10 月 28 日。

摘要里点出了旧架构的病根:靠模仿学习堆规模和数据的端到端模型,在安全攸关的长尾场景里依然脆弱,因为监督信号稀疏、因果理解有限。

AR1 的思路是把"因果链推理"和轨迹规划绑在一起,论文称它建立在三项关键创新之上。

从"看到什么就输出什么",到"先解释为什么,再输出轨迹",这一步才是所谓智能的分水岭。

九、模型真上车了:你问它在干嘛,它会说是红灯所以停

第十四页把 Alpamayo 1 的输入输出摊开:多摄像头图像、随时间变化的视觉流、文本编码器、用户指令、导航信息、Ego 历史,最后汇到轨迹解码器。

第十五页是一段仿真演示,场景是"因为有人行横道上的行人所以停车",图里画了历史轨迹和预测轨迹两条线。第十六页只有一行字——Physical AI AV Dataset,也就是那个数据集。

第十七页最有意思,标题是"Alpamayo 部署在车上"。车里的人问了一句"你在干嘛",车回答:"我在路口停车标志处停车。"这一问一答说明的东西比任何指标都直接:模型不只知道该做什么,还能把自己的判断讲出来。

演讲引用的是团队的另一场分享——从研究到量产,Alpamayo 如何加速自动驾驶开发,出自 GTC 2026 的一场专场。

可解释性一旦落到"能对话"这个层面,自动驾驶和乘客之间的信任关系就完全不一样了。

Alpamayo 生态成绩单:模型下载超 40 万次,数据集下载超 230 万次

图片来源:《英伟达》(第20页) · 阅读原文与全部图表

十、开放平台与生态:40 万次模型下载,230 万次数据集下载

最后几页讲的是开放平台和生态,也是这份材料里最容易被低估的部分。NVIDIA Alpamayo Open Platform 由三块组成。第一块是模型:开放 10B 参数级别的推理 VLA,可以通过导航和文本指令控制行为。

第二块是 AlpaSim,一个开放仿真框架,用于闭环测试和验证,插件体系可扩展,支持灵活的多摄像头配置,同时发布了基于 AlpaSim 的闭环端到端驾驶基准。

第三块是物理 AI 自动驾驶数据集,号称最多元开放,包含来自 25 个国家、2500 座城市、约 1700 小时的多传感器数据,还带人工核验过的推理标注和因果链自动标注流水线。

配套还放了后训练脚本和两份 Recipe:一份做监督微调,一份用 Cosmos-RL/GRPO 做强化学习后训练。生态成绩单在第二十页:Alpamayo 模型下载超过 40 万次,Physical AI AV 数据集下载超过 230 万次,全部 Alpamayo 仓库合计三千多颗星,还拿了 Computex 2026 的最佳选择奖。

比赛成绩也挺实在:在 KITScenes Long Tail 挑战赛上拿到零样本第三名,也就是没针对日本数据训练就直接上场。第二十二页是对外的新消息:NVIDIA DRIVE Hyperion Robotaxi 平台发布 Alpamayo 2 Super Robotaxi 推理模型,配套 AlpaSim 与 OmniDreams 两个仿真器、训练数据生成、开放模型和 Halos OS,底层是 DRIVE AGX Thor。

想把这套图表的完整版本看一遍,可以到运营动脉(www.yydm.cn)检索原文。

把视角拉到抖音商城科技报告,《抖音商城科技报告:2026五大趋势与TECH100》里的样本会更完整一些。

把模型、仿真器和数据集一起放开,英伟达要争的其实不是这一个项目,而是下一代自动驾驶的默认底座。

这份《自动驾驶的 ChatGPT 时刻》是什么来头?

它是英伟达自动驾驶研究高级总监 Marco Pavone 在 CVPR 2026 Alpamayo Summit 上的一场演讲,时间标注为 2026 年 6 月 4 日,演讲主题就是"自动驾驶的 ChatGPT 时刻"。内容围绕英伟达自动驾驶全栈方案、Cosmos 世界基础模型、Alpamayo 系列模型(VA、VLA、R1)以及 Alpamayo 开放平台展开。

为什么说自动驾驶迎来了自己的 ChatGPT 时刻?

演讲给的核心证据是语言预训练对驾驶任务有正向作用:把 Alpamayo 的语言骨干换成互联网预训练的 LLM 后,模型收敛更快、稳态更好,评测覆盖美国和欧洲的 25600 个场景,闭环评测结果一致。

另一个证据是推理能力上车。Alpamayo-R1 把因果链推理与轨迹规划结合,用带可验证奖励的强化学习提升因果理解,车上部署后能直接回答"我在路口停车标志处停车"。

Alpamayo VA、VLA 和 R1 之间是什么关系?

VA 是 Vision-Action 模型,视觉层用 ViT 做多摄像头多帧 token 化,语言层用 Llama2,动作层是自回归轨迹解码器,训练方式是对整条多模态序列做下一 token 预测。

VLA 把语言层换成互联网预训练的 LLM 骨干并蒸馏到嵌入式尺寸,动作层换成多模态轨迹解码器并引入元动作,因此收敛更快。R1 进一步把动作换成推理引导的轨迹扩散,骨干换成 Cosmos-Reason,用模仿学习、监督微调和强化学习三种信号训练。

Cosmos 世界基础模型能做什么?

Cosmos 由四种能力组成:Embed 是面向物理 AI 的视频-文本联合嵌入器,用于文到视频检索、反向视频搜索、语义去重和数据筛选;Predict 从多模态输入生成未来世界状态。

Transfer 结合 Omniverse 生成符合物理规律的照片级输出,用于合成数据生成;Reason 用思维链推理回答"下一步该做什么",可开箱即用,也能用于具身智能模型的后训练。

Alpamayo 开放平台开放了哪些东西?

包括 10B 参数级别的开放推理 VLA 模型、AlpaSim 开放仿真框架,以及号称最多元的开放自动驾驶数据集。数据集包含来自 25 个国家、2500 座城市、约 1700 小时的多传感器数据,并带人工核验的推理标注。

生态数据方面,模型下载超过 40 万次,Physical AI AV 数据集下载超过 230 万次,全部仓库合计三千多颗星。

相关报告解读推荐

想继续往深里看,下面这几篇是同一主题线上比较扎实的解读。

《2026年AI人才报告拆解:只2%企业真准备好了》——更扎心的是,AI高管的薪酬已经涨到离谱——PE投资企业的高管总包突破2000万美元,而人才缺口仍是最大的扩张障碍。

《ECDB 2026代理电商报告:ChatGPT转化率超搜索》——落点在ChatGPT转化率超搜索

《Meltwater 2026品牌AI可见度指南》——主线是GEO抢占推荐位

英伟达-自动驾驶的Chat GPT 时刻-2026-自动驾驶(英).pdf
www.yydm.cn欢迎访问运营动脉官网,即可获取7万+份涵盖300+行业、来自全球5000+权威机构的PPT/PDF资料,每日更新超50份,持续两年以上。支持电脑手机秒开阅读、下载不限速,3秒精准检索。推广还能享50%佣金,分销轻松赚钱。找运营资料,上运营动脉!让一部分运营人,先找到好资料微信服务号站长微信访问官网www.yydm.cn海量精品方案 / 报告 / 课件 / 模板找运营资料,上运...
26 页 13 次下载 4.52 MB
广告

声明:除非特别标注,否则均为本站原创文章,转载时请以链接形式注明文章出处。如若本站内容侵犯了原著者的合法权益,可联系本站删除。

确认删除?
会员
教程
收藏
足迹
联系
  • 站长微信
顶部