◆ DeepFocus 金融数据

智能驾驶VLA模型的架构范式与厂商路线

DeepFocus AI 研报速读 · 来源:海外投行 · 2026-08-16
一句话看懂:技术看多:VOA是智驾终局路径,原生动作生成补齐VLM短板,理想MindVLA已率先落地。

DeepFocus 视角

这份研报的最大价值在于把行业从"端到端大词"拉回到"显式动作头+扩散解码"的工程细节,但买方需要警惕三层隐含假设:第一,VOA是终局的论断建立在"语言-视觉-动作三者必须语义对齐"这一前提上,但小鹏二代VLA已经用"去语言中间层"打了反证——如果视觉本身就足以驱动动作,那千里的"思维链隐空间"和理想的"快慢双系统"反而可能是过渡形态,技术收敛的方向未必是单一VOA。第二,30Hz推理帧率被报告反复提及,但真正决定量产的是"车规级SoC的有效算力/能效比"——小鹏图灵芯片、英伟达Orin/Thor、高通Ride等芯片方案的进展节奏才是关键变量,报告对此着墨偏少。第三,元戎启行"12小时数据闭环"听着性感,但前提是已有海量高质量corner case数据池+仿真闭环基础设施,新进入者无法复制,实质上是头部供应商的护城河再加固。横向看,Waymo的Emma迁移自Gemini走"通用基础模型+驾驶微调"路线,特斯拉FSD走纯视觉端到端,国内理想/小鹏/千里则在做"中国特色corner case(加塞、电动车、混合交通)"的工程深耕——这意味着中国玩家的胜负点不在模型架构,而在高质量中国路况数据+车云闭环+车规芯片的三位一体能力。报告未充分讨论的风险还有:①L3以上监管未明朗,VOA的"黑箱"决策反而可能拖累责任认定;②城市NOA渗透率到顶后,VLA的边际改善能否撑起溢价存疑;③合资/外资品牌在2026-2027年若用"Waymo式基础模型"反扑,国内先发优势可能被稀释。读者接下来要盯的核心指标:理想Ultra车型2026Q1的MindVLA推送节奏与用户接管率、元戎启行40B以外是否放出更大参数量版本、小鹏图灵芯片的实测有效算力、千里与主机厂的定点合作落地,以及2026年L3政策窗口。

解读综述

这是一篇产业技术深度研报,主线是:自动驾驶正从模块化流水线→端到端→VLM→VOA四阶段演进,VOA通过显式动作头让"语言空间"直接驱动"轨迹输出",是各大厂共识的下一代范式。理想汽车MindVLA、元戎启行40B VOA、千里Co-WoRD、小鹏二代VLA各自走了差异化路线(扩散头自驾、Driver/Analyst/Critic三角色、隐空间专家Token、剔除语言中间层),但共同指向"端到端原生动作生成"这一终局。买方视角:这是技术路线的"分水岭",领先厂商的工程壁垒和数据闭环能力将决定下一轮格局。

速读 · 核心要点

风险与需要留意的地方

本文为 DeepFocus 对海外投行公开研报的 AI 解读与整理 · 解读置信度 72%,不含研报原文;完整跟踪与实时行情请在 DeepFocus 终端查看。

更多研报解读

在 DeepFocus 终端看实时行情与更多解读 →