智能驾驶VLA模型的架构范式与厂商路线
一句话看懂:技术看多:VOA是智驾终局路径,原生动作生成补齐VLM短板,理想MindVLA已率先落地。
DeepFocus 视角
这份研报的最大价值在于把行业从"端到端大词"拉回到"显式动作头+扩散解码"的工程细节,但买方需要警惕三层隐含假设:第一,VOA是终局的论断建立在"语言-视觉-动作三者必须语义对齐"这一前提上,但小鹏二代VLA已经用"去语言中间层"打了反证——如果视觉本身就足以驱动动作,那千里的"思维链隐空间"和理想的"快慢双系统"反而可能是过渡形态,技术收敛的方向未必是单一VOA。第二,30Hz推理帧率被报告反复提及,但真正决定量产的是"车规级SoC的有效算力/能效比"——小鹏图灵芯片、英伟达Orin/Thor、高通Ride等芯片方案的进展节奏才是关键变量,报告对此着墨偏少。第三,元戎启行"12小时数据闭环"听着性感,但前提是已有海量高质量corner case数据池+仿真闭环基础设施,新进入者无法复制,实质上是头部供应商的护城河再加固。横向看,Waymo的Emma迁移自Gemini走"通用基础模型+驾驶微调"路线,特斯拉FSD走纯视觉端到端,国内理想/小鹏/千里则在做"中国特色corner case(加塞、电动车、混合交通)"的工程深耕——这意味着中国玩家的胜负点不在模型架构,而在高质量中国路况数据+车云闭环+车规芯片的三位一体能力。报告未充分讨论的风险还有:①L3以上监管未明朗,VOA的"黑箱"决策反而可能拖累责任认定;②城市NOA渗透率到顶后,VLA的边际改善能否撑起溢价存疑;③合资/外资品牌在2026-2027年若用"Waymo式基础模型"反扑,国内先发优势可能被稀释。读者接下来要盯的核心指标:理想Ultra车型2026Q1的MindVLA推送节奏与用户接管率、元戎启行40B以外是否放出更大参数量版本、小鹏图灵芯片的实测有效算力、千里与主机厂的定点合作落地,以及2026年L3政策窗口。
解读综述
这是一篇产业技术深度研报,主线是:自动驾驶正从模块化流水线→端到端→VLM→VOA四阶段演进,VOA通过显式动作头让"语言空间"直接驱动"轨迹输出",是各大厂共识的下一代范式。理想汽车MindVLA、元戎启行40B VOA、千里Co-WoRD、小鹏二代VLA各自走了差异化路线(扩散头自驾、Driver/Analyst/Critic三角色、隐空间专家Token、剔除语言中间层),但共同指向"端到端原生动作生成"这一终局。买方视角:这是技术路线的"分水岭",领先厂商的工程壁垒和数据闭环能力将决定下一轮格局。
速读 · 核心要点
- 理想MindVLA已落地为单一VOA模型,即将错误的33%降幅+Ultra车型2026Q1推送十亿参数模型,量产节奏领先全行业
- 元戎启行40B VOA实现Driver/Analyst/Critic三角色闭环,数据处理周期从5天压缩至12小时,2025年10月第三方高阶智驾供应商市占率近40%
- 千里的Co-WoRD在隐空间内置交通交互/道路几何/动态演化/自车轨迹4类专家Token,把思维链从文本空间迁移到隐空间,规避了语言转译损耗
- 小鹏二代VLA做减法——去掉显式语言中间层,规避文字承载几何/运动细节的瓶颈,差异化路径也获验证
风险与需要留意的地方
- 30Hz推理帧率门槛对算力要求极苛刻,量产必须依赖token削减、量化、蒸馏、MoE等系列优化,且小鹏图灵芯片等车载SoC是落地前置条件——任何芯片延期都会拖累节奏
- 视觉-语言-动作三模态对齐的标注数据极度稀缺,是数据飞轮能否跑通的命门;元戎启行闭环周期压缩到12小时虽惊艳,但能否规模化复制存疑
- 稳健性仍是头号风险:语言幻觉、传感器噪声、形化验证缺失在罕见/果场景下翻车概率高,监管/事故容忍度是VLA大规模上车的真正拦路虎
更多研报解读
- 偏多但分化:云积压订单激增与AI资本开支加速构成主驱动,算力瓶颈与回报率压力是关键变量
- 看多金融见底与思源电气出海+工业AI落地共振,银行业ROE长期受益
- 全球货币政策分化:美联储宽松受通胀韧性强约束,日央行加息慢于预期,中国财政下半年加码
- 看多:设备与海外订单强劲,并表秦风气体+压缩空气储能打开第二曲线。
- 看多:康柏西普基本盘稳健,基因治疗KH631/KH658与双载荷ADC KH815/KH922打开第二曲线,估值
- 看多老铺黄金:Q2盈利韧性超预期,PE仅8倍+股息率9%,估值修复空间逾50%。
- 看多:出口高景气叠加租金提价与贸易服务放量,估值重塑至700-800亿
- 看多:液态奶企稳+深加工放量+75%高分红,估值修复弹性凸显