从LLM到VLM再到VLA意味着什么
一句话看懂:看多VLA架构产业趋势:自动驾驶与具身智能加速融合,理想汽车等已率先切换。
DeepFocus 视角
第一,这份报告本质是技术架构科普+趋势梳理,并非传统股票推荐,所以"看多"的对象是产业范式而非某只票,这点必须先界定清楚,否则容易被误读为LI的目标价报告。第二,核心前提与隐含假设有三条:①假设VLA的快慢系统架构真的能在量产车规级硬件上跑通端到端推理;②假设视觉-动作直接映射(去掉"L")不会因为丢失语言推理而牺牲复杂场景的可解释性和安全性;③假设头部车企的算力+数据闭环足够支撑持续迭代。这三个假设任何一个松动,理想等先发者的领先窗口就可能被特斯拉FSD、小鹏XNGP、华为ADS等追赶者迅速缩短。第三,报告回避了一个关键反方视角:VLA目前所有demo都集中在结构化或半结构化环境(城市道路、桌面抓取),在长尾极端工况下的可靠性、因果推理能力、法律归责边界,业内并无成熟解;Waymo等坚持"严格规则+激光雷达"的厂商并非落后,而是在等VLA的安全性证据。第四,敏感性方面,决定这条产业链兑现节奏的最敏感变量不是模型架构本身,而是车端/机器人端SoC的算力上限(NVIDIA Orin/Thor、华为MDC、地平线征程等)和单位token推理成本——一旦车端算力突破或推理成本腰斩,VLA量产节奏会非线性加速。第五,横向参照:可类比2017年Transformer从NLP向CV迁移、2020年ViT引爆视觉模型的两次范式切换,每一次的赢家都不是最早提出者,而是最快把架构产品化+数据闭环的公司(BERT→GPT,ResNet→ViT),所以真正的Alpha不在"谁先做VLA",而在"谁先把VLA的数据飞轮转起来"。第六,读者跟踪清单:①理想汽车每季度OTA升级里端到端模型的接管里程数据;②特斯拉FSD V13/V15的视觉-动作直接映射进展;③NVIDIA Thor量产时点和单芯片算力;④具身机器人公司(Figure/Tesla Optimus/优必选/智元)的真机演示视频与量产时点;⑤国内Robotaxi牌照与商业化进度(萝卜快跑、小马智行)。时间线上建议重点关注2026Q4-2027H1的几场关键发布会,这会是验证VLA能否从demo走向规模商用的窗口期。
解读综述
本报告以Q&A形式梳理LLM→VLM→VLA的技术演进路径,指出VLA(视觉语言动作模型)是把互联网图文预训练的VLM能力迁移至机器人/自动驾驶控制任务的关键架构。当前自动驾驶头部企业(如理想汽车)已基本切换至VLA架构,行业演进方向是探索移除"L"(语言)环节、实现视觉到动作的直接映射。买方视角:这是AI算力+整车+机器人产业链的长期主题,非个股择时报告。
速读 · 核心要点
- 理想汽车(LI)已落地快慢系统VLA架构,是少数把该架构从论文推向量产的整车厂,先发优势明确
- VLM→VLA迁移意味着同一套互联网图文预训练数据可复用,模型侧边际训练成本随架构成熟而下降
- 自动驾驶本质是"简单机器人",VLA在自动驾驶的落地验证,将反向加速具身机器人产业化
- 移除"L"、走向视觉-动作直接映射的产业趋势,意味着端到端方案对激光雷达/高精地图等模块化硬件的依赖可能被弱化
风险与需要留意的地方
- 理想等车企的快慢系统仍存在"高层理解系统与低层控制系统的有效衔接"这一未解决的技术挑战
- 离散动作token化路线存在精度损失和时延较高问题,OpenAI等采用此路线的机器人动作可能不够流畅
- VLA是AI算力+训练数据双密集型架构,研发门槛和资本开支极高,仅少数头部厂商能跟上
更多研报解读
- 偏多但分化:云积压订单激增与AI资本开支加速构成主驱动,算力瓶颈与回报率压力是关键变量
- 看多金融见底与思源电气出海+工业AI落地共振,银行业ROE长期受益
- 全球货币政策分化:美联储宽松受通胀韧性强约束,日央行加息慢于预期,中国财政下半年加码
- 看多:设备与海外订单强劲,并表秦风气体+压缩空气储能打开第二曲线。
- 看多:康柏西普基本盘稳健,基因治疗KH631/KH658与双载荷ADC KH815/KH922打开第二曲线,估值
- 看多老铺黄金:Q2盈利韧性超预期,PE仅8倍+股息率9%,估值修复空间逾50%。
- 看多:出口高景气叠加租金提价与贸易服务放量,估值重塑至700-800亿
- 看多:液态奶企稳+深加工放量+75%高分红,估值修复弹性凸显