◆ DeepFocus 金融数据

从LLM到VLM再到VLA意味着什么

DeepFocus AI 研报速读 · 来源:海外投行 · 2026-08-12
一句话看懂:看多VLA架构产业趋势:自动驾驶与具身智能加速融合,理想汽车等已率先切换。

DeepFocus 视角

第一,这份报告本质是技术架构科普+趋势梳理,并非传统股票推荐,所以"看多"的对象是产业范式而非某只票,这点必须先界定清楚,否则容易被误读为LI的目标价报告。第二,核心前提与隐含假设有三条:①假设VLA的快慢系统架构真的能在量产车规级硬件上跑通端到端推理;②假设视觉-动作直接映射(去掉"L")不会因为丢失语言推理而牺牲复杂场景的可解释性和安全性;③假设头部车企的算力+数据闭环足够支撑持续迭代。这三个假设任何一个松动,理想等先发者的领先窗口就可能被特斯拉FSD、小鹏XNGP、华为ADS等追赶者迅速缩短。第三,报告回避了一个关键反方视角:VLA目前所有demo都集中在结构化或半结构化环境(城市道路、桌面抓取),在长尾极端工况下的可靠性、因果推理能力、法律归责边界,业内并无成熟解;Waymo等坚持"严格规则+激光雷达"的厂商并非落后,而是在等VLA的安全性证据。第四,敏感性方面,决定这条产业链兑现节奏的最敏感变量不是模型架构本身,而是车端/机器人端SoC的算力上限(NVIDIA Orin/Thor、华为MDC、地平线征程等)和单位token推理成本——一旦车端算力突破或推理成本腰斩,VLA量产节奏会非线性加速。第五,横向参照:可类比2017年Transformer从NLP向CV迁移、2020年ViT引爆视觉模型的两次范式切换,每一次的赢家都不是最早提出者,而是最快把架构产品化+数据闭环的公司(BERT→GPT,ResNet→ViT),所以真正的Alpha不在"谁先做VLA",而在"谁先把VLA的数据飞轮转起来"。第六,读者跟踪清单:①理想汽车每季度OTA升级里端到端模型的接管里程数据;②特斯拉FSD V13/V15的视觉-动作直接映射进展;③NVIDIA Thor量产时点和单芯片算力;④具身机器人公司(Figure/Tesla Optimus/优必选/智元)的真机演示视频与量产时点;⑤国内Robotaxi牌照与商业化进度(萝卜快跑、小马智行)。时间线上建议重点关注2026Q4-2027H1的几场关键发布会,这会是验证VLA能否从demo走向规模商用的窗口期。

解读综述

本报告以Q&A形式梳理LLM→VLM→VLA的技术演进路径,指出VLA(视觉语言动作模型)是把互联网图文预训练的VLM能力迁移至机器人/自动驾驶控制任务的关键架构。当前自动驾驶头部企业(如理想汽车)已基本切换至VLA架构,行业演进方向是探索移除"L"(语言)环节、实现视觉到动作的直接映射。买方视角:这是AI算力+整车+机器人产业链的长期主题,非个股择时报告。

速读 · 核心要点

风险与需要留意的地方

本文为 DeepFocus 对海外投行公开研报的 AI 解读与整理 · 解读置信度 72%,不含研报原文;完整跟踪与实时行情请在 DeepFocus 终端查看。

更多研报解读

在 DeepFocus 终端看实时行情与更多解读 →