大模型产业交流
一句话看懂:国内大模型参数已追平海外,工程优化成新护城河,后训练与数据是短板
DeepFocus 视角
报告把国内大模型竞争从「参数竞赛」推向「工程与数据竞赛」,但隐含几个值得警觉的判断。
第一,「参数追平」结论需谨慎——海外旗舰仍以稠密架构为主、激活参数更多,国内MoE的稀疏激活下真实有效算力差距可能被低估;DeepSeek 1.6T与千问Max 2.4T的真实benchmark表现仍待第三方验证。
第二,「工程优化是护城河」结论的反方视角:分布式训练know-how本质是工程经验,存在被开源框架(Hugging Face、DeepSpeed、Megatron)民主化的风险,护城河深度有限;阿里、字节等大厂凭借云基础设施优势,工程能力差距在持续压缩中小厂商。
第三,后训练瓶颈比报告描述的更严重——国内主要靠蒸馏GPT/Claude等海外模型生成专家级数据,这一路径在海外API收紧(如OpenAI封禁中国IP)后将快速失效,数据飞轮存在断链风险。
第四,报告中「AI安全商业化早期」判断对网络安全板块是长期利好但短期催化弱,关注奇安信、深信服等A股标的的AI安全业务落地节奏。
第五,敏感性变量:B300等下一代GPU出货节奏直接影响国内训练算力成本与训练时长;阿里(BABA/9988)作为同时具备云、芯片(平头哥)、模型(通义千问)的全栈玩家,是最直接的国内大模型产业链beta标的。
跟踪指标:智谱GLM-6或下一代产品发布时间、Kimi与DeepSeek的ARR增速、阿里通义API价格变动、OpenAI对国内API访问政策、英伟达B300/B400出口管制动态。
解读综述
报告指出DeepSeek 1.6T与千问Max 2.4T代表国内参数与编程能力已接近海外水平,智谱GLM-5.3编程能力国内前列、ARR近12亿美元。但后训练(奖励模型、人类标注)和数据质量仍是国内短板,目前主要靠蒸馏海外数据。AI Infra工程优化已成为各厂商核心竞争力,第一梯队为智谱、Kimi、DeepSeek、阿里。
速读 · 核心要点
- DeepSeek 1.6T、千问Max 2.4T参数规模突破
- 智谱GLM-5.3编程能力国内前列、ARR近12亿美元
- 国内模型在编程领域已无显著海外差距
风险与需要留意的地方
- 后训练依赖蒸馏海外数据、奖励模型存偏
- AI安全商业模式受限于企业早期阶段
- 增量数据已脱离互联网、AI生成有漏检风险
更多研报解读
- 偏多但分化:云积压订单激增与AI资本开支加速构成主驱动,算力瓶颈与回报率压力是关键变量
- 看多金融见底与思源电气出海+工业AI落地共振,银行业ROE长期受益
- 全球货币政策分化:美联储宽松受通胀韧性强约束,日央行加息慢于预期,中国财政下半年加码
- 看多:设备与海外订单强劲,并表秦风气体+压缩空气储能打开第二曲线。
- 看多:康柏西普基本盘稳健,基因治疗KH631/KH658与双载荷ADC KH815/KH922打开第二曲线,估值
- 看多老铺黄金:Q2盈利韧性超预期,PE仅8倍+股息率9%,估值修复空间逾50%。
- 看多:出口高景气叠加租金提价与贸易服务放量,估值重塑至700-800亿
- 看多:液态奶企稳+深加工放量+75%高分红,估值修复弹性凸显