ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

深度 | DeepSeek V4 上国芯 120 天:Day-0 名单时代结束,国产算力进入「验收季」

深度 | DeepSeek V4 上国芯 120 天:Day-0 名单时代结束,国产算力进入「验收季」 DeepSeek V4 上国芯 120 天Day-0 名单时代结束国产算力进入「验收季」核心观点V4 上国芯四个月三个新信号把竞争的考场换了——950DT 提前上云、MiniMax H3 复制 Day-0、国测首次给 AI 训推芯片发准生证。适配名单不再值钱接下来考的是运行质量与现金流。证据等级[A] 官方/一手 [B] 2可靠来源 [C] 单一来源 [D] 个人判断一、上期的判断要被三个新证据往前推8 月 14 日的深研我给 V4 上国芯定过三个判断推理侧国产化走通了、训练侧没有、分水岭在产能。四个月过去方向没变但三个新证据把赛道本身换了。供给端昇腾 950DT 原本规划 Q4 量产现在提前到 8 月上线华为云昇腾 384 超节点商用部署超过 750 套DeepSeek 拿到 1.6 万张 950 卡 [B]。生态端8 月 3 日 MiniMax H3 开源当天十家国产芯片厂商 Day-0 适配 [B]。标准端5 月 26 日国测首次单独设立「人工智能训练推理芯片」品类昇腾 310/910、平头哥真武、壁仞 166、海光 DCU-3G、天数智芯、沐曦 MXC600、摩尔线程 PH1009 款国产芯片过 I 级 [A]。三个信号叠起来就一句话Day-0 名单不再值钱。名单决定能不能进门接下来考的是跑得好不好、赚不赚钱。二、四个月后「跑得怎么样」有了答案V4 靠 CSAHCA 压缩注意力把单 token 推理算力压到 V3.2 的 27%、KV 缓存压到 10%1.6T 参数的 V4-Pro 才可能在国产 NPU 上部署 [B]。这层「省」是适配的技术前提。实测水位910C 推理约为 H100 的 60%910B 在 batch8 时约为 H100 的 68%、功耗约 55%华为口径超节点自测 V4-Pro 约 4700 tok/s。关键在这些数字全部是厂商自测——120 天过去任何独立机构都还没放出昇腾的非自报 benchmark。英伟达的每个数字能被 Phoronix 独立复现昇腾的数字只能靠信任这条沟比算力差距更深。训练侧也清楚了。华为联合哈工大深圳用 1000 颗 910C 完成了 V4-Pro 的全参数后训练SFT即用现成数据做微调不是从零预训练算力利用率 MFU 30% [B]。但 DeepSeek 官方措辞是「在 NVIDIA GPU 与华为昇腾 NPU 上同时验证」——验证不是替换多个来源确认预训练仍主要跑在英伟达 H800/H100 上 [B]。还有个常被忽略的事实V4 用 mxFP4 存权重、显存减半但 FP4 存储不等于 FP4 计算现役硬件矩阵乘仍是 FP8/BF16FP4 的算力红利这代吃不到 [B]。软件侧的账更难看。CANN 宣称 95% CUDA 接口兼容表层替换已趟出成熟路径但 V4 的动态稀疏注意力算子在 CANN 原生算子库里不存在深度耦合 warp 调度的代码转换后要么编译失败要么运行时崩溃——两套执行模型的差距翻译工具处理不了。上图四个月后国产算力跑 V4 的技术水位——推理侧有自测数字、训练侧只有后训练实证、预训练仍在英伟达全链条缺独立第三方基准。三、Day-0 从「荣誉」变成「门槛」MiniMax H3 的十家 Day-0 先证伪了「V4 是一次性政治动作」——国产芯片软件生态在真实变好。但同一事实的背面是适配名单正在通货膨胀。当十家都能 Day-0首发适配只是参赛资格。国测把这事制度化。9 款过 I 级政企采购 AI 算力有了硬性及格线信创 2027 收官倒逼 2026 年集中招标 [B]。对采购方入围是入场券对芯片厂商入围只是起跑线——下一轮竞争发生在入围之后被真实采购、被稳定部署、被续约、现金流转正。厂商Day-0训练能力运行质量信号现金流信号华为昇腾V4H3 双 Day-01000 卡 SFT 实证950DT 8 月上云、超节点 750 套未上市寒武纪vLLM Day-0 开源弱H1 营收 108%存货 82 亿、现金流 3.11 亿海光Day-0全 FP16 训练DTK 即取即用数据可见摩尔线程V4H3 Day-0弱原生 FP8港股 IPO 推进GPU 四小龙Day-0弱无锚点模型依赖融资最扎眼的一行是寒武纪营收净利双高增长但 82.48 亿存货超过半年营收、经营现金流仅 3.11 亿、同比 -65.8%市值从高位回落至 7000 亿一线 [A]。存货可以解释为锁产能的备货但能不能在 H2 转成收入是叙事的验票点。还有个细节燧原始终没出现在任何已适配名单里 [D]。上图2026 年国芯跑千亿模型的关键节点——适配正从「新闻」变成「流程」。四、政策给门槛资本给验票政策端三股力量合流国测把国产化变成采购条款信创 2027 收官倒逼 2026 集中招标政治局 4 月 28 日把算力网列入「六张网」、相关投入预估超 7 万亿 [B]。需求侧阿里、字节、腾讯为 V4 云服务提前向华为下数十万颗订单芯片涨价约 20%。落地案例从适配声明变成私有化部署中国银联、国泰海通、6 家券商、中铝全在昇腾生态内——国产算力第一波真实业务落地是华为一家的独舞 [B]。三道天花板没有松动中芯 N2 产能缺口约 40%、HBM 缺口约 160 万颗、先进封装国产化率低于 10% [B]。950DT 提前上云提前的是产品节奏不是产能。资本端开始验票。寒武纪是第一张冷数据DeepSeek 6 月完成首轮融资约 510 亿元、估值近 4000 亿元7 月曝出乌兰察布 1GW 智算中心计划但芯片方案未定 [C]。1GW 相比美国动辄 3-5GW 的项目还差一个数量级。DeepSeek 拿 1.6 万张 950 卡、建智算中心、融资——它比任何券商都更早用真金白银为国产算力投票但投票投的是昇腾。上图政策、标准、需求合流成传导链——门槛决定订单订单落到交付现金流决定下一轮扩张。五、四个玩家分别要面对什么对模型厂商国产适配从可选项变必修课但成本是真的——V4 迁移昇腾重写 200 CUDA 算子、10 万 精度一致性测试、约 30 人年 [B]。MiniMax H3 能复制 Day-0是因为 V4 把路蹚出来了。对芯片厂商名单时代结束。真正的洗牌在采购、部署、续约、现金流四个环节。华为靠产能和软件栈领先寒武纪用现金流风险换订单规模GPU 四小龙拿不到锚点模型就可能看不到规模化收入。对采购方国测是及格线及格线不等于竞争力。私有化部署要一起验收模型能力、芯片吞吐、软件栈支持。对投资者高估值和现金流的剪刀差是最大的雷寒武纪的存货能不能在 H2 转成收入是国产算力叙事继续的验票点。六、我的判断我判断120 天前「Day-0 破壁」叙事战的输赢不重要了重要的是竞争的考场换了。从 2026 H2 开始国产算力不再考「谁上了名单」考「谁的卡跑得稳、谁的账转得正」。三个具体判断。其一2026 H2 会有一批验收式采购落地但第一轮交付之后才是真正的考验故障率、模型更新时的再适配速度、软硬件的长期绑定。其二训练侧全栈国产化最早 2027——950DT 超节点 Q4 才上量960 超节点要等 2027 Q4在此之前任何「国产训练替代英伟达」的说法都把 SFT 当成了预训练。其三国测是双刃剑——发准生证的同时把淘汰机制制度化连续两轮被客户弃用比不入围更致命。我需要三个数据才敢给这轮叙事定调寒武纪 H2 存货去化速度、950DT 的真实出货量不是「上线」的话术、有没有独立机构放出昇腾的非自报 benchmark。在那之前「全面替代」和「全是泡沫」都只是立场。先不下结论。参考来源部分Yicai GlobalChina’s DeepSeek Unveils New AI Model Using Huawei ChipsYahoo TechHuawei-led team post-trains DeepSeek’s 1.6T model on 1,000 Ascend 910C chips星岛日报内地首将 AI 训练推理晶片纳国测9 款齐入围新浪财经寒武纪市值退守7000亿82亿存货与算力平衡木雷锋网DeepSeek V4 首发适配背后——昇腾为什么坚持不做 CUDA 兼容层arXiv 2607.08215昇腾非 GPU 加速器大模型推理限制实地研究AI 辅助深度研究人工视角解读。每日更新。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进