ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

GPU算力涨价潮下,如何选择平台与省钱实战指南

GPU算力涨价潮下,如何选择平台与省钱实战指南 说句实在话干深度学习这几年我见过比模型loss还要让人心慌的东西就是算力账单。2026年这波算力涨价潮来得既猛又急GPU算力平台的时租价格一个季度内动辄上涨两到三成很多原本低价能捡到的算力资源一夜之间变成了“算力烤串”。这个背景下不同GPU算力平台之间的差异被急速放大有人靠长租锁价躲过一劫有人被动态定价打得措手不及还有人在聚合平台上淘到了比公有云便宜接近一半的卡。到底该怎么分辨这些平台怎么在涨价周期里选对用卡姿势是我过去几个月反复折腾、复盘出来的核心经验。今天把全部细节摊开聊从涨价逻辑到选型指标从省钱操作到问题排查一次性讲清楚。1. 涨价潮是怎么来的平台底价为什么一起飘1.1 供给端的三重卡脖子芯片拆不动产能出不来GPU涨价不是营销造势而是供应链物理瓶颈逼出来的。首先是先进工艺产能全球能满足数据中心级芯片制造需求的晶圆厂就那么几条产线扩产周期论年算。2026年恰好赶上某硬件厂商新一代核心大芯片导入上一代旗舰训练卡产量被压缩直接把整体供给压下一个台阶。其次是高带宽显存。训练大模型对显存容量和带宽的需求几乎喂不饱高带宽显存的堆叠工艺产能比芯片本身更紧张本质上属于更细分的稀缺品。最后是先进封装环节等效2.5D/3D封装的产能基本被头部客户包圆二线平台要想拿到卡排队是家常便饭。这三重瓶颈叠在一起形成了一个残酷现实整卡出货量在增长但远追不上需求增长速度数据中心显卡的交付周期从几周拉长到几个季度。算力平台手里有卡就等于有定价权。所以你在平台上看到的涨价通知表面上是“供需调节”背后是从晶圆到封装整条产线的紧张程度在统一调价。1.2 需求端的“军备竞赛式”扩卡需求侧比供给侧更夸张。大模型从训练卷到推理从文本卷到多模态模型参数量级和上下文长度不断拉高对算力的胃口是几何级数增长。与此同时各类智算中心建设、高校实验室算力采购、创业公司回归基础模型训练都在同一时间窗口索要资源。2026年的需求结构出现了一个明显变化以前是“有卡就行”现在是“卡要够多、显存要够大、互联要够宽”。中小模型做微调也能吃满单卡而8卡多卡互联已经成为不少任务的最低配置门槛。于是需求端不仅基数变大单个客户的占用量也变高平台资源池被切割得越来越碎结果就是所有档次的卡都不缺客户价格的挺坚变得顺理成章。供给和需求两头一起使劲涨价潮就不可避免。理解了这个底层逻辑再看平台报价的时候就不会只看表面数字而是能分辨谁是真便宜谁只是把成本藏在别处。1.3 电费、液冷与机柜隐性成本也在加很少有人认真算过平台的隐形成本。GPU算力平台不是单纯“租显卡”它是把显卡插在服务器里服务器放进机柜机柜接电、接液冷散热管、拉专线网络之后再对外计费。数据中心电费在大模型时代的占比越来越高部分用电高峰期机柜电费报价比低谷时段贵30%以上。再看散热改造。老机房为了压住高密度显卡的发热必须升级液冷系统一套液冷改造的成本摊下来平摊到每一卡位价格自然上浮。加上机柜租约到期后续约涨价、接入带宽升级费用这些全部会被平台摊进“每卡每小时”的单价里。这也是为什么2026年的涨价并不是个别平台行为而是从芯片、显存、封装、电力、机柜整条产业链传导下来的系统性上涨。如果你在涨价潮里看到某平台价格纹丝不动先别高兴先问问它的电费、带宽、故障补偿是不是另算了别的账。2. 五分钟看懂主流算力平台和它们“摊牌”的差异2.1 三条赛道公有云型、聚合租赁型、托管自建型现在能稳定租到GPU的平台大致分三类。第一类是公有云型。这类平台标准化程度高、文档完善、生态成熟但价格偏高在涨价潮里执行动态定价最坚决。而且它各种附加项拆得很细公网IP、带宽、镜像存储、快照费用单独计价时租单价看着还行月底总账单出来能吓你一跳。第二类是聚合租赁型。这类平台不自己养卡而是把多个渠道的闲置GPU统一接入做成一个算力超市。好处是能货比三家同样型号的卡在不同渠道会有明显价差调度系统会帮你自动选中当前时段最便宜的节点。缺点是质量参差不齐不同批次、不同保修状态的卡混在一起性能差异需要自己实际测试。第三类是自己买卡、托管机房或者干脆自己搭服务器。前期投入大但长期平均成本最低适合重度使用场景。这里要分清“自己买卡放机房”和“在平台包年租卡”的区别前者卡是你的折旧和故障风险自己扛后者你只是租用平台负责运维。涨价潮里自建最怕的是核心芯片持续涨价新买卡的成本越来越高回本周期被拉长。2.2 同一张卡不同平台价格差在哪直接上一个我实际对比过的例子。同样是某硬件厂商H系列中端训练卡在同一周内不同类型平台的价格梯队大致如下平台类型时租价格元/卡/小时是否含电力是否含高速互联高峰排队概率某头部公有云大厂22-28含需另购带宽高峰明显排队某全国性聚合租赁平台14-18含默认RoCE中低时段较低某区域本地机房直租10-13含视机房网络而定低二手翻新“野卡”渠道7-10大概率含不可控看运气价格会有波动重点是相对梯度。聚合租赁平台为什么能把价格压到公有云的一半甚至更低因为它没有自建云平台的研发、运营和客服成本卡的来源也更杂你租到的可能是机房闲置卡它接单的边际成本很低。在涨价潮里这个价差会被进一步放大。我有一次在聚合平台上看到某台机器的报价比同一天公有云的同款卡便宜了40%不止果断租下来跑一个42小时的微调任务实测吞吐基本持平只是在高峰时段偶尔能看到邻居任务的网络波动。2.3 五个容易忽略的“隐形差异点”很多新手上网看平台第一眼只会比每卡每小时多少钱这个习惯在涨价潮里尤其危险。真正决定成本的指标至少还有四个性能是否被锁同样型号的卡显存带宽可能被平台降频或限流。租到卡之后先跑一个小脚本实测实际浮点性能和显存带宽别等到训练跑到一半才发现速度不对。调度成功率平台页面显示“有货”不代表你能立刻启动高峰期排队时间可能从几分钟膨胀到几小时。排队过程通常不收费但也没产出你的时间成本被耗在无意义等待上。网络互联级别8卡以上任务跨节点通信是绝对瓶颈。InfiniBand和RoCE的性能差距很明显同一张卡插在高速互联集群和普通万兆网里训练效率能差出两三倍。租8卡以上实例前先确认互联类型再实测一下带宽。计费颗粒度按秒计费、按小时计费还是按天计费差别很大。按小时计费的任务如果跑了8小时5分钟可能被算成9小时的钱。长任务尤其要卡好关机时间或者确认平台有没有“分钟级舍入”规则。故障赔偿与SLA卡跑挂、节点宕机平台是否自动补偿时长、补偿多少必须提前问清楚。多数平台不会主动赔你不提就没有。这些隐形差异在涨价潮里会被放大成实实在在的钱。选平台的时候一旦忽略后面多花钱的体验会很别扭。3. 按使用场景挑平台比按品牌挑平台重要3.1 大模型预训练多卡互联和长时租优先预训练任务的特点是耗时动辄十几到几十天日志里全是checkpoint跨节点通信压力极大。这个场景下最不应该省的就是网络。去任何平台租卡先问清楚能不能提供“同机房同网络域多节点”的租用方案能不能保证节点之间走高速互联。用万兆网跑大模型分布式训练你会亲眼看到训练效率被通信拖垮的酸爽。预算上建议选能签以周或月为单位的长期租约。有的平台会在长期租上加一点折扣但涨价潮里更关键的是把“锁价”写进合同口头折扣不算数。我实测比较稳的做法是先跑一个短租小任务验证平台稳定性和调度速度再签订连续3周的包机把续费周期覆盖到一个完整的微调项目周期。预训练还有一个容易被忽视的点Checkpoint的存储。几十天的训练任务权重文件可能上百GB甚至上TB平台对存储的计费方式直接影响总成本。如果平台对快照和对象存储单独收费记得把这部分费用计入预算并且设置自动清理旧Checkpoint的策略。3.2 推理部署稳定比便宜更值钱模型训好之后才是真正的烧钱机器推理服务7×24小时在线。这个场景最怕两件事一是节点被平台回收或停机导致线上服务中断二是排队无法秒级拉起扩容节点流量高峰来了顶不上去。推理服务我会优先选公有云型平台或聚合平台里标注“专用实例池”的服务而不是碰竞价实例。专用实例池虽然每卡价格高一点但承诺了固定的实例数量和开机速度这是线上稳定性的底线。不要为了省10%的成本把推理服务放在随时可能被抢占的实例上出事就是事故级别的问题。推理场景还有一点容易忽略CPU和内存的配合。很多小模型的推理主要吃CPU、内存和磁盘IOGPU反而没那么满。对比平台报价时要同时看GPU利用率、CPU配额、内存带宽的综合情况。只盯着显存大小容易被表面配置误导实际推理吞吐跑不起来。3.3 科研、渲染与碎片化任务竞价实例是真香如果你跑的任务能断点续训、能接受被抢占、或者本来就是几小时级别的短任务那锁定平台的最低档竞价实例是绝对划算的。平台的低价实例本质上就是卖剩余算力价格可能只有常规价的40%-60%。虽然不承诺稳定性但配合自动保存机制实际体验并没有那么差。我自己做过一次实验一个约18小时的蒸馏脚本改造成每10分钟自动存一次权重后丢到竞价实例池跑。中途被抢占了两次但恢复后从checkpoint继续整个任务实际多花了不到1小时账单却比常规租用省了接近一半。所以竞价实例能不能用的关键不是怕被抢而是你有没有做好随时checkpoint的工程习惯。渲染和视频导出就更不必说了这类任务天然支持断点续导出直接扔给竞价池跑完全没问题。要避开的是那种平台突然把实例回收且没有保留日志和镜像的情况所以上任务前先把镜像传到镜像仓库别存在实例本地。3.4 选型清单一张表记住核心指标场景推荐平台类型关键指标预算策略超长预训练公有云/专业平台长租池高速互联、长时租约、锁价保障签月包/项目包微调/SFT/RLHF聚合平台专用实例池多卡互联、调度成功率包周/包月在线推理公有云/专用实例池秒级扩容、稳定不回收按需弹性伸缩科研/碎片任务竞价实例/闲置时段低单价、自动checkpoint按小时/按任务渲染/视频导出竞价实例/普通卡池显存、CPU配额、磁盘IO按量付费入门学习/试错聚合平台最低档/特价时段价格低、可随时退出按小时这张表是我自己选平台时的参考不是绝对标准但大方向错不了。选平台先定场景再比价格最后看合同细节顺序反了就容易吃亏。4. 涨价周期里的省钱操作我踩过坑也捡过漏4.1 涨价前的锁价与长约策略亲眼见过一个团队的操作他们提前预估到行情变化年初和某平台签了一个12个月的包年租约锁住了当时的价格。后来平台调价两次他们的账单纹丝不动相当于每个月白捡了几千块。锁价的关键是“把价格周期写进合同”而不是口头商量。合同里至少明确三点一是锁定期内的调价规则写上“锁定期内价格不变”这种明确的话二是提前解约的违约金写清多长期限内仍按原价续租三是到期后续约的涨幅上限不然到期后平台把价格直接翻倍你一点办法没有。我现在签平台租约时基本上都会把“锁价条款”放在第一页检查。不要嫌麻烦算力涨价周期里这一页纸能帮你省下的钱远比你花在研读合同上的时间值钱。如果你所在团队对价格敏感建议把所有平台的包年价格和政策变化做成一张表每月更新一次对趋势保持敏感。4.2 竞价实例的正确打开方式竞价实例用得好是省钱利器用不好是事故现场。我总结了几条规则只跑能checkpoint的任务优先跑可断点续训的脚本提前把运行环境和数据集做成镜像启动后3分钟内就能达到稳定状态减少被回收的概率设置实例自动释放时间避免忘记关机造成额外计费高峰期竞价价格并不便宜可能和常规价差不多要设置最高支付价阈值超过就退出竞价实例的“价格曲线”也是资产跑完一天的日志后分析价格波动时段把重任务挪到低谷段。有一次我把一个批量推理任务放在了下午的高峰竞价池结果价格只比常规实例便宜8%还因为排队多花了两个小时完全得不偿失。后来把任务调整到凌晨时段同样的资源价格直接降了40%。竞价实例的核心是“和平台的时间错峰”你越能适应非高峰时段省钱空间越大。4.3 深扒账单有多少钱死在了看不见的附加费账单爆雷最容易出现在几个地方镜像与快照存储费。你在平台上保存的大模型权重、数据集镜像正在按GB收费而且日积月累很吓人。公网流量费。训练数据从外部下载或镜像上传流量费能占账单的10%-20%部分平台还会对跨可用区流量单独计费。不活跃实例的持久化存储费。关机但未删除的实例云盘存储仍然计费很多人忘了释放。软件授权费。某些推理框架、调度工具平台可能会按实例数量收费细看账单才能发现。有一次我排查一个团队的账单发现他们明明没在跑任务每天账单却还在扣钱。查了一圈发现是他们在平台侧保留了3个数据卷和十几个镜像日积月累的存储费远比他们想象的可怕。所以从那天起我养成了一个习惯不论镜像、卷、快照还是实例都设清理周期用完即删。这听起来很基础但能做到的人真不多。4.4 我的算力成本三板斧监控法最后分享一套我自己的监控方法不需要复杂工具纯粹是工程习惯写一个简单的脚本每小时抓一次平台账单接口或页面数据记录当前计费实例数、实时时租价、竞价实例价格。设置阈值告警当日新增费用超过预估的20%就发提醒连续3天超支就复盘。每月做一次算力费用复盘哪些任务是必要的、哪些跑了没结果、哪些可以用低价时段重跑。这套方法的核心是让算力支出变得可观测。在涨价周期里很多成本膨胀都是从“不可观测”开始的。你对费用理解越清晰就越不容易被平台定价带着走。算力这种资源和代码一样只有能监控、能追踪才能真正管得住。5. 常见问题与救急排查手册5.1 排队、启动失败与OOM逐个说还没启动先说“实例卡在排队中”怎么办。先检查你是否选择了竞价或者免预约选项再看当前是否处于平台高峰时段。排队问题在聚合平台尤其明显因为同一个低价节点可能同时被多个任务抢单。比较实用的做法是提前预约在任务开始前几个小时先在平台侧把实例预启动起来抢占资源这样比高峰时段现开现用靠谱得多。再说“启动后立刻报显存不足OOM”。先看代码里是不是加载了过大的模型到显存比如用fp16加载了本来应该量化的模型再看batch size是否过大。最实用的排查方法是先跑一个最小batch size逐步上调卡住的那一点就是瓶颈。大模型训练里打开梯度检查点功能能显著减少显存占用但要接受一点计算开销。还有“实例启动成功但训练没有吞吐”。大概率是数据加载IO瓶颈或者跨节点网络有问题。先跑一个简单带宽测试看两台机器之间能否跑满预期带宽跑不满再检查网卡驱动、MTU设置、是否开启了硬件加速库。我遇到过一次训练速度奇慢排查了半天发现是对端节点跑的是旧驱动带宽只有正常的五分之一。5.2 平台故障与维权实例平台故障最常见的是三种节点宕机、网络闪断、实例被异常回收。处理原则只有一条先保存现场再联系客服最后计算损失。这里的现场指的是代码、权重、日志的备份不是让你继续重试同一个坏节点。我见过有人节点一宕机就疯狂重启同一个有问题的实例重启8次全部失败浪费了大量时间。成熟做法是先建立快照、保存代码分支再创建一个新实例进行验证如果持续失败就更换可用区或节点。故障后的“补偿时长”一定要主动申请很多平台不会自动补不说就没有。申请时把时间线、任务ID、损失时长写清楚客服处理效率会高很多。5.3 平台选型速查表避坑清单版检查项推荐动作计价方式确认按秒还是按小时计费问清是否含电费和基础网络调度承诺问高峰期排队时间上限确认是否支持预约机制互联等级8卡以上任务前必须问网络类型租到后实测带宽故障补偿确认宕机是否补偿时长记住申请流程步骤存储策略明确镜像、数据、快照是否单独收费设定清理周期价格锁定期涨价周期优先选择能锁价的平台锁价必须写入合同数据安全确认租约结束后平台是否彻底清理你的数据和密钥我自己这段时间复盘下来最大的体会是涨价潮不是让你别用GPU而是逼着你更聪明地用GPU。平台差异永远是客观存在的同卡不同价同价不同命关键看你有没有花时间把账单、调度、网络、故障补偿这些维度摸清。别嫌麻烦算力这部分省下来的钱足够你多跑很多次实验。最后再分享一个小技巧每次买新平台资源前多花半小时拉一下对方的历史价格曲线和故障记录这半小时能帮你避开后续几天甚至几周的折腾。祝各位在涨价周期里都能找到自己的节奏该冲的冲该省的要省得明白。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进