算力涨价背后:英伟达系GPU云厂商的商业模式与风险 如果只用一句话概括过去一年多的算力市场我觉得是GPU 已经从采购清单上的一项“硬件”变成了比黄金波动还大的一种“算力资产”。做 AI 的团队今天还在聊某型号 GPU 还有多少现货明天可能就要开始评估某家云厂商的财务健康度英伟达每次释放一点产能信号租赁价格、交付周期和远期合约都会跟着抖一下。在这样的行情里CoreWeave、Nebius 这两个名字出现得越来越频繁。它们有同一个标签英伟达直接投资、深度绑定、甚至愿意优先供卡的 GPU 云厂商。坊间用“干儿子”来形容它们和英伟达之间的关系这个比喻虽然粗糙却抓住了最核心的商业本质它们能从上游拿到比普通玩家更好的资源但也要接受这种资源倾斜带来的战略依附。这篇文章不打算讨论股价也不想做任何投资建议。我想拆解的问题只有一个当算力价格持续上涨、厂商看起来风光无限时这些英伟达系 GPU 云公司的商业模式里究竟有哪些东西会被芯片周期、客户结构和资本环境反复惩罚算力涨价到底能护它们多久1. 先把名字翻译成事实GPU 云公司到底在做什么生意1.1 它们卖的不是“云”而是高性能 GPU 资产运营很多人把 CoreWeave、Nebius 和 AWS、Azure、谷歌云放在一起比较觉得它们是在抢传统云厂商的生意。这个理解方向不太对。它们更像是一类“GPU 资产运营公司”只不过把资产包装成云服务来出租。这中间有一条非常清晰的产业链路向上游采购大量 GPU 服务器同时还要配置 NVLink、InfiniBand 交换机、存储、机房和电力。把这些硬件组装成能够支撑多机多卡训练的集群。通过 Kubernetes、Slurm 等调度系统把集群按小时、按月租赁给 AI 公司。在租赁过程中持续处理节点故障、网络拥塞、存储瓶颈和版本兼容问题。你看这套生意很像“盖楼出租”盖楼的钱是资本开支租金是每小时的机时收入最大的经营变量是入住率也就是 GPU 利用率。盖楼能不能按计划交付决定了你能不能按时收到租金但楼盖得再漂亮如果入住率上不去折旧和利息也会照样吞掉利润。这个类比非常重要。它解释了为什么 GPU 云厂商最关心两件事第一能不能快速扩出足够多的可用集群第二能不能把未来产能提前卖给稳定的客户。至于“云”这个概念本身反而没那么重要。1.2 CoreWeave 和 Nebius走的其实是同一条路的不同版本CoreWeave 的成长轨迹很多关注 AI 基础设施的人已经知道。它最早是做加密货币挖矿起家的2017 年成立后来在行业转向时切入 GPU 云服务再往后成为英伟达高端 GPU 的大规模使用者之一。它真正抓住的机会是在大模型开始爆发、传统云厂商没有足够的 GPU 储备时用极快的速度买卡、建机房、扩集群并且把产能长期签给需要稳定算力的头部 AI 公司。Nebius 的情况更特殊。它在 2024 年经历了公司主体的重建把业务从原来复杂的互联网版图里剥离出来变成一个专注 AI 基础设施的独立主体。它的定位更偏向“AI 原生云”面向需要大规模 GPU 集群但又对本地化、数据合规要求很高的客户尤其是欧洲市场。两家公司表面路径不同底层却高度一致都是靠大规模采购英伟达 GPU 来构建算力池再把“稀缺算力”转化为按小时计费的云端产品。它们的核心竞争力短期看是“能不能拿到卡”中期看是“能不能把集群利用率维持在高位”长期看才是“能不能提供传统云厂商给不了的性能和运维体验”。1.3 为什么 AI 团队愿意为一个看起来更贵的集群买单经常有人问同样是租 H 系列 GPU为什么 CoreWeave、Nebius 这类厂商的单价比某些大云厂商还高还会有公司排着队买因为 AI 团队真正需要的不是一个单独的 GPU而是一整套“能让模型按时训练出来”的确定性。大模型训练不是把一块卡插上就能跑。节点之间用什么网络互联、存储能不能跟上 checkpoint 写入、调度系统会不会在排队时饿死某个任务、节点故障后作业能不能自动恢复这些都会直接影响训练效率和交付时间。对于一家正在冲刺模型发布日期的公司来说多花一点单价换来的是不需要自己维护几千张卡的运维团队以及遇到问题时有人能在几小时内响应。这笔账很容易算清楚。所以GPU 云厂商真正销售的产品不是“GPU 小时”而是“在特定时间段内稳定可用的高速算力”。谁能提供更可靠的确定性谁就能在涨价周期里拿到溢价。2. 英伟达撑腰不等于无限宠爱2.1 英伟达需要一个“能替它抢时间”的放大器要理解 CoreWeave、Nebius 为什么能崛起必须先理解英伟达为什么需要它们。传统云厂商体量巨大是英伟达的重要客户但它们同时也是潜在威胁。大型云厂商有自己的议价能力等规模大到一定程度后都会倾向于自研芯片来降低成本——这件事在行业里已经不是秘密。英伟达如果只依赖这几家巨头出货渠道风险会很集中。于是英伟达需要一批“愿意全量采用英伟达方案、上线速度快、不会半路转向自研芯片”的中间力量。CoreWeave、Nebius 就是这类角色。它们不像传统云厂商那样要照顾成千上万种通用工作负载可以专门围绕英伟达生态把集群做到极致。英伟达给它们更多的芯片配额和支持它们反过来帮英伟达证明最新一代 GPU 在正确的网络和调度配置下能在短时间内跑出什么样的效果。这不是简单的买卖关系而是一种产业链协同英伟达负责定义硬件和生态CoreWeave、Nebius 负责做大规模部署样板AI 公司负责在上面跑出成果。2.2 “既是股东又是供应商”的双向绑定如果只看新闻标题很容易把英伟达对 CoreWeave、Nebius 的投资理解为“干爹撒钱”。但把股权关系和供应关系放在一起看就会发现这是一种非常精密的双向绑定。英伟达作为股东可以通过投资分享下游云服务增长的收益同时作为供应商它又希望这些被投公司持续采购新一代芯片。对被投公司来说有英伟达背书融资和争取大客户都会更容易但也意味着当英伟达推出新一代 GPU 时它们很难不跟。因为如果不买新卡就可能失去“优先获得下一代芯片配额”的地位也可能会在性能和能效上落后于其他竞争对手。这带来的结果是这些 GPU 云厂商的扩张节奏其实不完全由自己的客户需求决定还受到上游芯片迭代节奏的牵引。它们必须不断投入资本开支否则就会被挤出生态核心圈。所谓的“干儿子”更像是签了一份不能随便退出的同盟协议。2.3 价格上涨里藏着上游对下游的定价权芯片供给不足时价格会逐级向上游集中。最强势的是英伟达它掌握着每一代产品的产能分配中间层的 GPU 云厂商虽然能把租金定得很高但它们的成本大头——GPU 采购成本——同样由上游决定。所以当算力价格上涨普通用户看到的是“GPU 很抢手”产业链内部看到的却是利润分配极不均匀。如果供应一直紧张溢价大部分会留在芯片厂商那里。下游云厂商能不能分到足够的利润取决于两件事一是它能不能保证高利用率二是它能不能在合同里锁定长期高价。否则涨价对它们来说未必是纯粹的利好。3. 算力涨价不是简单的“物以稀为贵”3.1 供不应求是底色但不是唯一解释GPU 租赁价格上涨最直接的原因是需求增速超过供给增速。大模型训练需要上万卡规模的集群推理需求又在持续放大而高端 GPU 的产能受制于先进封装、高带宽存储和整体供应链短期很难快速放量。这是真正的物理学意义上的紧缺不是营销造出来的焦虑。但在这种大背景下GPU 云厂商的定价策略还叠加了很多财务因素。它们不是按“成本加合理利润”来定价而是按“未来现金回款需求”来定价。如果你只看市场供需会低估价格高位持续的时间如果你只看财务成本又会高估厂商的实际利润。3.2 GPU 的折旧时钟比财务账本更冷酷每一块 GPU 都有物理寿命和技术寿命。物理上一张卡用五六年可能还能跑但在 AI 这种迭代极快的行业上一代旗舰往往两三年就会进入弱势期。新一代芯片发布后老芯片的理论性能和能效会迅速失去竞争力租赁价格也会随之下滑。GPU 云公司在财务上通常按几年时间计提折旧但芯片的市场竞争力大概率不会等满折旧期才下降。这意味着它们必须在“新一代芯片还有价格优势、老一代芯片还没明显贬值”的窗口期里尽可能把算力租出去并收回现金。这个压力会直接反映在定价上。所以你会看到一种奇怪现象厂商明明已经赚到了很高的毛利却仍然显得很缺钱还要继续融资、继续扩产。因为如果这一代产品不能在有限窗口内形成足够收入等下一代产品出来后账面资产可能一夜之间大打折扣。算力涨价本质上是下游在为 GPU 云的“折旧焦虑”买单。3.3 为什么涨价越猛客户越想签长约按常理涨价应该让买家观望观望。但在 GPU 市场很多大型 AI 公司选择在涨价周期里签更长的合同。原因很简单AI 公司怕的不是贵而是到了该训练的时候没有卡。模型发布是有时间窗口的错过一个关键节点可能意味着数月的工作白费。与其赌几个月后的现货市场不如用长期合同锁定未来的产能。对 GPU 云厂商来说这种长约也很有价值客户提前付款或做出承诺意味着它们可以利用这笔确定性去融资、去扩产去提前向上游下订单。于是算力租赁市场出现了一个类似“远期合约”的结构。买方锁定了产能卖方锁定了收入看起来是双赢。但这个结构的风险在于如果客户的模型路线发生变化如果推理需求增长但没有像预期那样消耗高性能训练卡如果新一代芯片让当前合同失去性价比合同就会变成双方的负担。高价和长约并不能消除周期风险只是把风险从现货市场挪到了合约层面。不要被“长期合同锁定”安慰得太早。合同只能管理已签约部分的产能管不住签约之外的空置率也管不住技术路线转向带来的需求萎缩。4. 这种模式最怕什么五个容易被乐观叙事掩盖的命门4.1 客户集中度太高等于把命脉交到少数人手里GPU 云厂商的商业模式天然倾向于服务大客户因为大客户能带来稳定的大额收入还能在财务上支撑起庞大的扩产计划。CoreWeave 在公开上市过程中外界高度关注它和头部 AI 公司的长期合同正是因为这个原因。但客户集中度过高是一把双刃剑。如果一个大客户决定缩减训练规模或者转向自建集群、更换供应商那么云厂商手里大量已经部署的 GPU 就会突然失去去处。替换大客户不是一两个月能完成的事而折旧和利息每天都在发生。很多看似稳定的 GPU 云公司实际上只是被少数几份合同托着一旦其中一份出现变化压力会立刻传导到整个资产负债表。4.2 芯片换代带来的“资产被动减值”GPU 云厂商手里最值钱的资产恰恰是最容易贬值的资产。新一代 GPU 推出后上一代产品的市场价值会快速下降。如果云厂商没有在价格高位收回足够现金那就等于用昂贵的代价持有了一堆快速老化的“算力房地产”。这个问题在普通云厂商里也存在但在英伟达系 GPU 云公司里更明显。因为它们强调“最新一代”“最高性能”客户愿意付溢价前提是硬件足够新。如果未来资源跟不上它们就只能降价出租老卡利润率也会随之回落。4.3 英伟达的扶持对象可以随时增加CoreWeave、Nebius 今天的竞争优势很大程度上来自英伟达的供给分配。这种“被选中”的地位不是永久合同。英伟达会根据市场情况调整伙伴名单也会在算力极度紧缺时优先保障更重要的客户。如果未来出现另一家更听话、扩张更快、或者更符合英伟达区域布局的 GPU 云厂商资源倾斜就有可能转移。对下游用户来说选供应商时也要意识到所谓“英伟达干儿子”的待遇随时可能被新的关系结构稀释。它不是稳定的技术壁垒而是一种供应链层面的优先级排序。4.4 高杠杆最怕的不是算力不值钱而是融资环境不配合GPU 云的成长高度依赖外部资本。买一万张卡动辄需要数十亿量级的资金建数据中心、部署网络和存储也需要持续投入。这类公司的资产负债表会快速膨胀负债率也不会低。在资本市场愿意为“高增长、高负债”买单时扩产非常顺滑一旦融资环境收缩投资者要求更多利润、更少烧钱GPU 云公司就会措手不及。过去很多失败的重资产故事并不是因为资产没有价值而是因为在扩张期撞上了资本收缩期。GPU 云厂商的脆弱性不只是算力卖不卖得出去的问题更是“扩张节奏是否和资本市场耐心匹配”的问题。4.5 软件与运营能力还没有形成真正的护城河目前很多 GPU 云厂商的价值一大半来自英伟达的生态。调度器、监控系统、计费工具、镜像管理甚至很多性能优化方案都来自开源社区和芯片厂商的基础支持。这意味着后来者只要买到同样的卡、凑齐同样的网络就有机会复制出一个看起来很相似的服务。真正能形成长期壁垒的是那些很难快速复制的东西多年运维积累下来的故障知识库、针对特定行业的数据合规能力、对大客户复杂训练流程的深度调优经验、以及跨地域稳定交付的工程体系。如果一家 GPU 云公司只停留在“买卡、出租、收钱”的阶段那么在下一轮周期里它很可能成为价格战中最先被挤压的一方。5. 落到实操AI 团队怎么在这个环境里做算力决策5.1 先分清训练、微调、推理三种需求再谈采购算力市场不是铁板一块。训练、微调、推理对 GPU 的要求完全不同对应的采购策略也不一样。大规模预训练通常需要数千张卡协同对节点间网络带宽要求极高而且任务时间长一旦中断损失很大。这种场景更适合签长期合约甚至可以和供应商联合定制集群配置但也要在合同中重点谈故障恢复、checkpoint 和退出机制。微调和实验通常只需要几张到几十张卡频率高、时间短对“随用随取”的要求高于价格锁定。这个场景更适合按需租用或使用闲时算力没必要一次绑太长时间。在线推理看重的是稳定性和延迟而且推理负载往往更容易迁移到不同硬件上。如果供应商提供的服务不稳定再便宜也不划算。好的做法是把推理服务和训练资源分开采购避免互相影响。5.2 用一张表评估 GPU 供应商而不是只看单价很多团队第一次选供应商时只看“每卡每小时多少钱”。这是最容易踩坑的方式。同样一张卡放在一个网络拥塞、存储慢、故障响应迟钝的环境里和你自己管理的机房里真实产出可以差出很多倍。下面这张表可以作为一个最小评估框架评估维度要重点确认的问题为什么它重要现货资源当前有没有对应型号交付要等多久决定你是下周能跑还是三个月后才能跑集群网络节点间互联带宽、延迟是否支持多卡 all-reduce直接决定分布式训练效率存储与出口数据读写是否计费备份和模型导出是否限速隐藏成本常常比 GPU 租金本身更贵故障与 SLA节点故障后多久响应任务中断是否有补偿机制长训练任务最怕无声无息地断掉财务健康度是否在持续扩产是否频繁调整服务条款你的长期训练计划可能押在对方生存能力上技术栈兼容是否兼容常见镜像、Kubernetes、Slurm决定未来迁移到其他平台的成本这份清单的核心逻辑是GPU 单价只是起点不是终点。你需要计算的是“从提交训练任务到拿到稳定结果”的全链路成本。5.3 把“可迁移性”做成默认基础设施如果在算力紧缺、供应商强势的环境里只能做一件事来降低风险我的建议是让你的训练流程不要被某一家 GPU 云厂商绑架。具体做法可以分成三层环境层要容器化。训练代码、依赖库、运行环境都打包成镜像镜像可以在不同厂商的集群间复用。数据层要独立。checkpoint 定期写入独立的对象存储不要只存在 GPU 云厂商自有的分布式文件系统里。这样即使集群立刻不可用你已经训练好的进度也不会一起丢失。调度层要标准化。优先使用开源的 Kubernetes 或 Slurm 方案避免使用供应商独有的封装接口。封装越深将来迁移的代价越大。这里想特别强调 checkpoint 的重要性。大模型训练动辄跑几周一旦中断且无法恢复损失不只是机时费还包括团队成员几周的等待。把“断点续跑”当成基础设施来做比任何供应商承诺都可靠。5.4 一个最小风险检查清单可以直接拿去用在签合同或大规模跑任务之前可以先按这个顺序做一轮验证小规模验收。先租两到四张卡建一个最小集群把镜像、数据读写、权限、日志全部跑通确认不是“账面上可用实际跑不动”。做一次故障演练。直接手动杀掉一个训练进程或者人为断开一个节点看看任务能否自动恢复checkpoint 是否能正常续跑。大多数供应商的问题在这个环节都会暴露。审视合同里的退出机制。确认如果提前终止会扣多少费用如果服务不可用是按时间补偿还是现金补偿如果供应商自己出现问题你是否能拿走全部数据。分层采购。把一部分任务放在长期合约里锁定稳定产能另一部分放在按需市场里保持灵活性。不要把所有训练任务都押在同一个合同和同一家供应商上。GPU 市场再紧张也不值得为了“能拿到卡”而放弃对服务稳定性和退出机制的审查。宁可少签一点也要把意外情况怎么处理写清楚。6. 回到那个问题还能笑多久6.1 三个变量决定这是一条慢牛还是一轮周期股要判断 CoreWeave、Nebius 这类英伟达系 GPU 云厂商还能风光多久不需要预测新闻只需要盯住三个变量。第一需求端增速是否依然陡峭。如果大模型训练和推理对高端 GPU 的需求继续以每年成倍的速度增长那么这些厂商手里的资产就会持续稀缺涨价和长约都能维持。一旦需求增速放缓或者低成本推理替代方案大量出现溢价就会很快消失。第二英伟达的生态策略是否延续。只要英伟达仍然需要一批能够快速消化新芯片、并且不会倒向自研路线的中间层CoreWeave、Nebius 在供应链里的优先级就会保持。如果英伟达开始重点扶持新的区域伙伴或更垂直的算力服务商旧有的“亲儿子”待遇就会被稀释。第三资本环境是否仍然愿意为高杠杆买单。GPU 云厂商的扩张节奏本质上是资本市场的风险偏好投影。市场愿意给确定性合同高估值时扩产顺风市场一旦转向要求利润、要求现金流高负债公司的所有扩张动作都会被放大审视。6.2 一年内会怎样三年内会怎样从很短的时间窗口看算力紧缺和价格上涨大概率还会延续。只要头部 AI 公司仍然在拼模型规模高端 GPU 的需求就不会断CoreWeave、Nebius 这类能拿到芯片、能快速交付的厂商也会继续拿到高价格合同和资本市场的关注。把时间拉到三五年局面就不会这么一边倒了。芯片供给会逐步跟上新一代产品会改变性价比结构部分客户的训练需求可能转向推理新的 GPU 云厂商也会不断出现。到那时单纯依靠“买最新卡、出租高价”的公司会同时面对三个挤压老卡贬值、客户压价、融资成本上升。最终留下来的大概率不是“买卡最多”的公司而是能把算力真正做成稳定服务、能在软件和运维层面帮客户省时间、并且有能力在芯片代际切换时平滑过渡的公司。GPU 是它们生意的地基但不能永远是唯一的故事。6.3 给所有旁观者和采购者的一句提醒对于只是盯着新闻看的人来说CoreWeave、Nebius 的故事很热闹新融资、新订单、涨价、扩产每一条都像是“AI 算力永远不够”的证据。但把镜头拉近你会看到它们每一个数字背后都有对应的债务、折旧和客户承诺。对于正在采购算力的人来说与其赌哪家供应商能赢到最后不如现在就开始做一件事把自己的训练流程做成可以在不同供应商之间迁移的标准产品。GPU 行情会变芯片代际会变资本市场的偏好也会变唯一不变的是能把算力当成可编排、可迁移资源来管理的团队永远拥有更大的选择余地。厂商能风光多久不是由新闻热度决定的而是由“能不能在高价窗口期攒下真正的能力”决定的。对个人和团队也一样在一轮算力红利里真正值得积累的不是签下一份高价长约而是把模型训练、数据管理和集群运维变成别人拿不走的本事。