观点

内存涨价 500%,AI 公司算的那笔账全废了

12 个月内存价格翻 5 倍,摩尔定律倒退回 2007 年。靠堆 GPU 跑模型的那套逻辑,现在开始算不过来账了。

内存涨价 500%,AI 公司算的那笔账全废了

数据来源:Latent Space《Memory prices up 500% in 12 months》

链接:https://www.latent.space/p/ainews-memory-prices-up-500-in-12

500% 不是夸张,是 Spot Price

我看到这个数字的时候,第一反应是查一下来源有没有标错单位。

没标错。Latent Space 援引的现货市场数据:DRAM 和 NAND 闪存过去 12 个月涨了 500%。现货价,spot price,不是期货预期,不是分析师预测,是上周成交的价格。

更扎心的对比是性能/价格比。照这个趋势下去,今年年底的内存性价比会倒退回 2007 年的水平。2007 年,第一代 iPhone 发布那年。

存储这个品类,过去十几年一直在用摩尔定律悄悄变便宜。没人觉得它会变贵。也没人在算 TCO 的时候把它当成主要变量。

现在得重新算了。

为什么偏偏是现在炸

内存涨价不稀奇,每隔几年就来一轮。但这一轮的烈度不一样。三股力量撞在了一起。

第一股,HBM 在抢产能。HBM(高带宽内存)是给 AI 加速卡配的,每张 H100/H200/B200 都要带几组 HBM3e。HBM 用的是先进封装和更复杂的 Die Stacking 工艺,占用的晶圆产能是普通 DRAM 的 3 倍。同一条产线,做 HBM 就不能做 DDR5。三大原厂全在把普通 DRAM 产线切给 HBM,DDR5 供给被抽走,价格先涨。

第二股,AI Capex 周期到了。OpenAI、Anthropic、Meta、Google 全在扩集群。xAI 那个 10 万卡集群已经上线了,OpenAI 的 Stargate 计划砸下 1.8 万亿美金。这些集群每张卡都要带 80GB 甚至 192GB HBM,需求是真实存在的。

第三股,三大原厂集体控产。Samsung、SK Hynix、Micron 这两年默契控产,资本开支砍了又砍,产能扩张被刻意压住。供给曲线被人为压平了。

HBM3e 和 HBM4 的产能,优先锁给 Nvidia 和那几个大客户。中小买家排队也排不到。这不是周期波动,是结构性短缺。

堆 GPU 那套经济模型塌了

过去两年,AI 公司算训练成本有个简化模型:

总成本 ≈ GPU 采购 + 电费 + 机房 + 散热

内存被当成 GPU 的附件,含在硬件成本里,权重不大。

现在这个模型算不动了。HBM 在 AI 训练硬件成本里占比从大约 20% 涨到接近 40%。一张 B200 光 HBM 就吃掉上万美金,物料成本(BOM)结构完全变了。

更麻烦的是带宽墙。GPU 算力每一代翻倍,但 HBM 带宽跟不上。模型推理时,参数要从内存搬运到计算单元,带宽不够,GPU 就空转。Nvidia 在 GTC 2025 上自己都承认,B200 在很多推理 workload 上跑不满峰值 FLOPS,原因就是 HBM 带宽成为瓶颈。

OpenAI、Anthropic 这种级别的玩家,TCO 表格这几个月推倒重做了好几轮。Anthropic CEO Dario Amodei 之前发过一张图,说训练一个前沿模型的成本已经涨到 10 亿美金级别。这还是没算最新这轮内存涨价的数字。

MoE 架构的真正价值现在才显出来:参数总量可以很大,但每次推理只激活一小部分,正好对冲了内存单价上涨。这是 MoE 在 2024 年以后被所有玩家押注的根本原因。

MoE 和稀疏化反而成了救命稻草

说个反直觉的事:这轮内存涨价,MoE 模型反而占了便宜。

传统 Dense 模型,70B 参数就是 70B 参数,每次推理全量加载,需要的显存是固定死的。DeepSeek-V3 671B 的总参数看着吓人,但它用了 MoE 架构,每次推理只激活 37B,约 5.5%。Mixtral 8x7B 同理,激活比例 12.5%。

这意味着同样的硬件,可以服务更多用户,或者同样用户数下,硬件投资直接砍掉一半以上。DeepSeek 自己披露的 V3 训练成本是 558 万美金,对比 Llama 3.1 405B 训练成本据估算接近 1 亿美金。同等能力,成本差两个数量级。

核心逻辑是这样的:

Dense 模型:硬件成本 ∝ 总参数量
MoE 模型:硬件成本 ∝ 激活参数量,与总参数量弱相关

内存越贵,MoE 的相对优势越大。这就是为什么 Nvidia 自己都在推 Minitron 之类的稀疏化方案,连硬件厂都在用软件对冲硬件瓶颈。

谁会被挤出局

不是只有巨头才受影响。

中小模型公司:自己训模型、卖 API 的那种,硬件成本突然从可选项变成最大支出项。融资节奏跟不上价格涨幅的,要么涨价,要么关停。

自己搭集群的 startup:以为搞定 GPU 就能搞定一切,没意识到 GPU 现在是整套系统里最不紧缺的那个环节。

推理服务毛利率薄的应用层:Bot、Agent、垂直场景应用,全都是靠低单价、高并发起家。内存涨价直接吃掉毛利。一个 chat session 之前毛利 30%,可能跌到 10% 以下。

Anthropic 那种级别可以靠提高客单价摊薄,Cursor 这种可以把成本转嫁给开发者。但中小玩家没这个定价权。

下一个 12 个月看什么

三个变量决定这轮涨价是 6 个月还是 3 年。

HBM4 产能。 SK Hynix 和 Samsung 在抢 HBM4 量产首发,Micron 也不落后。HBM4 单 stack 容量从 24GB 升到 36-48GB,带宽翻倍。如果产能爬坡顺利,2025 年底 HBM 单 GB 成本会下来,缓解但不会逆转趋势。

国产 DRAM 扩产。 长鑫存储(CXMT)DDR5 产能 2025 年扩到 6 万片 wafer/月,长江存储(YMTC)在 NAND 这边也加了 3D NAND 产线。如果他们能稳定供货,会成为全球供给侧的真实变量。问题是先进制程良率和良率稳定性,目前和三大原厂还有 1-2 代差距。

ASIC 替代速度。 Google TPU、AWS Trainium、Microsoft Maia 这些专用芯片,内存子系统是自己定义的,不受 HBM 通用市场影响。如果 ASIC 路线跑通,Nvidia 通用 GPU 的定价权会被削弱,间接影响 HBM 议价。

我的判断是:这轮内存涨价的尾部,至少持续到 2025 年 Q4。如果是 HBM4 顺利 + 国产产能跟上 + ASIC 起量,三个条件全中,2026 年中可能见顶回落。任何两个不达预期,会拖到 2027 年。

AI 公司过去两年习惯了"算力越来越便宜"这个隐性前提。这个前提没了。

以后再算 TCO,内存会是表格里最大的一行。

来源: https://www.latent.space/p/ainews-memory-prices-up-500-in-12