IIIa. Racing to the Trillion-Dollar Cluster — 数字深挖
来源:situational-awareness.ai(2024-06),正文见 03a-trillion-dollar-cluster.md。对照截至 2026-07 的公开事实。
1. 一句话总结
作者用一条可验证的链条论证 2030 年前美国会出现万亿美元级 AI 工业动员:训练算力 +0.5 OOM/年 → 单集群成本每 2 年 ×10 → 总投资 ×2/年 → 收入翻倍验证。核心判断:电力才是最终瓶颈。
2. 数字地图
2.1 最大训练集群(假设 0.5 OOM/年)
| 年份 | OOM | H100 等效 | 集群成本 | 电力 | 电力参照系 |
|---|---|---|---|---|---|
| 2022 | 基线 | ~10k | ~$500M | ~10 MW | 1 万户家庭 |
| ~2024 | +1 | ~100k | ~$10 亿级 | ~100 MW | 10 万户家庭 |
| ~2026 | +2 | ~1M | ~$100 亿级 | ~1 GW | 胡佛大坝/大型核反应堆 |
| ~2028 | +3 | ~10M | ~$1000 亿级 | ~10 GW | 美国一个中小州 |
| ~2030 | +4 | ~100M | $1T+ | ~100 GW | >20% 美国发电量 |
2.2 全球 AI 总投资(假设 ×2/年,慢于最大集群 ×3/年)
| 年份 | 年投资 | H100 等效出货 | 耗电占美国发电 % | 占 TSMC 领先制程产能 % |
|---|---|---|---|---|
| 2024 | ~$150B | ~5–10M | 1–2% | 5–10% |
| ~2026 | ~$500B | 数千万 | 5% | ~25% |
| ~2028 | ~$2T | ~100M | 20% | ~100% |
| ~2030 | ~$8T | 数亿 | 100% | 4× 当前 |
3. 计算链拆解
3.1 集群成本链($500M → $1T)
2022 基线: 25k A100 (Semianalysis/JP Morgan 估算) ≈ 10k H100 等效 (H100 ≈ 2–3× A100)
$1/A100-hour × 2–3 年 ≈ $500M ← 注意: 是"建集群"成本而非"租 3 个月训练"成本
(GPU 约占集群总成本 ~40–50%; Nvidia GPU+网络 ≈ 60%+)
2022→2030: +4 OOM = 10000× 算力
FLOP/$ 改善假设 ~35%/年 × 8 年 ≈ 10×
成本增长 ≈ 10000× / 10× ≈ 1000× → $500M × 1000 ≈ $500B–1T ✓
隐含假设: FLOP/$ 每年只改善 ~35% (Epoch 数据显示过去 10 年 <10× → ~26%/年, 与 35% 同量级)
→ 即作者认为芯片效率改善远跟不上算力扩张
3.2 电力链(1M H100 → 100 GW)
单 H100: 700W (芯片) + 冷却/网络/存储 ≈ Semianalysis 估 1,400W → 作者取整 1 kW/H100 等效
100M H100: 100M × 1kW = 100 GW
100 GW × 8760h = 876 TWh/年 vs 美国总发电 ~4,250 TWh ≈ 20.6% ✓
天然气可行性: Marcellus/Utica 日产 36 Bcf → ~150 GW 连续发电 (简单循环) / ~250 GW (联合循环)
100 GW 需 ~1,200 新井; 40 个钻机 (2019 年该地区曾有 80 个) 可在 <1 年建成
燃气电厂 capex <$1,000/kW → 100 GW ≈ $100B
3.3 芯片链(TSMC 产能)
2024: 5–10M H100 等效 ≈ 150k–300k wafer/年 ≈ TSMC 领先产能的 3–10%
(TSMC ~400k wafer/月 总领先产能; 35 H100/wafer)
2030: 总 AI 芯片需求 = TSMC 当前总领先产能的数倍 → 需 4× 当前产能
Gigafab: $20B/座, 100k wafer-starts/月 → 需几十座 → >$1T fab capex
瓶颈排序: CoWoS 先进封装 + HBM 内存 > 逻辑晶圆 (作者 2024 年中判断, 与后来事实一致)
3.4 收入验证链(投资能否自我循环)
OpenAI ARR: 2023.8 $1B → 2024.2 $2B (每 6 个月翻倍)
外推: 2024 底/2025 初 ~$10B → 2026 年中大科技 AI 收入 $100B
$100B 路径: 350M Office 订阅 × 1/3 × $100/月 ≈ $140B/年 (仅微软一家 AI 附加费潜力)
核心逻辑: "每一轮 10× 投资都产生了相应回报" → 投资领先收入 (investment-led), 集群建设提前数年
3.5 历史参照:3% GDP 不算空前
| 参照 | 规模 | 换算到今天 |
|---|---|---|
| 曼哈顿 + 阿波罗峰值 | 0.4% GDP | ~$100B/年 |
| 1996–2001 电信泡沫 | ~$1T | ~$1T |
| 1841–1850 英国铁路 | 累计 ~40% GDP | ~$11T/十年 |
| 中国投资率 (20 年) | 40%+ GDP | ~$11T/年 |
| 二战美国举债 | 60%+ GDP | ~$17T |
| 作者预测: 2027 年 AI 投资 | ~3% GDP | ~$1T/年 |
4. 隐含假设与敏感性
| # | 假设 | 脆弱度 | 若失效应 |
|---|---|---|---|
| A | 训练算力 +0.5 OOM/年延续到 2030 | 中 | 集群表整体右移/降档 |
| B | FLOP/$ 仅 ~35%/年改善(芯片效率跟不上算力) | 中低 | 更高 FLOP/$ → 更便宜集群(作者自己说 ±0.5 OOM 误差) |
| C | 总投资 ×2/年($150B→$8T) | 高 | $8T ≈ 美国 GDP 的 |
| D | 电力可以靠天然气快速解锁(须绕开环保承诺/许可) | 中高 | 集群被迫出海(中东)——作者视此为安全灾难 |
| E | AI 收入每 6 个月翻倍 → $100B/2026 年中 | 中 | 收入是投资循环的燃料;若滞后期拉长,capex 先行为主 |
| F | 全部产能只服务少数玩家(集中度假设) | 低 | 集群表是"最大单一集群",总投资表已含多玩家 |
最脆弱项排序:C($8T 总投资)> E(收入翻倍斜率)> A(0.5 OOM 趋势)。A 是作者整系列的外推基石;C 的终值是最大胆的。
5. 事后验证台账(2024-06 → 2026-07)
| 预测 | 预测值 | 现实 (2026-07) | 判定 |
|---|---|---|---|
| Nvidia CY25 收入 >$200B("主流卖方只给 $120–130B 很疯狂") | 2024.6 被嘲笑 | CY25 数据中心收入 ~$200B+ | 兑现 |
| 2024 年 AI 总投资 ~$150B | 2024 | 四大云 capex 合计 ~$220–260B(AI 占大头) | 量级一致(略偏保守) |
| "电力是最大约束,不是芯片" | — | 2025–26 数据中心电力紧缺成为行业共识;GE Vernova 燃气轮机订单爆炸、核电(OKLO/VST/CEG/TLN)大涨;EIA/公用事业大幅上调需求预测 | 兑现 |
| 2026 年 ~1M H100 等效 / $100 亿级集群 | ~2026 | Stargate 一期($500B 总盘, 2025.1 宣布)在德克萨斯开建;2025 年 GPT-5 级训练 run 已达 ~$500M–1B 成本量级 | 轨道吻合(形态从"单集群"变成"园区化") |
| Microsoft/OpenAI $100B 集群 (2028) | 2028 | Stargate 总盘 $500B;微软-OpenAI 2025 年拆分原 $100B 协议,各自扩张 | 金额级更大但项目形态改变 |
| 2026 年中大科技 AI 收入 $100B run rate | 2026 | 微软 AI 收入(Azure AI+OpenAI)~$20–30B/年,谷歌 Cloud AI ~$10–20B/年;合计 ~$40–60B | 方向对、约晚 6–12 个月 |
| 2030: $1T 单集群 / $8T 总投资 | 2030 | 未到验证点;投行共识 2030 美国 AI capex ~$500B–1T/年(Goldman 等),方向一致 | 未验证 |
| "把 AGI 数据中心赶到中东"的担忧 | — | 沙特/阿联酋 (G42) 大额算力订单确实出现 | 部分发生(未到"决定性"程度) |
6. 投资框架:可跟踪的领先指标(leading indicators)
该章给出了一条可证伪的投资信号链,按先行度排序:
① 电力: 电网互连队列 (EIA-860)、公用事业 5 年负荷预测修订、GEV 燃气轮机订单、核电 SMR 订单
→ 先行 2–4 年 (集群建设期), 目前最强信号
② 芯片: TSMC CoWoS/HBM 产能、Nvidia 数据中心收入 vs 卖方预期、设备 (ASML/AMAT) 订单
→ 先行 1–2 年
③ 集群: 最大训练 run 的规模 (每年是否 ~+0.5 OOM)、Stargate 类项目实际开工进度
→ 验证 0.5 OOM/年 假设
④ 收入: OpenAI/微软/谷歌 AI 收入翻倍斜率 (每 6 个月是否 ~2×)
→ 最滞后, 但决定投资循环能否自我维持
核心交易含义(作者原话):"NVDA/TSM 还没 fully priced in"(2024.6),事后看成立。落到 2026 年:沿着信号链找"尚未定价"的环节。电力(审批/燃气轮机/核电)信号最强但已被市场部分发现;若认为 0.5 OOM 趋势延续,"芯片→集群→收入"链上每次卖方预期滞后都是同一类错误的重演。
7. 结论
- 该章最强的两个判断(电力瓶颈、Nvidia 收入预测)在 2025–26 年被市场验证,且都偏离当时主流卖方预期。
- 最弱的两环是 $8T 总投资终值(依赖 2×/年外推到 2030)和 $100B 收入里程碑时点:前者尚无法证伪,后者已确认偏乐观约一年。