先进封装 2.5D / 3D
HBM:贴着 GPU 放的摩天楼内存
把 DRAM 叠成一栋楼,用 TSV 穿起来。宽而慢胜过窄而快,从第一代 HBM 一路讲到 HBM4E。
原理与演进
HBM:贴着 GPU 放的“摩天楼内存”
前面一直提到 HBM,这一页把它拆开讲。没有 HBM,CoWoS 就没那么重要;没有 CoWoS,HBM 也没地方放。两者是一起火起来的。
原理一:把内存芯片叠成一栋楼
普通内存(DDR、GDDR)是一颗颗平铺在主板上的。HBM 把 8 到 16 片 DRAM 芯片垂直叠起来,每片磨薄到几十微米,用几千根 TSV 竖着穿透所有楼层,最底下垫一片底层逻辑芯片(base die)负责对外接口。
HBM 剖面:一栋 8 层的内存楼
← 左右滑动看全图 →
原理二:宽而慢,胜过窄而快
GDDR 走的是“少车道、开快车”:每颗只有 32 根数据线,但每根跑到 20–30 Gbps。HBM 反过来,“多车道、开慢车”:每堆 1024 根(HBM4 是 2048 根),每根只跑 6–10 Gbps。
开慢车的好处是电路简单、省电、发热少。总带宽靠车道数堆上去。代价是车道太多,只有中介层接得住,所以 HBM 必须跟 CoWoS 这类封装绑在一起。
打个比方
GDDR 像一条 2 车道的赛车道,车速 300 公里每小时;HBM 像一条 64 车道的城市大道,限速 80。同样一小时,大道运走的车多得多,而且没人需要买赛车。
发展历程:十年带宽涨了 20 倍
单堆 HBM 带宽(GB/s)
| 代际 | 量产 | 位宽 | 每针速率 | 单堆带宽 | 层数 / 容量 | 代表产品 |
|---|---|---|---|---|---|---|
| HBM | 2015 | 1024 | 1 Gbps | 128 GB/s | 4 层 / 1 GB | AMD Fury X |
| HBM2 | 2016 | 1024 | 2 Gbps | 256 GB/s | 8 层 / 8 GB | P100、V100 |
| HBM2E | 2020 | 1024 | 3.2–3.6 Gbps | ~460 GB/s | 8 层 / 16 GB | A100 |
| HBM3 | 2022 | 1024 | 6.4 Gbps | 819 GB/s | 12 层 / 24 GB | H100 |
| HBM3E | 2024 | 1024 | 9.2–9.8 Gbps | ~1.2 TB/s | 12 层 / 36 GB | H200、B200、MI325X |
| HBM4 | 2026 | 2048 | 8 Gbps(标准)~11(厂商) | 2–2.8 TB/s | 12–16 层 / 最高 64 GB | Rubin、MI450 |
| HBM4E | ~2027 | 2048 | 更高 | 3 TB/s 以上(预测) | 16 层以上 | 定制底层芯片 |
HBM 的四个痛点
- 贵、吃产能:同样容量的 HBM 大约要消耗 DDR5 三倍的晶圆面积(die 更大、TSV 占地、堆叠良率损失)。2025–2026 年 HBM 大量挤占 DRAM 产能,连普通内存都跟着涨价。
- 散热:热从底层一路往上传,要穿过十几层芯片和填充材料,中间层最热。HBM 又紧挨着 1–2 kW 的 GPU。
- 测试难:16 层叠完才发现某一层坏了,整栋楼报废。所以每层都要先测,堆叠工艺的良率决定成本。
- 只有三家能做:SK 海力士领先,三星和美光追赶。任何一家出问题,全球 AI 芯片出货都会受影响。
下一步:底层芯片变成“可定制”
从 HBM4 开始,最底下那片逻辑芯片改由台积电等晶圆厂用先进逻辑工艺制造。这意味着客户可以在 HBM 里放自己的电路,比如部分内存控制、数据压缩,甚至简单计算。再往后,层间连接会从微凸块改成混合键合,楼可以盖得更高、更薄、更凉。HBM 正在从“标准零件”变成“为每颗 GPU 量身定做的一部分”。