Yiek Heng 的知识空间
首页芯片封装先进封装 2.5D / 3D快速增长诞生:2013 标准 / 2015 量产
先进封装 2.5D / 3D

HBM:贴着 GPU 放的摩天楼内存

把 DRAM 叠成一栋楼,用 TSV 穿起来。宽而慢胜过窄而快,从第一代 HBM 一路讲到 HBM4E。

原理与演进

HBM:贴着 GPU 放的“摩天楼内存”

前面一直提到 HBM,这一页把它拆开讲。没有 HBM,CoWoS 就没那么重要;没有 CoWoS,HBM 也没地方放。两者是一起火起来的。

原理一:把内存芯片叠成一栋楼

普通内存(DDR、GDDR)是一颗颗平铺在主板上的。HBM 把 8 到 16 片 DRAM 芯片垂直叠起来,每片磨薄到几十微米,用几千根 TSV 竖着穿透所有楼层,最底下垫一片底层逻辑芯片(base die)负责对外接口。

HBM 剖面:一栋 8 层的内存楼
GPU 底层逻辑芯片 DRAM 芯片 × 8(最多 16 层) 每层磨薄到约 30–50 µm TSV:上千根垂直铜柱 像电梯井一样贯穿所有楼层 层间微凸块 + 填充材料 MR-MUF(海力士)/ TC-NCF(三星、美光) 底层逻辑芯片 接口电路、测试;HBM4 起用台积电逻辑工艺 中介层里的短线连到 GPU(约几毫米)
← 左右滑动看全图 →
整栋楼的总高度被标准限制在 1 毫米以内(HBM4 为 775 µm),所以层数越多,每层就要磨得越薄。层数、厚度、散热三者互相打架,是 HBM 最难的地方。

原理二:宽而慢,胜过窄而快

GDDR 走的是“少车道、开快车”:每颗只有 32 根数据线,但每根跑到 20–30 Gbps。HBM 反过来,“多车道、开慢车”:每堆 1024 根(HBM4 是 2048 根),每根只跑 6–10 Gbps。

开慢车的好处是电路简单、省电、发热少。总带宽靠车道数堆上去。代价是车道太多,只有中介层接得住,所以 HBM 必须跟 CoWoS 这类封装绑在一起。

打个比方

GDDR 像一条 2 车道的赛车道,车速 300 公里每小时;HBM 像一条 64 车道的城市大道,限速 80。同样一小时,大道运走的车多得多,而且没人需要买赛车。

发展历程:十年带宽涨了 20 倍

单堆 HBM 带宽(GB/s)
HBM4 的 JEDEC 标准是 2 TB/s,NVIDIA 要求厂商跑得更快,误差线是厂商公布的上限。HBM4E 为预测值。
代际量产位宽每针速率单堆带宽层数 / 容量代表产品
HBM201510241 Gbps128 GB/s4 层 / 1 GBAMD Fury X
HBM2201610242 Gbps256 GB/s8 层 / 8 GBP100、V100
HBM2E202010243.2–3.6 Gbps~460 GB/s8 层 / 16 GBA100
HBM3202210246.4 Gbps819 GB/s12 层 / 24 GBH100
HBM3E202410249.2–9.8 Gbps~1.2 TB/s12 层 / 36 GBH200、B200、MI325X
HBM4202620488 Gbps(标准)~11(厂商)2–2.8 TB/s12–16 层 / 最高 64 GBRubin、MI450
HBM4E~20272048更高3 TB/s 以上(预测)16 层以上定制底层芯片

HBM 的四个痛点

  • 贵、吃产能:同样容量的 HBM 大约要消耗 DDR5 三倍的晶圆面积(die 更大、TSV 占地、堆叠良率损失)。2025–2026 年 HBM 大量挤占 DRAM 产能,连普通内存都跟着涨价。
  • 散热:热从底层一路往上传,要穿过十几层芯片和填充材料,中间层最热。HBM 又紧挨着 1–2 kW 的 GPU。
  • 测试难:16 层叠完才发现某一层坏了,整栋楼报废。所以每层都要先测,堆叠工艺的良率决定成本。
  • 只有三家能做:SK 海力士领先,三星和美光追赶。任何一家出问题,全球 AI 芯片出货都会受影响。

下一步:底层芯片变成“可定制”

从 HBM4 开始,最底下那片逻辑芯片改由台积电等晶圆厂用先进逻辑工艺制造。这意味着客户可以在 HBM 里放自己的电路,比如部分内存控制、数据压缩,甚至简单计算。再往后,层间连接会从微凸块改成混合键合,楼可以盖得更高、更薄、更凉。HBM 正在从“标准零件”变成“为每颗 GPU 量身定做的一部分”。

图中尺寸除特别说明外均为示意,不按真实比例。年份与数值为行业常见说法或公开报道,具体以厂商资料为准。 内容更新至 2026-10。