Yiek Heng 的知识空间
首页芯片封装AI 芯片与前沿基础概念
AI 芯片与前沿

AI 芯片撞上的三堵墙

光罩极限、大芯片良率、内存墙:为什么单靠缩小晶体管已经不够,AI 芯片必须靠先进封装。

它为什么诞生

为什么需要 CoWoS:AI 芯片撞上的三堵墙

如果芯片能无限变大、内存能无限快,就不需要 CoWoS。可惜现实里有三堵墙。

墙一:光罩极限,芯片不能想做多大就做多大

芯片是用光刻机“印”出来的,像盖章一样。这个章的最大尺寸叫光罩极限(reticle limit),大约 26 mm × 33 mm = 858 mm²。单颗芯片不可能比这个章更大。

NVIDIA H100 的裸片是 814 mm²,已经顶到天花板了。AI 还要更多算力,怎么办?

814 mm² H100:几乎填满 虚线框 = 光罩 858 mm² 印不出来 想要 1700 mm² 的芯片? 超出光罩的部分无法曝光 高速桥 办法:分开印,再“拼”起来 B200 就是这么做的
← 左右滑动看全图 →
“拼”的那一步,需要一种能把两颗芯片之间连上上万根线的东西。普通基板做不到,这就引出了中介层。

墙二:大芯片良率低,越大越容易废

晶圆在制造过程中会随机落下一些微小缺陷(灰尘、杂质)。一颗芯片上只要有一个缺陷,往往就整颗报废。芯片越大,被“砸中”的概率越高。

SiP 一页的晶圆小实验已经演示过:同样的缺陷,切成大芯片报废得多,切成小芯片浪费得少。这就是 Chiplet(芯粒) 思路:把一颗大芯片拆成几颗小芯片分别制造、挑出好的,再用封装把它们拼回去。前提是“拼回去”时,小芯片之间的连线要足够多、足够快,几乎像在同一颗芯片里一样。

墙三:内存墙,算力在等数据

AI 模型的参数动辄几千亿个,GPU 每算一步都要从内存里读海量数据。过去 20 年,芯片的算力增长了上万倍,而内存的带宽只增长了几十到上百倍。结果就是 GPU 大部分时间在“等菜”,而不是在“炒菜”。

想让数据跑得更快,有两个办法:修更多车道(更多根数据线),缩短距离(内存放得更近)。传统主板两样都做不到。

传统显卡:GDDR 在主板上 GPU 每颗显存 32 根数据线 · 距离 1–3 厘米 一颗 GDDR6X ≈ 84 GB/s CoWoS:HBM 贴着 GPU 放 GPU HBMHBMHBMHBM 每堆 1024 根(HBM4:2048 根) · 距离 <1 毫米 一堆 HBM3E ≈ 1.2 TB/s,HBM4 ≈ 2 TB/s 以上 单堆带宽 ≈ GDDR 的 15–30 倍
← 左右滑动看全图 →
HBM(高带宽内存)是把 8–16 层 DRAM 叠成一摞,底部伸出一千多根数据线。这么多线,主板和普通基板都接不住,只有硅中介层能接。所以:要用 HBM,就几乎必须用 CoWoS 这类 2.5D 封装。
图中尺寸除特别说明外均为示意,不按真实比例。年份与数值为行业常见说法或公开报道,具体以厂商资料为准。 内容更新至 2026-10。