芯粒互连:SerDes 与 UCIe
芯片之间怎么“说话”:并行与串行、PAM4、每比特能耗,以及芯粒之间的“通用 USB 口”UCIe。
SerDes 与 UCIe:芯片之间怎么“说话”
CoWoS 提供了路,HBM 是路上最重要的邻居。但路上跑什么样的“车”,要靠接口协议决定。这一页讲两种最重要的:用来跑长途的 SerDes,以及专门为封装内短途设计的 UCIe。
先分清:并行和串行
传数据有两种思路。并行是很多根线同时传,每根慢一点;串行是把数据排成一队,从一两根线上高速传过去。
选哪种,取决于线贵不贵。在中介层上,线又细又短又便宜,就用并行(HBM、UCIe 都是);在主板和电缆上,每根线都占空间、都会衰减,就用串行。把并行转成串行、再转回来的电路,就是 SerDes(Serializer / Deserializer,串行器/解串器)。
SerDes 怎么越跑越快:PAM4
传统信号只有高、低两个电平,一个符号代表 1 bit(叫 NRZ)。现在主流的 PAM4 用四个电平,一个符号代表 2 bit,同样的频率速度翻倍。代价是电平之间的距离只剩三分之一,更怕噪声,所以要加纠错码(FEC),会多出延迟和功耗。
SerDes 的问题:贵在电、贵在面积
高速 SerDes 要做均衡、时钟恢复、纠错,电路复杂。每传 1 bit 大约花 5 皮焦(pJ),是封装内并行接口的十几倍;它还占芯片边缘宝贵的面积,并带来几十到上百纳秒的延迟。如果两颗芯片已经在同一个 CoWoS 封装里,距离只有一两毫米,再用 SerDes 就太浪费了。
UCIe:芯片之间的“通用 USB 口”
Chiplet 时代,每家都有自己的芯片间接口:NVIDIA 的 NV-HBI、AMD 的 Infinity Fabric、苹果的 UltraFusion。互不兼容,A 公司的芯粒没法和 B 公司的拼在一起。
2022 年 3 月,Intel、AMD、Arm、台积电、三星、日月光、Google、Meta、微软、高通等联合发布 UCIe(Universal Chiplet Interconnect Express,通用芯粒互连)。目标是让芯粒像乐高积木一样,不同厂家、不同工艺做的都能拼在一起。
一张图看懂:距离越远,传 1 bit 越费电
把芯片之间的各种连接按距离排一排,就能看出先进封装的价值:能放进同一个封装的,绝不拉到外面去。
| SerDes(长距) | UCIe 先进封装 | 厂商私有 D2D | HBM 接口 | |
|---|---|---|---|---|
| 典型距离 | 10 cm – 数米 | ≤ 2 mm | ≤ 几 mm | 几 mm |
| 方式 | 串行,PAM4 | 并行,宽而慢 | 并行 | 并行,1024/2048 位 |
| 能耗 | ~5 pJ/bit | ~0.3–0.5 pJ/bit | 同量级或更低 | 每 bit 数 pJ(含 DRAM 读取) |
| 用在哪 | NVLink、PCIe、以太网 | 开放芯粒生态、定制 ASIC | NV-HBI(B200)、Infinity Fabric | GPU ↔ 内存 |
| 依赖 CoWoS 吗 | 不需要 | 先进模式需要 | 需要 | 需要 |
把三章串起来:CoWoS 提供了大量又短又细的线,所以芯片之间可以用“宽而慢”的并行接口(HBM、UCIe、NV-HBI)说话,省掉 SerDes 的功耗和延迟。只有必须离开封装时,才动用 SerDes,以及未来的光。
UCIe 的现实:标准很热闹,但截至 2026 年,NVIDIA、AMD 的旗舰芯片仍用自家私有接口,因为私有接口能针对自己的产品压榨到极限。UCIe 更多出现在定制 ASIC 和 IP 授权市场(新思、Cadence 等提供 UCIe IP)。我的预期是:2028 年以后,随着 HBM 底层芯片可定制、第三方芯粒增多,UCIe(尤其 3D 版)会成为“不同公司的芯粒拼在一起”的默认语言。