AMD 路线·从 Zen 到芯粒帝国
2015 年,AMD 一年只卖了约 40 亿美元,股价一度跌到 2 美元以下。十年后,它的服务器 CPU 据报道拿下了约四成营收份额。这一页讲清楚:Zen 是怎么从零做出来的,为什么 AMD 要把一颗 CPU 切成好几块“芯粒”,3D V-Cache 为什么让游戏变快,以及这条路的代价是什么。
推土机之后,AMD 差点撑不下去
Zen 不是一次普通的升级,它是一家公司押上全部身家的翻身仗。
2011 年,AMD 推出了“推土机”(Bulldozer)架构。它的思路是:两个整数核心共用一套前端和浮点单元,用“核心数多”来对抗 Intel。结果单线程性能弱、功耗高,在 Intel 的 Sandy Bridge 面前全面落下风(详见 走进死胡同的路线)。之后几年的改良版(打桩机、压路机、挖掘机)也没能翻身。
钱很快烧光了。AMD 在 2009 年已经把自己的晶圆厂分拆成格罗方德(GlobalFoundries),2012 年又卖掉了总部大楼再租回来。2015 年营收跌到约 40 亿美元,比 2011 年少了近四成。
转机来自两个人。2012 年,传奇芯片设计师吉姆·凯勒(Jim Keller)回到 AMD,牵头一个全新的 CPU 架构,代号 Zen,首席架构师是迈克·克拉克(Mike Clark)。2014 年 10 月,苏姿丰(Lisa Su)出任 CEO。她砍掉了分散的项目,把赌注压在两件事上:高性能 CPU 和 GPU。Zen 就是那张最大的牌。
- 12011 推土机:FX 处理器发布,单线程性能不如上一代。
- 22012 凯勒回归:Zen 项目启动,从零设计。
- 32014 苏姿丰上任:公司聚焦高性能计算。
- 42017 Zen:Ryzen 与 EPYC 上市,营收止跌。
- 52019 Zen 2:芯粒设计,服务器份额开始快速上涨。
- 62022 收购赛灵思:营收跳涨,也开始做 AI 加速器。
Zen:4 核一簇,再用“无限总线”连起来
一种芯片,既做桌面 8 核,又拼成服务器 32 核。
2017 年 3 月,第一代 Ryzen(锐龙)桌面处理器上市;6 月,服务器版 EPYC(霄龙)上市。AMD 宣称 Zen 的 IPC(每个时钟周期能完成的指令数,可以理解成“每一拍干多少活”)比上一代挖掘机高约 52%。几个关键设计:
- CCX(CPU Complex,核心簇):4 个核心组成一簇,共享一块 8 MB 的三级缓存(L3)。缓存是芯片里的“小冰箱”,常用的数据放在手边,不用每次跑去远处的内存(大仓库)取。
- SMT(同时多线程):一个核心可以同时跑两个线程(两条任务),让闲着的执行单元也干上活。这是 AMD 第一次在主流 CPU 上做 SMT。
- Infinity Fabric(无限总线):AMD 自己的片内和片间互连。它连接两个 CCX、内存控制器和输入输出接口,也能跨芯片连接。
一颗 Zen 芯片代号 Zeppelin,约 213 mm²,在格罗方德 14 nm 工艺上生产,里面有 2 个 CCX,共 8 核。聪明的地方在于:服务器 EPYC 不另做大芯片,而是把 4 颗同样的 Zeppelin 装进一个封装,得到 32 核。这一步是后来芯粒路线的雏形。
- 1CCX:4 个核心一簇。每个核心有自己的 L1、L2 缓存。
- 2L3 缓存:一簇 4 核共享 8 MB。另一簇的数据要绕远路才能拿到。
- 3无限总线:芯片内部的“高速公路”,连接两个 CCX 和外设。
- 4内存与输入输出:每颗芯片自带 2 个内存通道和一组 PCIe。
- 5多芯片封装:4 颗相同的芯片拼成 32 核服务器 CPU,每颗之间都直连。
Zen 一代解决了什么
- 单线程性能大幅追上 Intel,8 核桌面价格只有对手 8 核的约一半。
- 一种芯片覆盖桌面、工作站、服务器,设计和流片成本大大降低。
- 插槽 AM4 用了很多年,老主板能升级新 CPU。
它的缺陷
- 两个 CCX 之间、四颗芯片之间通信慢,延迟忽高忽低。
- EPYC 一代的内存分散在四颗芯片上,软件要“懂”这种结构才跑得好(NUMA,非一致内存访问)。
- 频率不如 Intel 高,游戏帧数仍落后。
Zen 2:把 CPU 切成芯粒
计算部分用最新最贵的 7 nm,输入输出部分留在便宜的老工艺。
2019 年的 Zen 2 做了一个大胆决定:不再把整颗 CPU 做在一块硅上,而是拆成两种小芯片,也叫芯粒(chiplet):
- CCD(Core Complex Die,计算芯粒):只放 8 个核心和 32 MB L3 缓存,约 74 mm²,用台积电 7 nm 生产。
- IOD(I/O Die,输入输出芯粒):放内存控制器、PCIe、USB 等“对外接口”。桌面版约 125 mm²,用格罗方德 12 nm;服务器版约 416 mm²,用 14 nm。
服务器 EPYC Rome 用 8 颗 CCD 围着 1 颗 IOD,得到 64 核;桌面 Ryzen 用 1 到 2 颗 CCD 加 1 颗小 IOD。同一颗 CCD,从 6 核桌面一直用到 64 核服务器。芯粒互连的通用标准后来发展成 UCIe。
为什么拆开更好
第一,接口电路缩不动。内存接口、PCIe 这类模拟和输入输出电路,换到 7 nm 几乎不变小,却要付 7 nm 的高价。不如留在老工艺上。第二,也是最重要的:小芯片良率高。
- 1CCD:8 核 + 32 MB L3,只做计算,用最先进工艺。
- 2IOD:管内存、PCIe 等接口,用便宜的老工艺。
- 3无限总线连线:每颗 CCD 通过封装基板上的走线连到 IOD。
- 4缺陷:晶圆上随机落下的微小瑕疵。落在哪颗芯片上,哪颗就可能报废。
良率的数学:为什么越大越亏
晶圆在制造过程中会随机落下极小的缺陷(灰尘、图形错误)。常用的简化模型是:良率 Y ≈ e−A×D。A 是芯片面积,D 是每平方厘米平均有几个缺陷(缺陷密度)。面积翻倍,良率不是减半,而是按指数往下掉。这正是 三堵墙 里说的“大芯片良率墙”。
AMD 在 2021 年的一篇论文里估算:第一代 EPYC 用 4 颗芯片拼成,成本只有同等单片设计的约 59%;到了 Zen 2,同样用 7 nm 做 64 核,芯粒方案的优势更大。
拖动滑块看看。
按 300 mm 晶圆、边缘留 3 mm、晶圆价格假设 1.7 万美元(据报道约为 5 nm 级价格)计算,只算切割良率,不算封装和测试。
Zen 3:8 个核心坐进同一个房间
芯粒的外形不变,内部把两个 4 核簇合成一个 8 核簇。
Zen 2 的一颗 CCD 里其实还是两个 4 核 CCX,各有 16 MB L3。一个核心想用另一簇缓存里的数据,得绕到 IOD 再回来,很慢。游戏这种“线程之间频繁交换数据”的程序最吃亏。
2020 年 11 月的 Zen 3(Ryzen 5000)把 8 个核心放进同一个 CCX,共享整块 32 MB L3。每个核心能直接看到的缓存翻了一倍。加上核心本身的改进,AMD 宣称 IPC 提升约 19%。这一代起,AMD 在游戏性能上第一次全面追平甚至超过 Intel。
3D V-Cache:把一整块缓存叠上去
芯片平面放不下更多缓存,那就往第三个维度长。
游戏的数据量大、访问乱,缓存越大,去内存取数的次数越少,帧数越稳。可是在 CCD 上加缓存会让芯片变大、变贵,而且 SRAM(缓存用的存储电路)在新工艺上几乎缩不动(见 晶体管与制程)。
AMD 的办法是:另外做一颗只有缓存的小芯片,64 MB SRAM,用台积电 SoIC 混合键合直接贴在 CCD 上。混合键合不用焊锡球,而是让两块芯片表面的铜和铜直接融合,连接点间距只有约 9 微米,密度比焊球高几十倍(原理见 TSV、3D 堆叠与混合键合)。
2022 年 4 月的 Ryzen 7 5800X3D 是第一款,L3 从 32 MB 变成 96 MB,据评测很多游戏帧数提升一到两成。服务器版 Milan-X 一颗 CPU 有 768 MB L3。
第一代的缺陷是散热:缓存叠在核心上面,热量要多穿过一层硅才能出去,所以频率要降、电压要锁,不能超频。2024 年 11 月的 Ryzen 7 9800X3D 把顺序倒过来:缓存芯片垫在下面,CCD 放在上面,核心直接贴着散热盖,频率和普通版接近,还可以超频。
- 1CCD:放核心和原有 32 MB L3 的计算芯粒。
- 2V-Cache 缓存芯片:64 MB SRAM,正好盖在 CCD 原有 L3 的位置上方。
- 3结构硅:没有电路的空白硅片,只为把高度垫平、把热导出去。
- 4混合键合界面:铜对铜直接连接,没有焊球。
- 5TSV(硅通孔):第二代缓存芯片在下,要用贯穿硅片的铜柱把信号和电源送到上面的 CCD。
解决了什么
- 不改核心、不加大 CCD,就把 L3 扩大到三倍。
- 游戏和部分科学计算(流体仿真等)明显加速。
- 混合键合在消费级 CPU 上首次大规模量产。
缺陷
- 多一道键合工序,成本更高,产能受台积电 SoIC 限制。
- 对办公、编译等“不缺缓存”的任务几乎没帮助。
- 双 CCD 型号(如 7950X3D)只有一颗 CCD 有大缓存,要靠系统调度把游戏放对位置,早期常放错。
Zen 4:新插槽 AM5,和更小的 Zen 4c
换 5 nm、换 DDR5、换插槽,还多了一种“瘦身版”核心。
2022 年 9 月的 Zen 4(Ryzen 7000)CCD 用台积电 5 nm,IOD 用 6 nm,并且每颗 IOD 都带了一个小核显(集成显卡)。它带来了 DDR5 内存、PCIe 5.0,还第一次支持 AVX-512:一次处理 512 位数据的向量指令,适合科学计算和 AI 推理(详见 让 CPU 变快的十个发明)。Zen 4 用两拍 256 位的方式执行,省面积;到 Zen 5 桌面版才换成完整 512 位通路。
插槽:从 PGA 到 LGA
AM4 插槽(2016–)用的是 PGA(针栅阵列):针脚长在 CPU 上,插进主板的孔里。AM5(2022–)改成 LGA1718(触点栅格阵列):CPU 底部只有平的金属触点,弹簧针脚在主板插槽里。原因是 DDR5 和 PCIe 5.0 需要更多、更密的引脚和更好的供电,LGA 更容易做到。Intel 早在 2004 年就转向了 LGA。AMD 承诺 AM5 支持到 2027 年以后。
- 1PGA:AM4 用了 1331 根针,从 Zen 一直用到 Zen 3,前后约八年。
- 2LGA1718:AM5 的 1718 个触点,针脚在主板侧,CPU 更耐碰。
- 3Zen 4 标准核:追求最高频率,电路排布宽松。
- 4Zen 4c 紧凑核:同一份设计,换更密的版图,频率上限更低。
Zen 4c / Zen 5c:同样的核心,更小的面积
云服务商想要的是“一个机柜里塞尽量多的核心”,不在乎每个核心能不能冲到 5.7 GHz。AMD 没有像 Intel 那样另做一种不同的小核(Intel 的大小核指令集曾经不一致,见 Intel 路线),而是把同一个 Zen 4 设计用更紧凑的版图重新排一遍,减少用来冲高频的冗余电路,L3 也减半。结果是核心面积小约 35%,指令完全相同,软件不用区分。
2023 年 6 月的 EPYC Bergamo 用 Zen 4c 做到 128 核;2024 年的 EPYC Turin Dense 用 Zen 5c 做到 192 核。笔记本芯片里也开始混用标准核和 c 核。
Zen 5 与 Zen 6:核心越来越多
每一代 CCD 换新工艺,IOD 可以留用,节奏稳定。
2024 年 8 月的 Zen 5(Ryzen 9000)加宽了核心前端,AMD 宣称 IPC 平均提升约 16%。桌面版沿用了 Zen 4 的 6 nm IOD,只换 CCD(台积电 N4P)。这就是芯粒的好处:哪块该升级就换哪块。2024 年 10 月的 EPYC Turin 最多 192 核。
Zen 6 的服务器版 EPYC“Venice”于 2026 年 7 月发布,是第一款用台积电 N2(2 nm 环栅晶体管)的服务器 CPU,据报道最多 256 核。消费级 Zen 6(据报道代号 Medusa、Olympic Ridge 等)时间未定,据报道在 2026 年底到 2027 年之间,仍使用 AM5 插槽。
APU 与 MI300A:CPU 和 GPU 住进一个封装
把 CPU、显卡、内存放得更近,数据少搬几趟。
APU 是 AMD 对“CPU 和 GPU 做在一起的芯片”的叫法,最早在 2011 年就推出了。笔记本里的 Ryzen AI 系列(2024 年起)再加上 NPU(神经网络处理器,专门跑 AI 的小引擎),据 AMD 数据约 50 TOPS(每秒 50 万亿次运算)。
2025 年初的 Strix Halo(Ryzen AI Max)更进一步:16 个 Zen 5 核心加一个 40 组计算单元的大核显,配 256 位宽 LPDDR5X 内存,最高 128 GB。CPU 和 GPU 共用这一池内存,叫统一内存。这样不用像独立显卡那样把数据从内存复制到显存,能装下很大的 AI 模型。苹果 M 系列走的也是这条路(对比见 Intel 与 AMD 对比及 x86 的未来)。
数据中心那头,2023 年 12 月发布的 Instinct MI300A 把 24 个 Zen 4 核心、228 组 GPU 计算单元和 128 GB HBM3 放在一个封装里。计算芯粒用混合键合叠在 4 颗 IOD 上,IOD 再放在 CoWoS 硅中介层上。美国超算 El Capitan 用的就是它。
- 1CPU 芯粒:3 颗 Zen 4 CCD,共 24 核。
- 2GPU 芯粒(XCD):6 颗,共 228 组计算单元。
- 3IOD:4 颗,计算芯粒用混合键合叠在它们上面,里面还有 256 MB 的 Infinity Cache。
- 4HBM3:8 堆,共 128 GB,CPU 和 GPU 共享同一份内存。
- 5硅中介层:台积电 CoWoS,把 IOD 和 HBM 连在一起。
- 6两颗 CCD:和桌面 Ryzen 9000 用的是同一种计算芯粒。
- 7大 IOD:核显、NPU 和 256 位内存控制器都在这里,CPU 和 GPU 共用一池内存。
无晶圆厂:设计自己做,制造交给台积电
2009 年卖掉工厂时像是认输,十年后却变成了优势。
AMD 创始人杰里·桑德斯有句名言:“真正的男人要有晶圆厂。”可是建一座先进晶圆厂要上百亿美元,AMD 的营收撑不起。2009 年,它把工厂分拆成格罗方德,自己变成无晶圆厂(fabless)公司:只做设计,制造外包。
起初这只是止血。真正的转折在 2018 年:格罗方德宣布放弃 7 nm 研发。AMD 被迫把最先进的芯片全部交给台积电。而那几年正是台积电工艺超过 Intel 的时候(Intel 10 nm 一再延误,见 Intel 路线)。AMD 搭上了最快的车。
无晶圆厂的好处
- 不用自己掏几百亿美元建厂,钱全花在设计上。
- 哪家工艺最好就用哪家,不会被自家工厂的延误拖住。
- 台积电同时服务苹果、英伟达,规模大、学习快,AMD 跟着受益。
代价与风险
- 要和苹果、英伟达抢台积电的产能,先进工艺和 CoWoS、SoIC 封装经常排队。
- 利润要分给代工厂,先进晶圆价格逐年上涨。
- 供应集中在台湾,地缘政治风险大。AMD 也在评估台积电美国亚利桑那厂的产能。
结果:服务器份额一路上涨
服务器 CPU 利润最高、换代最慢,客户最看重“每瓦性能”和“每个机柜能放多少核”。芯粒让 AMD 能比对手更早做出更多核心的 CPU。据市场调研机构 Mercury Research 的报道,EPYC 在 x86 服务器 CPU 的出货量份额从 2017 年约 1% 涨到 2025 年约三成;按营收算,据报道已到约四成以上。
切开的代价:延迟和待机功耗
芯粒省了钱,但芯片之间的“过道”比芯片内部长得多。
同一块硅里,信号走的是纳米级的细线;跨芯粒时,信号要先走出芯片,经过封装基板上的走线,再进入另一颗芯片。这一趟又慢又耗电。下面这张图把几种“取数”的时间放在一起比较,数字来自公开评测的约数,随型号和内存不同会变。
- 芯粒间延迟跨 CCD 通信、访问内存都要过 IOD,延迟比单片设计高,对游戏和数据库等敏感负载不友好。
- IOD 功耗与待机功耗无限总线一直在跑,IOD 用的又是较老工艺。据评测,桌面 Ryzen 待机时整颗 CPU 常有 20 W 上下,比 Intel 单片设计高。笔记本因此多用单片 APU。
- 带宽瓶颈每颗 CCD 到 IOD 的连接宽度有限,单颗 CCD 往往吃不满内存带宽,写入带宽更窄。
- 封装更复杂多颗芯片要贴到同一块基板上,后续叠 V-Cache、上中介层,都依赖台积电的先进封装产能。
AMD 十年的每一步,一张表看完
| 技术 | 诞生 | 解决什么 | 缺陷 | 现状 / 去向 |
|---|---|---|---|---|
| Zen 核心 + SMT | 2017 | 推土机单线程太弱,公司濒临破产 | 首代频率低、延迟不均 | 每 1–2 年一代,已到 Zen 6 |
| CCX 4 核簇 | 2017 | 用一种小模块拼出不同核数 | 跨簇通信慢 | Zen 3 起改为 8 核一簇 |
| Infinity Fabric | 2017 | 统一的片内、片间互连 | 功耗高,带宽有限 | 仍是所有 AMD 芯片的骨干 |
| CCD + IOD 芯粒 | 2019 | 大芯片良率低、接口电路不缩 | 延迟、待机功耗 | 主流;业界普遍跟进,标准化为 UCIe |
| 3D V-Cache | 2022 | 缓存不够、SRAM 缩不动 | 成本高,一代散热受限 | 第二代改为缓存在下,游戏 CPU 标配 |
| AM5 / LGA1718 | 2022 | DDR5、PCIe 5 需要更多引脚 | 平台初期贵 | 预计用到 2027 年以后 |
| Zen c 紧凑核 | 2023 | 云服务要更多核心、每瓦更高 | 频率低、缓存少 | 服务器与笔记本广泛使用 |
| APU 统一内存 | 2011 / 2025 | CPU 与 GPU 之间来回复制数据 | 内存焊死、成本高 | Strix Halo 用于 AI 小主机、工作站 |
| MI300A | 2023 | 超算里 CPU、GPU 分家导致搬数据慢 | 极贵,依赖 CoWoS 产能 | El Capitan 等超算在用 |
| 无晶圆厂模式 | 2009 | 建厂资金撑不住 | 产能受制于人,地缘风险 | 持续;全线依赖台积电先进工艺 |
- 推土机失败后,AMD 用 Zen 回到“宽而强的单核”,2017 年重新回到竞争。
- Zen 2 把 CPU 拆成计算芯粒和输入输出芯粒:小芯片良率高,接口留在老工艺,省钱又灵活。
- 3D V-Cache 用混合键合把缓存叠上去,第二代把缓存挪到下面解决散热。
- Zen c 用同一设计做更小的核心,服务器核心数八年涨了约八倍。
- 无晶圆厂让 AMD 搭上台积电的快车,代价是延迟、待机功耗和产能依赖。
你的游戏机里就有 Zen
PlayStation 5 和 Xbox Series X|S 用的都是 AMD 定制芯片,里面是 8 个 Zen 2 核心加 RDNA 2 显卡,做在一块单片上。Steam Deck 掌机也是 Zen 2。如果你在网上看到“X3D”结尾的 CPU 被称作“游戏神 U”,说的就是 3D V-Cache。很多云服务器的“AMD 实例”,背后就是 EPYC。
为什么游戏机用单片而不是芯粒?因为游戏机一款要卖上亿台、多年不变,单片设计虽然初期贵,但量大摊薄后单价更低,延迟和功耗也更好。芯粒最适合的是“同一颗计算芯粒要拼出很多种产品”的情况。
1. Zen 2 的 CCD 和 IOD 分别负责什么?为什么用不同工艺?
CCD 放核心和 L3 缓存,负责计算,用最先进的 7 nm;IOD 放内存控制器和 PCIe 等接口,用 12/14 nm。接口电路换新工艺几乎不变小,用老工艺更便宜。
2. 芯片面积从 100 mm² 变成 700 mm²,良率大概会怎样变化?
按 Y ≈ e−A×D,缺陷密度 0.1 个/cm² 时,100 mm² 约 90%,700 mm² 约 50%。面积越大,良率按指数下降,不是线性下降。
3. 第一代和第二代 3D V-Cache 最大的区别是什么?
第一代把 64 MB 缓存芯片叠在 CCD 上面,核心的热要多穿一层,频率受限;第二代(9800X3D)把缓存芯片放到 CCD 下面,核心直接贴近散热盖,频率更高还能超频。
4. Zen 4c 和 Intel 的 E 核思路有什么不同?
Zen 4c 是同一个 Zen 4 设计换更紧凑的版图,指令和 IPC 完全一样,只是频率上限更低、缓存更少;Intel 的 E 核是另一套不同的微架构。
5. 芯粒设计的主要缺点有哪些?
跨芯粒延迟高(跨 CCD 通信接近访问内存的时间),无限总线和 IOD 让待机功耗偏高,CCD 到 IOD 的带宽有限,以及更依赖先进封装产能。
6. 2018 年哪件事让 AMD 全面转向台积电?
格罗方德宣布放弃 7 nm 研发,AMD 只能把最先进的 CPU 交给台积电生产,正好赶上台积电工艺领先的几年。
延伸阅读
- AMD 历年年报(10-K)与财报新闻稿,2011–2025 年营收数据。
- S. Naffziger 等,“Pioneering Chiplet Technology and Design for the AMD EPYC and Ryzen Processor Families”,ISCA 2021(芯粒成本与良率分析)。
- AMD Zen、Zen 2、Zen 3、Zen 4、Zen 5 架构发布资料与 Hot Chips / ISSCC 报告(2016–2024);Ryzen 7 5800X3D、9800X3D 发布资料。
- AMD 与台积电关于 3D V-Cache 与 SoIC 混合键合的公开资料(Computex 2021、ISSCC 2022)。
- AMD Instinct MI300A 发布资料(2023 年 12 月);劳伦斯利弗莫尔国家实验室 El Capitan 公告(2024)。
- AMD Ryzen AI Max(Strix Halo)CES 2025 发布资料;EPYC Venice(Zen 6)发布报道(2026)。
- Mercury Research 关于 x86 服务器 CPU 份额的季度报告(经媒体转述,2017–2026)。
- Chips and Cheese、AnandTech 等对 Ryzen 核间延迟、内存延迟与待机功耗的评测;WikiChip、TechInsights 对 CCD、IOD 与 Zen 4c 面积的分析。
- 格罗方德 2018 年 8 月关于暂停 7 nm 研发的公告。
- 本站相关页面:x86 五十年、走进死胡同的路线、Intel 路线、Intel 与 AMD 对比及 x86 的未来、芯粒与 UCIe、混合键合、三堵墙、CPU 入门。