Yiek Heng 的知识空间
首页CPU两家路线主流在用诞生:2017(Zen)/ 2019 芯粒2026-10-11
Intel 与 AMD CPU · 第 6 页

AMD 路线·从 Zen 到芯粒帝国

2015 年,AMD 一年只卖了约 40 亿美元,股价一度跌到 2 美元以下。十年后,它的服务器 CPU 据报道拿下了约四成营收份额。这一页讲清楚:Zen 是怎么从零做出来的,为什么 AMD 要把一颗 CPU 切成好几块“芯粒”,3D V-Cache 为什么让游戏变快,以及这条路的代价是什么。

从头重来2017 年的 Zen 抛弃了推土机,回到“宽而强的单核”。
切成小块2019 年的 Zen 2 把计算和输入输出拆开,小芯片良率高、便宜。
往上叠2022 年起用混合键合把一整块缓存叠上去,游戏性能大涨。
它为什么诞生

推土机之后,AMD 差点撑不下去

Zen 不是一次普通的升级,它是一家公司押上全部身家的翻身仗。

2011 年,AMD 推出了“推土机”(Bulldozer)架构。它的思路是:两个整数核心共用一套前端和浮点单元,用“核心数多”来对抗 Intel。结果单线程性能弱、功耗高,在 Intel 的 Sandy Bridge 面前全面落下风(详见 走进死胡同的路线)。之后几年的改良版(打桩机、压路机、挖掘机)也没能翻身。

钱很快烧光了。AMD 在 2009 年已经把自己的晶圆厂分拆成格罗方德(GlobalFoundries),2012 年又卖掉了总部大楼再租回来。2015 年营收跌到约 40 亿美元,比 2011 年少了近四成。

转机来自两个人。2012 年,传奇芯片设计师吉姆·凯勒(Jim Keller)回到 AMD,牵头一个全新的 CPU 架构,代号 Zen,首席架构师是迈克·克拉克(Mike Clark)。2014 年 10 月,苏姿丰(Lisa Su)出任 CEO。她砍掉了分散的项目,把赌注压在两件事上:高性能 CPU 和 GPU。Zen 就是那张最大的牌。

AMD 年营收(十亿美元) 0102030 4.025.8约 34 20112013201520172019202120232025 1 2 3 4 5 6 推土机时代 Zen 时代 数据取自 AMD 年报,四舍五入;2025 年为约数(虚线)
← 左右滑动查看 →
  1. 12011 推土机:FX 处理器发布,单线程性能不如上一代。
  2. 22012 凯勒回归:Zen 项目启动,从零设计。
  3. 32014 苏姿丰上任:公司聚焦高性能计算。
  4. 42017 Zen:Ryzen 与 EPYC 上市,营收止跌。
  5. 52019 Zen 2:芯粒设计,服务器份额开始快速上涨。
  6. 62022 收购赛灵思:营收跳涨,也开始做 AI 加速器。
推土机像一家饭馆为了“翻台快”,让两个厨师共用一个灶台。Zen 则是重新装修:每个厨师都有自己的大灶台。
它是怎么工作的 · 2017

Zen:4 核一簇,再用“无限总线”连起来

一种芯片,既做桌面 8 核,又拼成服务器 32 核。

2017 年 3 月,第一代 Ryzen(锐龙)桌面处理器上市;6 月,服务器版 EPYC(霄龙)上市。AMD 宣称 Zen 的 IPC(每个时钟周期能完成的指令数,可以理解成“每一拍干多少活”)比上一代挖掘机高约 52%。几个关键设计:

  • CCX(CPU Complex,核心簇):4 个核心组成一簇,共享一块 8 MB 的三级缓存(L3)。缓存是芯片里的“小冰箱”,常用的数据放在手边,不用每次跑去远处的内存(大仓库)取。
  • SMT(同时多线程):一个核心可以同时跑两个线程(两条任务),让闲着的执行单元也干上活。这是 AMD 第一次在主流 CPU 上做 SMT。
  • Infinity Fabric(无限总线):AMD 自己的片内和片间互连。它连接两个 CCX、内存控制器和输入输出接口,也能跨芯片连接。

一颗 Zen 芯片代号 Zeppelin,约 213 mm²,在格罗方德 14 nm 工艺上生产,里面有 2 个 CCX,共 8 核。聪明的地方在于:服务器 EPYC 不另做大芯片,而是把 4 颗同样的 Zeppelin 装进一个封装,得到 32 核。这一步是后来芯粒路线的雏形。

一颗 Zeppelin(8 核) 核核核核核核核核 L3 8 MB L3 8 MB Infinity Fabric 无限总线 内存控制器 ×2 PCIe / 输入输出 1 2 3 4 EPYC Naples(32 核) Zeppelin8 核Zeppelin8 核Zeppelin8 核Zeppelin8 核 5 示意图,不按比例;红线为封装内的无限总线连接
← 左右滑动查看 →
  1. 1CCX:4 个核心一簇。每个核心有自己的 L1、L2 缓存。
  2. 2L3 缓存:一簇 4 核共享 8 MB。另一簇的数据要绕远路才能拿到。
  3. 3无限总线:芯片内部的“高速公路”,连接两个 CCX 和外设。
  4. 4内存与输入输出:每颗芯片自带 2 个内存通道和一组 PCIe。
  5. 5多芯片封装:4 颗相同的芯片拼成 32 核服务器 CPU,每颗之间都直连。

Zen 一代解决了什么

  • 单线程性能大幅追上 Intel,8 核桌面价格只有对手 8 核的约一半。
  • 一种芯片覆盖桌面、工作站、服务器,设计和流片成本大大降低。
  • 插槽 AM4 用了很多年,老主板能升级新 CPU。

它的缺陷

  • 两个 CCX 之间、四颗芯片之间通信慢,延迟忽高忽低。
  • EPYC 一代的内存分散在四颗芯片上,软件要“懂”这种结构才跑得好(NUMA,非一致内存访问)。
  • 频率不如 Intel 高,游戏帧数仍落后。
它解决了什么问题 · 2019

Zen 2:把 CPU 切成芯粒

计算部分用最新最贵的 7 nm,输入输出部分留在便宜的老工艺。

2019 年的 Zen 2 做了一个大胆决定:不再把整颗 CPU 做在一块硅上,而是拆成两种小芯片,也叫芯粒(chiplet):

  • CCD(Core Complex Die,计算芯粒):只放 8 个核心和 32 MB L3 缓存,约 74 mm²,用台积电 7 nm 生产。
  • IOD(I/O Die,输入输出芯粒):放内存控制器、PCIe、USB 等“对外接口”。桌面版约 125 mm²,用格罗方德 12 nm;服务器版约 416 mm²,用 14 nm。

服务器 EPYC Rome 用 8 颗 CCD 围着 1 颗 IOD,得到 64 核;桌面 Ryzen 用 1 到 2 颗 CCD 加 1 颗小 IOD。同一颗 CCD,从 6 核桌面一直用到 64 核服务器。芯粒互连的通用标准后来发展成 UCIe。

为什么拆开更好

第一,接口电路缩不动。内存接口、PCIe 这类模拟和输入输出电路,换到 7 nm 几乎不变小,却要付 7 nm 的高价。不如留在老工艺上。第二,也是最重要的:小芯片良率高。

假想:64 核做成一整块 一整块,接近光罩上限 约 700 mm² 以上(估算) 4 一个缺陷 → 整颗报废 EPYC Rome:8 + 1 颗芯粒 CCDCCDCCDCCDCCDCCDCCDCCD IOD 输入输出芯粒 14 nm · 内存 / PCIe 1 2 3 每颗 CCD 约 74 mm²,7 nm;示意图,不按比例
← 左右滑动查看 →
  1. 1CCD:8 核 + 32 MB L3,只做计算,用最先进工艺。
  2. 2IOD:管内存、PCIe 等接口,用便宜的老工艺。
  3. 3无限总线连线:每颗 CCD 通过封装基板上的走线连到 IOD。
  4. 4缺陷:晶圆上随机落下的微小瑕疵。落在哪颗芯片上,哪颗就可能报废。

良率的数学:为什么越大越亏

晶圆在制造过程中会随机落下极小的缺陷(灰尘、图形错误)。常用的简化模型是:良率 Y ≈ e−A×D。A 是芯片面积,D 是每平方厘米平均有几个缺陷(缺陷密度)。面积翻倍,良率不是减半,而是按指数往下掉。这正是 三堵墙 里说的“大芯片良率墙”。

AMD 在 2021 年的一篇论文里估算:第一代 EPYC 用 4 颗芯片拼成,成本只有同等单片设计的约 59%;到了 Zen 2,同样用 7 nm 做 64 核,芯粒方案的优势更大。

良率 ≈ e−面积×缺陷密度 0%30%60%90% 0200400600800 芯片面积(mm²) 缺陷 0.1 个/cm² 0.2 个/cm² CCD 约 74 mm² 良率约 93% 单片约 700 mm² 良率约 50%
← 左右滑动查看 →
要点:缺陷密度取 0.1 个/cm² 时,74 mm² 的小芯片约 93% 是好的;700 mm² 的大芯片只有约一半能用。真实缺陷密度各家保密,图中数值仅作示意。
动手试试:芯片面积和良率
74 mm²
缺陷密度
好芯片坏芯片缺陷
一片晶圆切出-
良率(本次模拟 / 公式)-
每颗好芯片约(美元)-

拖动滑块看看。

按 300 mm 晶圆、边缘留 3 mm、晶圆价格假设 1.7 万美元(据报道约为 5 nm 级价格)计算,只算切割良率,不算封装和测试。

继续改进 · 2020

Zen 3:8 个核心坐进同一个房间

芯粒的外形不变,内部把两个 4 核簇合成一个 8 核簇。

Zen 2 的一颗 CCD 里其实还是两个 4 核 CCX,各有 16 MB L3。一个核心想用另一簇缓存里的数据,得绕到 IOD 再回来,很慢。游戏这种“线程之间频繁交换数据”的程序最吃亏。

2020 年 11 月的 Zen 3(Ryzen 5000)把 8 个核心放进同一个 CCX,共享整块 32 MB L3。每个核心能直接看到的缓存翻了一倍。加上核心本身的改进,AMD 宣称 IPC 提升约 19%。这一代起,AMD 在游戏性能上第一次全面追平甚至超过 Intel。

Zen 2 CCD:两个 4 核簇 L3 16 MBL3 16 MB 跨簇要经 IOD 绕路 Zen 3 CCD:8 核一簇 共享 L3 32 MB 任何一个核心都能直接用整块 32 MB
← 左右滑动查看 →
深蓝色小方块是核心,橙色是 L3 缓存。示意图,不按比例。两代 CCD 都是 8 核 32 MB,区别在于缓存是“两间小屋”还是“一间大屋”。
它是怎么工作的 · 2022

3D V-Cache:把一整块缓存叠上去

芯片平面放不下更多缓存,那就往第三个维度长。

游戏的数据量大、访问乱,缓存越大,去内存取数的次数越少,帧数越稳。可是在 CCD 上加缓存会让芯片变大、变贵,而且 SRAM(缓存用的存储电路)在新工艺上几乎缩不动(见 晶体管与制程)。

AMD 的办法是:另外做一颗只有缓存的小芯片,64 MB SRAM,用台积电 SoIC 混合键合直接贴在 CCD 上。混合键合不用焊锡球,而是让两块芯片表面的铜和铜直接融合,连接点间距只有约 9 微米,密度比焊球高几十倍(原理见 TSV、3D 堆叠与混合键合)。

2022 年 4 月的 Ryzen 7 5800X3D 是第一款,L3 从 32 MB 变成 96 MB,据评测很多游戏帧数提升一到两成。服务器版 Milan-X 一颗 CPU 有 768 MB L3。

第一代的缺陷是散热:缓存叠在核心上面,热量要多穿过一层硅才能出去,所以频率要降、电压要锁,不能超频。2024 年 11 月的 Ryzen 7 9800X3D 把顺序倒过来:缓存芯片垫在下面,CCD 放在上面,核心直接贴着散热盖,频率和普通版接近,还可以超频。

第一代(5800X3D):缓存在上 散热盖 64 MB SRAM CCD(核心 + 32 MB L3) 封装基板 核心的热要穿过结构硅才能出去 频率较低,不能超频 1 2 3 4 第二代(9800X3D):缓存在下 散热盖 CCD(核心 + 32 MB L3) 64 MB SRAM 封装基板 核心直接贴近散热盖 频率接近普通版,可以超频 5 剖面示意,不按比例;SRAM 芯片很薄,实际厚度只有几十微米
← 左右滑动查看 →
  1. 1CCD:放核心和原有 32 MB L3 的计算芯粒。
  2. 2V-Cache 缓存芯片:64 MB SRAM,正好盖在 CCD 原有 L3 的位置上方。
  3. 3结构硅:没有电路的空白硅片,只为把高度垫平、把热导出去。
  4. 4混合键合界面:铜对铜直接连接,没有焊球。
  5. 5TSV(硅通孔):第二代缓存芯片在下,要用贯穿硅片的铜柱把信号和电源送到上面的 CCD。

解决了什么

  • 不改核心、不加大 CCD,就把 L3 扩大到三倍。
  • 游戏和部分科学计算(流体仿真等)明显加速。
  • 混合键合在消费级 CPU 上首次大规模量产。

缺陷

  • 多一道键合工序,成本更高,产能受台积电 SoIC 限制。
  • 对办公、编译等“不缺缓存”的任务几乎没帮助。
  • 双 CCD 型号(如 7950X3D)只有一颗 CCD 有大缓存,要靠系统调度把游戏放对位置,早期常放错。
换平台 · 2022–2023

Zen 4:新插槽 AM5,和更小的 Zen 4c

换 5 nm、换 DDR5、换插槽,还多了一种“瘦身版”核心。

2022 年 9 月的 Zen 4(Ryzen 7000)CCD 用台积电 5 nm,IOD 用 6 nm,并且每颗 IOD 都带了一个小核显(集成显卡)。它带来了 DDR5 内存、PCIe 5.0,还第一次支持 AVX-512:一次处理 512 位数据的向量指令,适合科学计算和 AI 推理(详见 让 CPU 变快的十个发明)。Zen 4 用两拍 256 位的方式执行,省面积;到 Zen 5 桌面版才换成完整 512 位通路。

插槽:从 PGA 到 LGA

AM4 插槽(2016–)用的是 PGA(针栅阵列):针脚长在 CPU 上,插进主板的孔里。AM5(2022–)改成 LGA1718(触点栅格阵列):CPU 底部只有平的金属触点,弹簧针脚在主板插槽里。原因是 DDR5 和 PCIe 5.0 需要更多、更密的引脚和更好的供电,LGA 更容易做到。Intel 早在 2004 年就转向了 LGA。AMD 承诺 AM5 支持到 2027 年以后。

PGA(AM4) 针脚在 CPU 上 插座上是孔,针容易弯 LGA(AM5) CPU 底部是平触点 弹簧针在主板插槽里 1 2 剖面示意,不按比例 一个核心占多大(含 L2) Zen 4 约 3.8 mm² Zen 4c 约 2.5 mm² 高频、大缓存 小约 35% 同样的指令、同样的 IPC c 版牺牲最高频率,排布更紧凑 3 4 面积为据报道的约数,按比例画
← 左右滑动查看 →
  1. 1PGA:AM4 用了 1331 根针,从 Zen 一直用到 Zen 3,前后约八年。
  2. 2LGA1718:AM5 的 1718 个触点,针脚在主板侧,CPU 更耐碰。
  3. 3Zen 4 标准核:追求最高频率,电路排布宽松。
  4. 4Zen 4c 紧凑核:同一份设计,换更密的版图,频率上限更低。

Zen 4c / Zen 5c:同样的核心,更小的面积

云服务商想要的是“一个机柜里塞尽量多的核心”,不在乎每个核心能不能冲到 5.7 GHz。AMD 没有像 Intel 那样另做一种不同的小核(Intel 的大小核指令集曾经不一致,见 Intel 路线),而是把同一个 Zen 4 设计用更紧凑的版图重新排一遍,减少用来冲高频的冗余电路,L3 也减半。结果是核心面积小约 35%,指令完全相同,软件不用区分。

2023 年 6 月的 EPYC Bergamo 用 Zen 4c 做到 128 核;2024 年的 EPYC Turin Dense 用 Zen 5c 做到 192 核。笔记本芯片里也开始混用标准核和 c 核。

现状与未来 · 2024–2027

Zen 5 与 Zen 6:核心越来越多

每一代 CCD 换新工艺,IOD 可以留用,节奏稳定。

2024 年 8 月的 Zen 5(Ryzen 9000)加宽了核心前端,AMD 宣称 IPC 平均提升约 16%。桌面版沿用了 Zen 4 的 6 nm IOD,只换 CCD(台积电 N4P)。这就是芯粒的好处:哪块该升级就换哪块。2024 年 10 月的 EPYC Turin 最多 192 核。

Zen 6 的服务器版 EPYC“Venice”于 2026 年 7 月发布,是第一款用台积电 N2(2 nm 环栅晶体管)的服务器 CPU,据报道最多 256 核。消费级 Zen 6(据报道代号 Medusa、Olympic Ridge 等)时间未定,据报道在 2026 年底到 2027 年之间,仍使用 AM5 插槽。

每一代 Zen 与 EPYC 最多核心数 32646496/128128/192约 256 无新 EPYC ZenZen+Zen 2Zen 3Zen 4Zen 5Zen 6 2017 · 14nm2018 · 12nm2019 · 7nm2020 · 7nm2022 · 5nm2024 · N4P/N32026 · N2 单片拼装小改款芯粒革命8 核 CCXAM5 · 4c512 位向量据报道 标准核 紧凑核(c 版)多出的部分 V-Cache:Zen 3(2022)起
← 左右滑动查看 →
要点:八年里,一颗服务器 CPU 的核心数从 32 涨到约 256,是同期单核性能提升幅度的好几倍。这条曲线主要靠芯粒和封装,而不只是靠工艺。Zen 6 数据为据报道,用虚线表示。
另一条线

APU 与 MI300A:CPU 和 GPU 住进一个封装

把 CPU、显卡、内存放得更近,数据少搬几趟。

APU 是 AMD 对“CPU 和 GPU 做在一起的芯片”的叫法,最早在 2011 年就推出了。笔记本里的 Ryzen AI 系列(2024 年起)再加上 NPU(神经网络处理器,专门跑 AI 的小引擎),据 AMD 数据约 50 TOPS(每秒 50 万亿次运算)。

2025 年初的 Strix Halo(Ryzen AI Max)更进一步:16 个 Zen 5 核心加一个 40 组计算单元的大核显,配 256 位宽 LPDDR5X 内存,最高 128 GB。CPU 和 GPU 共用这一池内存,叫统一内存。这样不用像独立显卡那样把数据从内存复制到显存,能装下很大的 AI 模型。苹果 M 系列走的也是这条路(对比见 Intel 与 AMD 对比及 x86 的未来)。

数据中心那头,2023 年 12 月发布的 Instinct MI300A 把 24 个 Zen 4 核心、228 组 GPU 计算单元和 128 GB HBM3 放在一个封装里。计算芯粒用混合键合叠在 4 颗 IOD 上,IOD 再放在 CoWoS 硅中介层上。美国超算 El Capitan 用的就是它。

MI300A(俯视) HBMHBM CCDCCDCCD XCDXCDXCDXCDXCDXCD 1 2 3 4 5 Strix Halo(俯视) CCD8 核CCD8 核 IOD + 核显 40 组 GPU 单元 NPU · 内存控制器 LPDDR5X 在主板上 LPDDR5X 6 7 示意图,不按比例;MI300A 的 HBM 实为 8 堆,计算芯粒位于 IOD 正上方
← 左右滑动查看 →
  1. 1CPU 芯粒:3 颗 Zen 4 CCD,共 24 核。
  2. 2GPU 芯粒(XCD):6 颗,共 228 组计算单元。
  3. 3IOD:4 颗,计算芯粒用混合键合叠在它们上面,里面还有 256 MB 的 Infinity Cache。
  4. 4HBM3:8 堆,共 128 GB,CPU 和 GPU 共享同一份内存。
  5. 5硅中介层:台积电 CoWoS,把 IOD 和 HBM 连在一起。
  6. 6两颗 CCD:和桌面 Ryzen 9000 用的是同一种计算芯粒。
  7. 7大 IOD:核显、NPU 和 256 位内存控制器都在这里,CPU 和 GPU 共用一池内存。
为什么能赢

无晶圆厂:设计自己做,制造交给台积电

2009 年卖掉工厂时像是认输,十年后却变成了优势。

AMD 创始人杰里·桑德斯有句名言:“真正的男人要有晶圆厂。”可是建一座先进晶圆厂要上百亿美元,AMD 的营收撑不起。2009 年,它把工厂分拆成格罗方德,自己变成无晶圆厂(fabless)公司:只做设计,制造外包。

起初这只是止血。真正的转折在 2018 年:格罗方德宣布放弃 7 nm 研发。AMD 被迫把最先进的芯片全部交给台积电。而那几年正是台积电工艺超过 Intel 的时候(Intel 10 nm 一再延误,见 Intel 路线)。AMD 搭上了最快的车。

IDM(垂直整合,如 Intel 传统模式) 芯片设计工艺研发晶圆制造封装测试 无晶圆厂(AMD 2009 年起) 芯片设计工艺研发晶圆制造封装测试 AMD 台积电(先进)· 格罗方德(老工艺) 台积电 / 日月光等
← 左右滑动查看 →
IDM(Integrated Device Manufacturer)指自己设计、自己制造的公司。示意图。

无晶圆厂的好处

  • 不用自己掏几百亿美元建厂,钱全花在设计上。
  • 哪家工艺最好就用哪家,不会被自家工厂的延误拖住。
  • 台积电同时服务苹果、英伟达,规模大、学习快,AMD 跟着受益。

代价与风险

  • 要和苹果、英伟达抢台积电的产能,先进工艺和 CoWoS、SoIC 封装经常排队。
  • 利润要分给代工厂,先进晶圆价格逐年上涨。
  • 供应集中在台湾,地缘政治风险大。AMD 也在评估台积电美国亚利桑那厂的产能。

结果:服务器份额一路上涨

服务器 CPU 利润最高、换代最慢,客户最看重“每瓦性能”和“每个机柜能放多少核”。芯粒让 AMD 能比对手更早做出更多核心的 CPU。据市场调研机构 Mercury Research 的报道,EPYC 在 x86 服务器 CPU 的出货量份额从 2017 年约 1% 涨到 2025 年约三成;按营收算,据报道已到约四成以上。

AMD 在 x86 服务器 CPU 的出货量份额(约数) 0%10%20%30% ~1~4.5~11~23~28 201720182019202020212022202320242025 各年第四季度附近的报道值,取整;不同机构统计口径不同,仅示趋势
← 左右滑动查看 →
它的缺陷

切开的代价:延迟和待机功耗

芯粒省了钱,但芯片之间的“过道”比芯片内部长得多。

同一块硅里,信号走的是纳米级的细线;跨芯粒时,信号要先走出芯片,经过封装基板上的走线,再进入另一颗芯片。这一趟又慢又耗电。下面这张图把几种“取数”的时间放在一起比较,数字来自公开评测的约数,随型号和内存不同会变。

桌面 Ryzen 里“拿一次数据”要多久(约数) CCD 0 CCD 1 核 A核 B核 C 共享 L3共享 L3 约 20 ns IOD · 内存控制器 跨 CCD 约 70–80 ns DDR5 内存:约 75–90 ns
← 左右滑动查看 →
要点:核 A 找同一 CCD 里的核 B 很快;找另一颗 CCD 的核 C,要经过 IOD 绕一圈,时间和去内存差不多。所以 16 核的双 CCD 型号,游戏常常只用其中一颗。数据为公开评测的约数,不同代际与内存设置差异较大。
  • 芯粒间延迟跨 CCD 通信、访问内存都要过 IOD,延迟比单片设计高,对游戏和数据库等敏感负载不友好。
  • IOD 功耗与待机功耗无限总线一直在跑,IOD 用的又是较老工艺。据评测,桌面 Ryzen 待机时整颗 CPU 常有 20 W 上下,比 Intel 单片设计高。笔记本因此多用单片 APU。
  • 带宽瓶颈每颗 CCD 到 IOD 的连接宽度有限,单颗 CCD 往往吃不满内存带宽,写入带宽更窄。
  • 封装更复杂多颗芯片要贴到同一块基板上,后续叠 V-Cache、上中介层,都依赖台积电的先进封装产能。

AMD 的应对:Zen 3 合并 CCX 减少跨簇;V-Cache 加大缓存减少访问内存;据报道 Zen 6 一代的芯粒连接会从基板走线改成更密的封装内连接(类似 扇出封装 或 中介层 上的短线),以降低延迟和功耗。

汇总

AMD 十年的每一步,一张表看完

技术诞生解决什么缺陷现状 / 去向
Zen 核心 + SMT2017推土机单线程太弱,公司濒临破产首代频率低、延迟不均每 1–2 年一代,已到 Zen 6
CCX 4 核簇2017用一种小模块拼出不同核数跨簇通信慢Zen 3 起改为 8 核一簇
Infinity Fabric2017统一的片内、片间互连功耗高,带宽有限仍是所有 AMD 芯片的骨干
CCD + IOD 芯粒2019大芯片良率低、接口电路不缩延迟、待机功耗主流;业界普遍跟进,标准化为 UCIe
3D V-Cache2022缓存不够、SRAM 缩不动成本高,一代散热受限第二代改为缓存在下,游戏 CPU 标配
AM5 / LGA17182022DDR5、PCIe 5 需要更多引脚平台初期贵预计用到 2027 年以后
Zen c 紧凑核2023云服务要更多核心、每瓦更高频率低、缓存少服务器与笔记本广泛使用
APU 统一内存2011 / 2025CPU 与 GPU 之间来回复制数据内存焊死、成本高Strix Halo 用于 AI 小主机、工作站
MI300A2023超算里 CPU、GPU 分家导致搬数据慢极贵,依赖 CoWoS 产能El Capitan 等超算在用
无晶圆厂模式2009建厂资金撑不住产能受制于人,地缘风险持续;全线依赖台积电先进工艺
一页纸总结
  1. 推土机失败后,AMD 用 Zen 回到“宽而强的单核”,2017 年重新回到竞争。
  2. Zen 2 把 CPU 拆成计算芯粒和输入输出芯粒:小芯片良率高,接口留在老工艺,省钱又灵活。
  3. 3D V-Cache 用混合键合把缓存叠上去,第二代把缓存挪到下面解决散热。
  4. Zen c 用同一设计做更小的核心,服务器核心数八年涨了约八倍。
  5. 无晶圆厂让 AMD 搭上台积电的快车,代价是延迟、待机功耗和产能依赖。
身边的例子与自测

你的游戏机里就有 Zen

身边的例子

PlayStation 5 和 Xbox Series X|S 用的都是 AMD 定制芯片,里面是 8 个 Zen 2 核心加 RDNA 2 显卡,做在一块单片上。Steam Deck 掌机也是 Zen 2。如果你在网上看到“X3D”结尾的 CPU 被称作“游戏神 U”,说的就是 3D V-Cache。很多云服务器的“AMD 实例”,背后就是 EPYC。

进阶

为什么游戏机用单片而不是芯粒?因为游戏机一款要卖上亿台、多年不变,单片设计虽然初期贵,但量大摊薄后单价更低,延迟和功耗也更好。芯粒最适合的是“同一颗计算芯粒要拼出很多种产品”的情况。

1. Zen 2 的 CCD 和 IOD 分别负责什么?为什么用不同工艺?

CCD 放核心和 L3 缓存,负责计算,用最先进的 7 nm;IOD 放内存控制器和 PCIe 等接口,用 12/14 nm。接口电路换新工艺几乎不变小,用老工艺更便宜。

2. 芯片面积从 100 mm² 变成 700 mm²,良率大概会怎样变化?

按 Y ≈ e−A×D,缺陷密度 0.1 个/cm² 时,100 mm² 约 90%,700 mm² 约 50%。面积越大,良率按指数下降,不是线性下降。

3. 第一代和第二代 3D V-Cache 最大的区别是什么?

第一代把 64 MB 缓存芯片叠在 CCD 上面,核心的热要多穿一层,频率受限;第二代(9800X3D)把缓存芯片放到 CCD 下面,核心直接贴近散热盖,频率更高还能超频。

4. Zen 4c 和 Intel 的 E 核思路有什么不同?

Zen 4c 是同一个 Zen 4 设计换更紧凑的版图,指令和 IPC 完全一样,只是频率上限更低、缓存更少;Intel 的 E 核是另一套不同的微架构。

5. 芯粒设计的主要缺点有哪些?

跨芯粒延迟高(跨 CCD 通信接近访问内存的时间),无限总线和 IOD 让待机功耗偏高,CCD 到 IOD 的带宽有限,以及更依赖先进封装产能。

6. 2018 年哪件事让 AMD 全面转向台积电?

格罗方德宣布放弃 7 nm 研发,AMD 只能把最先进的 CPU 交给台积电生产,正好赶上台积电工艺领先的几年。

资料来源

延伸阅读

  • AMD 历年年报(10-K)与财报新闻稿,2011–2025 年营收数据。
  • S. Naffziger 等,“Pioneering Chiplet Technology and Design for the AMD EPYC and Ryzen Processor Families”,ISCA 2021(芯粒成本与良率分析)。
  • AMD Zen、Zen 2、Zen 3、Zen 4、Zen 5 架构发布资料与 Hot Chips / ISSCC 报告(2016–2024);Ryzen 7 5800X3D、9800X3D 发布资料。
  • AMD 与台积电关于 3D V-Cache 与 SoIC 混合键合的公开资料(Computex 2021、ISSCC 2022)。
  • AMD Instinct MI300A 发布资料(2023 年 12 月);劳伦斯利弗莫尔国家实验室 El Capitan 公告(2024)。
  • AMD Ryzen AI Max(Strix Halo)CES 2025 发布资料;EPYC Venice(Zen 6)发布报道(2026)。
  • Mercury Research 关于 x86 服务器 CPU 份额的季度报告(经媒体转述,2017–2026)。
  • Chips and Cheese、AnandTech 等对 Ryzen 核间延迟、内存延迟与待机功耗的评测;WikiChip、TechInsights 对 CCD、IOD 与 Zen 4c 面积的分析。
  • 格罗方德 2018 年 8 月关于暂停 7 nm 研发的公告。
  • 本站相关页面:x86 五十年、走进死胡同的路线、Intel 路线、Intel 与 AMD 对比及 x86 的未来、芯粒与 UCIe、混合键合、三堵墙、CPU 入门。
年份、型号与市场数据为公开报道或厂商资料,2026 年及以后的产品信息以厂商正式发布为准。 内容更新至 2026-10。