走进死胡同的路线·它们为什么退役
CPU 的历史不只是一路成功。Pentium 4 想冲 10 GHz,Itanium 想换掉 x86,Bulldozer 想用“半个核”凑出更多核心。它们都失败了,但每一次失败都给后来的成功留下了图纸。这一页把这些“死胡同”一个个拆开讲。
一张图看完十几条“死胡同”
它们有的活了二十年,有的只活了两年。退役的原因却惊人地相似。
“死胡同”在这里指一条技术路线:厂商花了几年甚至十几年押注,最后发现走不通,只好放弃或掉头。它和“过时”不一样。过时是被更好的东西自然替换;死胡同是当初的判断本身就错了一部分。
读这一页时,每一项都问四个问题:它为什么诞生?想解决什么?缺陷在哪?为什么退役,留下了什么?如果还不熟悉流水线、分支预测、多线程这些词,可以先看 CPU 入门 和 让 CPU 变快的十个发明。
Pentium 4:想冲 10 GHz,撞上了功耗墙
把流水线拉到 31 级换来高主频,最后芯片热得像电炉。
为什么诞生
1990 年代末,买电脑的人只看一个数字:主频(每秒多少拍,单位 MHz、GHz)。2000 年 3 月,AMD 的 Athlon 抢先到了 1 GHz,Intel 很被动(详见 x86 五十年)。Intel 的回答是全新的 NetBurst 架构,2000 年 11 月以 Pentium 4 上市,首发 1.4 和 1.5 GHz。Intel 当时对外说,这套架构能一路扩展到约 10 GHz。
它的构想:把每一步切得更细
流水线就像洗衣房:洗、烘、叠、装袋四个人同时干活,每人只管一步。步骤切得越细,每一步越快,传送带就能转得越快,这就是主频。Pentium 4 把一条指令的处理切成了 20 级,2004 年的 Prescott 版本更是切到 31 级,而前代 Pentium III 大约只有十级出头。
缺陷:长流水线的三笔账
- 猜错代价大。程序里大约每五六条指令就有一个“如果……就跳到……”的分支。CPU 要提前猜方向。猜错一次,流水线越长,浪费越多。
- 每拍干的活少。主频高了,但每一拍完成的指令数(叫 IPC)下降。同频率下,Pentium 4 比 Pentium III 还慢。
- 功耗暴涨。主频越高,需要的电压越高,功耗大致随“频率 × 电压²”上涨。这正好赶上 2005 年前后晶体管漏电变严重,电压降不下去了。
拖动滑块看看。
玩具模型:主频由“每级逻辑 + 固定的锁存开销”决定,并按 31 级约 3.8 GHz 校准;每条指令的拍数包含分支猜错和内存等待(内存延迟按纳秒固定,主频越高等的拍数越多);功耗按频率平方与级数估算。数字只用来看趋势。
它解决了什么
- 主频数字在广告上压过对手,2002 年就到了 3 GHz。
- 首次在桌面引入超线程(2002 年 3.06 GHz 型号)。
- SSE2 指令和高带宽总线,在视频编码等流式任务上很快。
它的缺陷
- 同频率性能低,猜错分支损失大。
- 功耗和发热失控,笔记本根本装不下。
- 押注“主频会一直涨”,正好撞上物理极限。
为什么退役,留下了什么
救 Intel 的是一个边缘团队。以色列海法的设计中心没有用 NetBurst,而是在老的 P6 架构上做了一颗省电的笔记本芯片 Pentium M(2003 年,迅驰平台的核心)。它主频只有 1.x GHz,实际速度却和 2 GHz 以上的 Pentium 4 有得一拼,电池还能撑很久。2006 年 7 月,基于同一思路的 Core 2 上市,台式机也换回了“宽而短”的流水线,NetBurst 在 2008 年前后退出主流(后续见 Intel 路线)。
NetBurst 的遗产:业界从此不再只比主频,开始比每瓦性能;多核成了提速的主路;超线程和 SSE2 保留了下来。
Itanium:想换掉 x86,结果被戏称“Itanic”
把排班的活交给编译器,CPU 自己就能简单又快。前提是编译器真能排好。
为什么诞生
1990 年代初,x86 被认为“包袱太重”:指令长短不一、规则古怪,还得兼容十几年前的软件。HP 正在研究一种叫 EPIC(显式并行指令计算)的新思路,1994 年和 Intel 合作,要做一套全新的 64 位指令集 IA-64,芯片叫 Itanium(安腾)。计划是先占领服务器,再一步步取代 x86。
它的构想:让编译器提前排班
编译器是把程序员写的代码翻译成 CPU 指令的软件。普通 x86 CPU 内部有一套复杂的“乱序执行”电路,在运行时临时判断哪些指令可以一起做。Itanium 认为这套电路太费晶体管,不如让编译器在翻译时就把能并行的指令打包好:每个 128 位的“指令包”放 3 条指令,CPU 照着包执行就行。这类思路也叫 VLIW(超长指令字)。
- 1编译器:程序发布前就决定好哪些指令一起做。它看不到程序运行时的真实情况。
- 2指令包:128 位放 3 条指令,包里的指令保证可以同时执行。
- 3空操作:找不到能并行的指令,只能填“什么都不做”,浪费位置和带宽。
- 4乱序调度器:x86 芯片在运行时看数据有没有到,谁准备好了谁先做。
- 5兼容性:Itanium 运行 x86 程序要靠硬件模拟或软件翻译,性能明显落后。
缺陷:编译器猜不准内存
编译器最大的盲区是内存延迟:一次读内存可能 1 纳秒就从缓存拿到,也可能要等 100 纳秒。这取决于运行时的情况,编译时根本不知道。乱序 CPU 可以边等边做别的事;Itanium 的固定排班遇到这种情况只能整组干等。再加上第一代芯片 Merced 原计划 1998 年上市,拖到 2001 年才发货,性能还不如同期 x86,媒体戏称它为“Itanic”(和泰坦尼克号押韵)。
致命一击来自 AMD。2003 年 AMD 推出 AMD64:在 x86 上直接扩展出 64 位,老软件照跑不误。客户不需要重写程序,就能用上 64 位。2004 年 Intel 也只好采用同样的扩展。从此 Itanium 只剩下 HP 高端服务器这一个主要客户。
为什么退役,留下了什么
最后一代 Itanium 9700(Kittson)在 2017 年推出,2020 年 1 月停止接单,2021 年 7 月最后一批出货。2024 年初发布的 Linux 6.7 也删掉了对它的支持。它的遗产:64 位 x86 成为标准;Itanium 上的一些高可靠性功能(例如内存错误恢复)后来进入了 Xeon;“只靠编译器排班”的思路被证明不适合通用 CPU,但在 GPU、DSP 和 AI 加速器里仍有用武之地(见 AI 芯片)。
Bulldozer:两个核共用一套零件,差点拖垮 AMD
用“半个核”的成本凑出两个核,核数好看了,单个核却变弱了。
为什么诞生
2000 年代后期,CPU 进入多核时代,服务器软件越来越能同时用很多线程。AMD 预判:以后比的是核数和总吞吐量,而且很多计算会交给显卡(AMD 2006 年收购了 ATI)。于是它设计了一种叫 CMT(集群多线程)的结构:把两个整数核绑成一个“模块”,让它们共用取指、译码、浮点单元和二级缓存。2011 年 10 月,首款 FX-8150 上市,宣传为“8 核”,其实是 4 个模块。
- 1共享前端:两个核轮流用同一个译码器,两边都忙时互相抢,谁都喂不饱。
- 2整数核:每个核的整数执行单元比上一代 Phenom II 还窄,单线程变慢。
- 3共享浮点:一个模块只有一套浮点单元,做科学计算、游戏物理时更吃亏。
- 4Zen 的做法:每个核完整、宽大,再用 SMT(同时多线程)让两个线程共享一个强核。示意,不按比例。
缺陷:赌错了软件的方向
- 单线程弱。游戏和日常软件大多靠一两个线程。Bulldozer 单线程性能有时还不如自家上一代,更远远落后于同期 Intel 的 Sandy Bridge。
- 高主频高功耗。为了弥补,它又走了“长流水线、高主频”的老路,FX-9590 这样的型号 TDP 达到 220 W。
- “8 核”争议。2015 年美国消费者发起集体诉讼,认为一个模块不应该算两个核。AMD 不认错,但在 2019 年以约 1210 万美元和解。
- 制程也拖后腿。它用 GlobalFoundries 的 32 nm 和 28 nm 工艺,后来一直没等到更先进的高性能工艺。
为什么退役,留下了什么
Bulldozer 之后的 Piledriver(2012)、Steamroller(2014)、Excavator(2015)一路修补,但没法改掉根本结构。那几年 AMD 连年亏损,股价一度跌到 2 美元以下。2012 年 Jim Keller 回到 AMD,带队从零设计 Zen:放弃模块共享,回到“一个强核 + SMT 两线程”。2017 年 3 月 Ryzen 上市,AMD 称每拍性能比 Excavator 提升约 52%。Bulldozer 的教训几乎逐条写进了 Zen 的设计(详见 AMD 路线)。
早期 Atom 与 Larrabee:x86 想去它不擅长的地方
一个想进手机,一个想做显卡。两次都发现,x86 不是万能钥匙。
Atom:为什么诞生,为什么失败
2008 年,Intel 推出 Atom:一颗极简的 x86 小核,采用顺序执行(指令严格排队,不乱序,省掉大量电路),功耗只有几瓦。它先在“上网本”上大卖。可 2010 年 iPad 发布后,平板和智能手机迅速吃掉了上网本市场。
Intel 随后推出手机芯片(2012 年的 Medfield 等),可手机世界早已是 ARM 的天下:软件、基带、厂商关系都不在 Intel 手里。为了打开市场,Intel 大量补贴,2014 年移动业务据报道亏损约 40 亿美元。2016 年 4 月,Intel 取消了 Broxton 和 SoFIA 两条手机芯片线,基本退出手机。
Larrabee:为什么诞生,为什么失败
同一时期,GPU 开始被用来做通用计算(NVIDIA 2006–2007 年推出 CUDA)。Intel 想:何不用几十个小 x86 核、每个配一个 512 位的宽向量单元,用软件来画图形?这就是 2008 年公布的 Larrabee。好处是程序员熟悉 x86,坏处是做图形远不如专门的 GPU 电路高效。2009 年 12 月,Intel 取消了 Larrabee 显卡产品,把它改造成高性能计算用的 Xeon Phi。
Xeon Phi 曾经风光过:2013 到 2015 年间,用它的中国“天河二号”连续排名世界超算第一。但 NVIDIA 的 GPU 在每瓦算力和软件生态(CUDA)上越拉越远,深度学习兴起后差距更大。2017 年 Intel 取消下一代 Knights Hill,几年内全线停产。Intel 后来重新做真正的 GPU(Xe 架构、2022 年的 Arc 显卡),等于承认了 Larrabee 的方向走不通。
x86 像一把功能很全的瑞士军刀。在电脑上,它什么都能干,大家也习惯了。但到了手机这个“厨房”,人们要的是一把又轻又快的菜刀(ARM);到了图形这个“木工房”,要的是一台电锯(GPU)。瑞士军刀再好,也赢不了专用工具。
14nm+++ 与 Tick-Tock 的终结
一个节拍器坏了,Intel 在同一代工艺上停了六年。
Tick-Tock 为什么诞生
2007 年起,Intel 用一种叫 Tick-Tock 的节奏推进产品:Tick 年换新制程(把晶体管做得更小,见 晶体管与制程),沿用旧架构;Tock 年换新架构(芯片内部设计),沿用已经成熟的制程。一次只冒一种风险,大约每两年进一代工艺。这个节奏让 Intel 领先对手近十年。
它是怎么坏掉的
14 nm 就开始吃力:Broadwell 延误到 2014 年底才少量上市。下一代 10 nm 目标定得极高:晶体管密度提升约 2.7 倍,还用了钴互连、四重曝光等一大堆新技术,结果良率长期上不去。2016 年 3 月,Intel 在年报里宣布 Tick-Tock 改成 PAO(制程、架构、优化三步走)。实际上“优化”变成了一次又一次:14nm+、14nm++、14nm+++。
Cannon Lake:只出了一款的 10 nm 首发
为了兑现“10 nm 已出货”的承诺,Intel 在 2018 年 5 月推出 Cannon Lake 架构的 Core i3-8121U:只有 2 个核,核显被屏蔽,只出现在少数笔记本和迷你主机里。很快它就悄悄停产,被 2019 年的 Ice Lake 取代。它几乎是一颗“证明存在”的芯片。
留下了什么
3DNow!、超线程、傲腾、Quark
有的被更好的东西取代,有的只是“不划算了”,有的还没完全死透。
AMD 3DNow!(1998–2010)
为什么诞生:1998 年 3D 游戏爆发,Intel 的 MMX 只能算整数。AMD 在 K6-2 上抢先推出 3DNow!,一次能算两个浮点数,加速 3D 画面。
缺陷:只有 AMD 支持,软件要专门适配;1999 年 Intel 推出更强的 SSE,很快成为业界标准。
结局:2010 年 AMD 宣布弃用,从 2011 年的 Bulldozer 起基本移除(只保留两条预取指令)。已退役
Intel 超线程(2002– ,部分新芯片去掉)
为什么诞生:一个核心常常有部件闲着。超线程(SMT)让一个核同时跑两个线程,把空闲部件用起来,2002 年随 Pentium 4 进入桌面。
为什么被拿掉:Intel 有了 E 核来负责多线程吞吐;超线程要额外的电路和安全隔离(2018 年后多个侧信道漏洞与它有关)。2024 年的 Lunar Lake、Arrow Lake 的 P 核不再支持超线程。
现状:Xeon 服务器和 AMD 仍在用;据报道 Intel 未来部分服务器芯片会恢复。部分退场
Intel Optane 傲腾(2017–2022)
为什么诞生:内存(DRAM)快但贵、断电就丢;固态硬盘便宜但慢上千倍。Intel 和美光 2015 年公布 3D XPoint 新材料,想填中间的空档。
缺陷:比闪存贵很多,又比 DRAM 慢;只有 Intel 一家用,软件要专门改;2021 年美光退出生产。
结局:2022 年 7 月 Intel 宣布停止该业务,计提约 5.59 亿美元损失。已退役
Intel Quark(2013–约 2019)
为什么诞生:2013 年物联网概念升温,Intel 想用一颗极小的 x86 芯片(指令集相当于老 Pentium)进入传感器、穿戴设备,还推出 Galileo、Edison 开发板。
缺陷:和 ARM Cortex-M 单片机比,更贵、更耗电,生态也小。
结局:2017 年开发板全部停产,Quark 芯片约 2019 年停产。已退役
针脚从 CPU 搬到了主板:PGA 退场
不是一个产品失败了,而是一种“插法”跟不上了。
CPU 要装到主板上,就得有成百上千个电气触点(插法的基础见 CPU 入门,封装见 倒装芯片)。早年主流是 PGA(针栅阵列):针长在 CPU 底部,插进主板插座的孔里。后来变成 LGA(触点栅格阵列):CPU 底部只有平的金属触点,弹簧针长在主板插座上,靠扣具压紧。
- 1金属顶盖:盖在芯片上面,把热传给散热器。
- 2CPU 上的针:PGA 的针长在 CPU 封装基板底部。
- 3插座的孔:主板插座只有孔,便宜、结实。
- 4平触点:LGA 的 CPU 底部只有金属小圆片,不怕碰。
- 5弹簧针:长在插座里,靠扣具压力和触点接触。
PGA 为什么退场:触点越来越多(DDR5、PCIe 5.0、更多供电),针要更密更细,长在几百美元的 CPU 上太容易弯;弹簧触点也让信号和供电更好。Intel 台式机 2004 年就转向了 LGA,服务器也早已是 LGA;笔记本则在约 2014 年以后基本改成直接焊在主板上的 BGA,为了更薄。AMD 台式机坚持到 2022 年 AM5 才换。
LGA 的缺陷:弯针的风险转移到了主板插座上;大尺寸 LGA 需要很强的扣具,例如 Intel LGA1700 曾被发现压力不均会让 CPU 轻微弯曲。PGA 今天主要只剩在少数老平台和工控产品上。
每条死胡同,都给后来的路留了图纸
把教训连起来看,就是今天 Intel 和 AMD CPU 的设计原则。
| 技术 | 诞生 | 解决什么 | 缺陷 | 现状 / 去向 |
|---|---|---|---|---|
| NetBurst / Pentium 4 | 2000 | 用超长流水线冲高主频 | 每拍性能低,猜错代价大,功耗失控 | 2004 年取消 Tejas,2006 年被 Core 2 取代 |
| Itanium / IA-64 | 2001 | 用编译器排班取代复杂的 x86 硬件 | 编译器猜不准内存延迟,x86 兼容差,严重延误 | AMD64 胜出;2021 年 7 月最后出货 |
| Bulldozer(CMT) | 2011 | 用共享模块低成本堆核数 | 单线程弱、功耗高,“8 核”诉讼 | 2017 年被 Zen 取代,教训写进 Zen |
| Atom 早期 / 手机 | 2008 | 做省电的 x86 小核进上网本、手机 | 手机生态是 ARM 的,靠补贴亏损 | 2016 年退出手机;血统延续为 E 核 |
| Larrabee / Xeon Phi | 2008 / 2012 | 用很多 x86 小核做显卡和并行计算 | 图形性能不够,每瓦算力输给 GPU | 显卡 2009 年取消;Xeon Phi 约 2020 年停产;留下 AVX-512 |
| Tick-Tock 与 14nm+++ | 2007 | 两年一代工艺,一次只冒一种风险 | 10 nm 目标过激,一卡全卡 | 2016 年改 PAO;2021 年改名与 IDM 2.0 |
| Cannon Lake | 2018 | 兑现 10 nm 出货承诺 | 良率差,只出一款,核显被屏蔽 | 2019 年被 Ice Lake 取代 |
| 3DNow! | 1998 | 加速 3D 游戏的浮点计算 | 只有 AMD 支持,被 SSE 压过 | 2010 年宣布弃用 |
| 超线程(Intel 消费级) | 2002 | 让一个核同时跑两个线程 | 占面积与功耗,安全隔离麻烦 | 2024 年起部分新芯片去掉;服务器和 AMD 仍在用 |
| Optane 傲腾 | 2017 | 填补内存与闪存之间的速度空档 | 太贵,生态小,美光退出 | 2022 年停止;CXL 接棒 |
| Quark | 2013 | 用 x86 进物联网 | 贵、耗电,输给 ARM 单片机 | 约 2019 年停产 |
| 台式机 PGA | 1990s | CPU 可插拔,插座便宜 | 针多了易弯,信号和供电受限 | Intel 2004 年、AMD 2022 年改用 LGA |
- Pentium 4 证明:只追主频会撞上功耗墙,每瓦性能才是硬道理。
- Itanium 证明:x86 的兼容性比“更干净的指令集”更值钱;AMD64 因此胜出。
- Bulldozer 证明:单线程性能不能牺牲;Zen 用“强核 + SMT”翻盘。
- Atom 早期、Larrabee、Quark 证明:x86 进入手机、图形、物联网都打不过专用方案。
- 14nm+++ 证明:把设计绑死在一种工艺上很危险;这推动了 tile 拆分和外包制造。
- 3DNow!、傲腾、PGA 的退场说明:没有生态或成本优势的技术,再巧妙也难活。
你家可能还藏着一台“死胡同”
2005 年前后的台式机,很多装的是 Pentium 4,风扇呼呼响、机箱烫手,那就是 NetBurst 的功耗墙。2009 年前后流行的 10 寸上网本,几乎都是 Atom N270/N280。如果你拆过 AMD 锐龙 5000 系列以前的 CPU,会看到底部密密麻麻的针(AM4 PGA);换成锐龙 7000 以后,底部变成了平的触点(AM5 LGA)。
1. Pentium 4 为什么要把流水线做到 20 级甚至 31 级?代价是什么?
为了提高主频:每一级的活越少,每拍可以越短。代价是分支猜错时要倒掉更多半成品、每拍完成的指令变少,而且高主频带来高电压和高功耗,最后撞上功耗墙。
2. Itanium 的“编译器排班”最怕什么?
最怕运行时才知道的事情,尤其是内存延迟。编译器不知道一次读内存要等 1 纳秒还是 100 纳秒,固定的指令包只能整组等待,而乱序 x86 可以边等边做别的。
3. 是什么让 Itanium 失去了取代 x86 的机会?
2003 年 AMD 推出 AMD64,在 x86 上直接扩展 64 位,老软件照跑。客户不用重写程序就能用 64 位,Intel 2004 年也跟进,Itanium 就只剩小众市场。
4. Bulldozer 的一个“模块”里哪些部件是共享的?为什么这让单线程变弱?
共享取指与译码前端、浮点单元和二级缓存。每个整数核本身做得更窄,前端又要两边轮流用,单个线程能用到的资源就少了。
5. Intel 的 Tick-Tock 是什么?为什么在 2016 年停止?
Tick 年换新制程、Tock 年换新架构,大约两年一代工艺。10 nm 目标过于激进,良率长期上不去,14 nm 被迫延长使用,2016 年改为“制程、架构、优化”三步。
6. 举两个例子说明“失败的路线也留下了遗产”。
例如:Pentium M 的省电设计发展成 Core 2;Xeon Phi 首先用上的 AVX-512 进入 Xeon;Atom 血统的小核成了 E 核;Bulldozer 的教训塑造了 Zen。
延伸阅读
- Intel,Pentium 4 / NetBurst 微架构技术白皮书与发布资料(2000–2004);关于取消 Tejas 与 Jayhawk 的公告与媒体报道(2004 年 5 月)。
- Intel 处理器数据手册中 Pentium 4(Willamette、Northwood、Prescott)各型号的 TDP 数据。
- HP 与 Intel,IA-64 / EPIC 架构资料;Intel Itanium 9700 停产通知(2019 年发布,2020 年 1 月停止接单,2021 年 7 月最后出货);Linux 6.7 移除 IA-64 支持的内核提交记录。
- AMD,Bulldozer / FX 系列发布资料(2011);Dickey v. AMD 集体诉讼和解文件(2019);AMD Zen 发布资料(2016–2017,“IPC 提升约 52%”)。
- L. Seiler 等,“Larrabee: A Many-Core x86 Architecture for Visual Computing”,SIGGRAPH 2008;Intel Xeon Phi 产品停产通知(2018–2019);TOP500 榜单(2013–2015)。
- Intel 年报与财报:移动与通信业务亏损(2014)、取消 Broxton 与 SoFIA(2016 年 4 月)、Form 10-K 中关于 PAO 的说明(2016 年 3 月)、Optane 业务结束(2022 年 7 月)。
- Intel,10 nm 工艺与 Cannon Lake(Core i3-8121U)资料(2018);Intel Accelerated 活动,工艺改名与 IDM 2.0(2021)。
- AMD,3DNow! 弃用说明(AMD 开发者博客,2010);Intel 与美光 3D XPoint 发布资料(2015)。
- Intel Lunar Lake 与 Arrow Lake 架构发布资料(2024),关于 P 核去除超线程的说明;关于 Intel 未来服务器芯片恢复多线程的媒体报道(2025)。
- AMD AM5(LGA1718)与 AM4 插座资料;Intel LGA775(2004)与 LGA1700 资料及相关评测报道。
- 本站相关页面:x86 五十年、让 CPU 变快的十个发明、Intel 路线、AMD 路线、晶体管与制程、术语词典。