Yiek Heng 的知识空间
首页CPUCPU 基础基础概念诞生:1971(Intel 4004)2026-10-11
Intel 与 AMD CPU · 第 1 页

CPU 入门·一颗处理器到底在干什么

电脑里最贵的那颗芯片叫 CPU。这一页从零讲起:它由什么做成,一条指令怎么被执行,GHz、缓存、指令集、核心、线程这些词是什么意思,以及它怎么装进主板。每个概念都讲清楚:它为什么诞生,解决了什么,又留下了什么问题。

只会三件事取一条指令,看懂它,执行它。每秒重复几十亿次。
速度靠“等得少”算得快不难,难的是数据别让 CPU 干等。缓存就是为此而生。
x86 是一门“语言”Intel 和 AMD 的 CPU 都说 x86,所以同一份 Windows 两家都能跑。
它为什么诞生

CPU 是电脑里的“总指挥”

CPU 的全称是中央处理器(Central Processing Unit)。电脑里的大多数事情,都要先经过它。

1945 年前后的第一代电子计算机 ENIAC,换一个计算任务要靠人重新插线、拨开关,一插就是几天。同年,数学家冯·诺依曼在一份报告里提出了一个关键想法:把“要做的步骤”(程序)也当成数据,和要处理的数一起存进内存。机器只要按顺序读出步骤、照着做就行,换任务只要换内容,不用换线。这就是“存储程序”结构,今天几乎所有 CPU 都还按这个思路工作。

早期的 CPU 由成柜子的电路板拼成。1971 年,Intel 把整个处理器做进了一颗芯片,这就是 4004:约 2300 个晶体管,4 位,最高约 740 kHz。“一颗芯片就是一个处理器”,所以叫微处理器。五十多年后,一颗台式机 CPU 里有几十亿到上百亿个晶体管,两家主要厂商是 Intel 和 AMD(这段恩怨见 x86 五十年)。

CPU 和 GPU 有什么不一样

GPU(图形处理器)原本专门画游戏画面,1999 年 NVIDIA 把它作为独立概念推出。画面上几百万个像素,每个都做差不多的计算,于是 GPU 走了另一条路:放成千上万个简单的小核心,一起做同一种事。CPU 则相反:只有几个到几十个核心,但每个都很聪明,会猜下一步、会调换顺序、能应付千变万化的程序。今天的 AI 训练主要靠 GPU,原因见 AI 芯片。

CPU 像几位全能大厨,什么菜都会做,还会随机应变;GPU 像一条流水线上的几千个帮工,每人只会切一种菜,但一起切得飞快。
CPU:几位全能大厨 核心核心核心核心 核心核心核心核心 大块缓存 + 复杂的控制逻辑 1 2 核心少,但每个又大又聪明 擅长:步骤多、分支多、要马上响应的活 GPU:成千上万个帮工 小缓存 + 显存接口 3 每个小核心很简单,但数量巨大 擅长:同一个动作重复几百万遍(画面、AI)
← 左右滑动查看 →
  1. 1CPU 核心:能独立执行程序的完整处理单元。台式机常见 6 到 24 个,服务器可达一两百个。
  2. 2缓存与控制逻辑:CPU 有很大一块面积不是用来“算”,而是用来“备料”和“调度”。
  3. 3GPU 小核心:一颗高端显卡据报道有两万多个这样的单元,每个只会简单运算。
要点:示意图,不按比例。CPU 把面积花在“让一条指令尽快做完”上;GPU 把面积花在“同时做尽量多条”上。两者是分工,不是谁取代谁。
它是怎么工作的 · 最底层

从开关到加法:晶体管、逻辑门、加法器

CPU 不认识“3”和“5”,它只认识“通电”和“不通电”。所有计算都从这里长出来。

晶体管是一个用电控制的开关:给它的控制端加电压,它就导通;撤掉,就断开(详见 晶体管与制程)。“通”记作 1,“断”记作 0。只用 0 和 1 来表示数,叫二进制。比如十进制的 5,二进制写作 101。

1937 年,还是研究生的香农(Claude Shannon)发现:把开关串起来、并起来,正好能实现一百年前布尔提出的逻辑运算“与、或、非”。这种用几个晶体管搭出来、做一种逻辑判断的小电路,叫逻辑门:

  • 与门(AND):两个输入都是 1,输出才是 1。像两个串联的开关。
  • 或门(OR):有一个是 1,输出就是 1。像两个并联的开关。
  • 异或门(XOR):两个输入不一样时输出 1。

把一个异或门和一个与门放在一起,就能算 1 位二进制加法:异或给出“本位的和”,与门给出“要不要进位”。这叫半加器。再把 64 个加法“格子”首尾相连,就是能算 64 位数的加法器。CPU 里负责算术和逻辑运算的部件叫 ALU(算术逻辑单元),它的核心就是这些加法器。

① 开关串起来 电源 A B 灯 1 A、B 都接通,灯才亮 这就是“与门” AND 每个方块代表一个晶体管开关 ② 门拼成半加器 A B 异或 XOR 与 AND 和 S 进位 C 2 3 A、B 各是 1 位二进制数 S 是这一位的和,C 是进到下一位的 1 ③ 1 位加法表 AB和 S进位 C 0000 0110 1010 1101 4 1 + 1 = 10(二进制) 64 个连起来 = 64 位加法器 示意:真实芯片中一个逻辑门由几个到十几个晶体管组成
← 左右滑动查看 →
  1. 1晶体管开关:两个串联,只有都接通电流才过去,这就是“与”。
  2. 2逻辑门:异或门判断“两个数是否不同”,与门判断“是否都是 1”。
  3. 3两个输出:S 是本位的结果,C 是进位,要交给左边那一位。
  4. 41 + 1:本位写 0,向前进 1,和小学竖式加法一样。
打个比方

晶体管是砖,逻辑门是墙,加法器是房间,CPU 是一整栋楼。盖楼的人不用每次都想砖怎么烧,设计 CPU 的工程师也是一层层往上搭,底下的细节交给工具。

它是怎么工作的 · 一条指令的一生

取指、译码、执行:CPU 唯一会做的事

再复杂的软件,到了 CPU 这里都被拆成一条条极简单的“指令”,排队等着被执行。

指令是 CPU 能直接执行的最小命令,比如“把两个数相加”“从内存第 100 号格子读一个数”“如果结果是 0 就跳到别处”。程序就是一长串指令,存放在内存里。内存像一排带编号的格子,编号叫地址。

CPU 里有一个专门的小格子叫程序计数器(PC),它记着“下一条指令在哪个地址”。CPU 就这样一圈圈地转:

  1. 取指按 PC 的地址,把指令从内存搬进来,PC 加一。
  2. 译码看懂这条指令:要做加法?用哪几个数?
  3. 执行让 ALU 去算,或者去内存读写。
  4. 写回把结果存进寄存器,然后回到第 1 步。

遇到“跳转”指令时,CPU 直接改写 PC,下一圈就从别的地址开始取。if 判断、循环,都是这样实现的。

内存:带编号的格子 0 号 · 指令 1 号 · 指令 ← PC 2 号 · 指令 3 号 · 指令 4 号 · 数据 5 号 · 数据 沿总线送进 CPU 取指译码执行写回 按 PC 取指令看懂要干什么ALU 去算存进寄存器 1 2 3 4 转一圈 = 处理一条指令 每秒转几十亿圈 示意。真实 CPU 把每步拆得更细,还让多条指令错开同时进行(流水线)
← 左右滑动查看 →
  1. 1取指 Fetch:PC 指向哪里,就去哪里取指令。
  2. 2译码 Decode:把指令的 0 和 1 翻译成“开哪些开关”。
  3. 3执行 Execute:ALU 做运算,或者访问内存。
  4. 4写回 Write-back:结果放进寄存器,准备下一圈。
动手:一步步看 CPU 算 2 + 3
内存 0 LOAD R1, [6] 1 LOAD R2, [7] 2 ADD R1, R2 3 STORE R1, [8] 4 HALT 5 (空) 6 数据:2 7 数据:3 8 数据:0 CPU 取指 译码 执行 PC 程序计数器 0 IR 指令寄存器 (空) R1 0 R2 0 ALU 运算器 空闲 已用步数:0(简化成每步一个时钟周期)
← 左右滑动查看 →

准备程序已经放在内存 0 到 4 号格子里,两个要加的数放在 6、7 号。点“下一步”开始。

进阶

上面每一步都要等前一步做完,很慢。真实 CPU 会让多条指令像洗衣房里的衣服一样“流水”通过:第一件在烘干时,第二件已经在洗。还会同时开好几条流水线、提前猜跳转方向、打乱顺序先做能做的。这些“让 CPU 变快的发明”见 CPU 微架构。

它是怎么工作的 · 节拍

时钟与 GHz:让几十亿个开关踩同一个节拍

CPU 里有一个一直在“滴答”的信号,叫时钟。所有动作都跟着它走。

为什么需要时钟?加法器算出结果需要一点点时间,不同路径快慢不一。如果谁算完谁就往下传,后面的电路会收到一半新一半旧的数据,乱成一团。解决办法是像乐队指挥一样,给全芯片发一个统一的节拍:每“滴答”一下,所有寄存器同时把上一拍算好的结果存下来,中间的电路只要在一拍之内算完就行。这种设计叫同步电路,几乎所有 CPU 都是这样。

每秒“滴答”多少下,就是时钟频率,单位赫兹(Hz)。1 GHz 是每秒 10 亿下。4004 约 0.74 MHz;2000 年 AMD Athlon 率先到 1 GHz;今天台式机 CPU 最高约 5 到 6 GHz。

频率高就一定快吗?

不一定。性能约等于 频率 × 每拍完成的指令数(IPC)。一颗 4 GHz、每拍做 6 条的 CPU,比一颗 5 GHz、每拍只做 3 条的快得多。2000 年代初 Intel 的 Pentium 4 就是只追频率、吃了大亏的例子(见 走进死胡同的路线)。

它的缺陷:频率墙

每次“滴答”都要给大量导线充放电。功耗大约和 电压² × 频率 成正比,而频率越高往往还要加电压,所以频率稍涨,发热猛涨。2005 年前后,频率被热量卡在了 4 GHz 附近,之后厂商改走“多核”路线(背景见 晶体管与制程)。今天的频率只是缓慢爬升,CPU 还会根据温度和负载自动升降频率,叫睿频。

时钟信号:每秒跳几十亿下 1 个周期 1 0 1 时钟 时钟 寄存器 A 逻辑电路(加法器等) 必须在一个周期内算完 寄存器 B 2 3 4 时钟每跳一下, 寄存器同时存下 这一拍的结果 频率 = 每秒的周期数:1 GHz = 每秒 10 亿个周期 5 GHz 时一个周期只有 0.2 纳秒,光在这段时间里只能走约 6 厘米
← 左右滑动查看 →
  1. 1上升沿:信号从 0 跳到 1 的瞬间,相当于指挥棒落下。
  2. 2寄存器 A:保存上一拍的结果,并把它交给后面的电路。
  3. 3逻辑电路:最慢的一条路径决定了一拍至少要多长,也就决定了最高频率。
  4. 4寄存器 B:下一个上升沿到来时,把新结果存下。
时钟就像划龙舟的鼓点。鼓敲得越快船越快,但划手跟不上,或者累得满头大汗,鼓就不能再快了。
它是怎么工作的 · 放东西的地方

寄存器、缓存、内存与总线

CPU 算得非常快,真正拖后腿的往往是“数据还没送到”。所以放数据的地方被分成了好几层。

寄存器是 CPU 内部最小、最快的存储格子,ALU 只能直接对它们做运算。x86 CPU 的通用寄存器只有 16 个,每个 64 位(8 字节)。内存(DRAM,就是你买电脑时说的“16 GB 内存”)大得多,但在芯片外面,取一次数据要约 80 到 100 纳秒,这期间 CPU 本可以执行几百条指令。

为了填补这个巨大的速度差,人们在 CPU 里放了几层缓存(Cache):用速度快但占地方的 SRAM 做的小仓库,自动保存“最近用过、马上可能还要用”的数据。1968 年 IBM 的大型机最早商用了缓存;1989 年 Intel 的 i486 第一次把 8 KB 缓存做进了 x86 芯片里。今天通常分三层:每个核心自己的 L1、L2,加上所有核心共享的 L3。

缓存有效,是因为程序有“习惯”:刚用过的数据很可能马上再用,挨着的数据也很可能接着用。猜中了叫命中,猜不中叫未命中,只好去下一层找。缓存的缺陷是占面积大、费电,而且 SRAM 很难随工艺继续缩小,所以 AMD 后来干脆把额外缓存叠在芯片上面(见 AMD 路线)。

层级典型容量延迟(对数刻度)若 1 纳秒 = 1 秒 寄存器L1 缓存L2 缓存L3 缓存内存 DRAM固态硬盘 16 个 × 8 字节每核几十 KB每核 1 到 3 MB全芯片几十 MB16 到 64 GB1 到 4 TB <0.3 ns约 1 ns约 3 到 5 ns约 10 到 20 ns约 80 到 100 ns约 80 µs 伸手就拿1 秒 · 桌上便签约 4 秒 · 抽屉约 15 秒 · 身后书架约 1.5 分 · 资料室约 1 天 · 外地仓库 1 ns100 ns10 µs 1 2 现代台式 CPU 的典型量级,型号间差别很大;固态硬盘为随机读取延迟
← 左右滑动查看 →
  1. 1L1 到 L3 缓存:越靠近核心越小越快。L1 每个核心只有几十 KB,却能在约 1 纳秒内给出数据。
  2. 2内存:容量是 L3 的上千倍,但慢了几十倍。数据不在缓存里时,CPU 只能干等,这叫“内存墙”。
要点:每往下一层,容量大约大十倍到上千倍,速度慢好几倍到上千倍。CPU 设计里很大一部分功夫,都花在“让需要的数据提前待在上面几层”。

总线:数据走的路

总线是芯片之间传数据的一组导线,加上一套“谁先说话”的规矩。1990 年代到 2000 年代的 PC,CPU 通过一条叫前端总线(FSB)的共享通道连到主板上的“北桥”芯片,再由北桥去连内存和显卡。它的好处是结构简单、各家零件好搭配;缺陷是所有数据挤一条路,CPU 越快越堵。

于是 AMD 在 2003 年的 K8(Athlon 64、Opteron)里把内存控制器直接搬进了 CPU,并改用点对点的 HyperTransport 连接;Intel 在 2008 年的 Nehalem(第一代 Core i7)跟进,改用 QPI。前端总线和北桥就此退役。今天 CPU 自己直接连内存和 PCIe 设备(显卡、固态硬盘),剩下的 USB、网卡等慢速设备才交给主板上的芯片组。

约 2000 年:一条共享大马路 CPU 前端总线 北桥芯片 内存 显卡 南桥:USB、硬盘 1 2 今天:内存直接接到 CPU 上 核心 核心 内存控制器 PCIe 控制器 内存 DDR5 显卡、固态硬盘 芯片组:USB 等 3 4
← 左右滑动查看 →
  1. 1前端总线 FSB:CPU 和外界的唯一通道,内存、显卡、硬盘的数据都要挤这一条。
  2. 2北桥:主板上的“中转站”,内存控制器当年在这里,多绕了一道。
  3. 3集成内存控制器:AMD 2003 年、Intel 2008 年搬进 CPU,内存延迟明显下降。
  4. 4PCIe 控制器:显卡、固态硬盘直接接 CPU,北桥彻底消失。
结构示意,不按比例。今天笔记本 CPU 往往连芯片组都并进了封装里,主板更简单。
它是怎么工作的 · CPU 的语言

指令集:CPU 听得懂的“词典”

x86、ARM、RISC-V 说的都是“指令集”。它决定了一颗 CPU 能运行哪些软件。

指令集(ISA)是 CPU 和软件之间的约定:有哪些指令,每条用哪串 0 和 1 表示,有几个寄存器。软件被编译成某种指令集的机器码,就只能在“说这种语言”的 CPU 上跑。

x86 是 Intel 1978 年为 8086 芯片定的指令集,名字来自 8086、80286、80386 这串型号。IBM PC 选了它,海量软件随之而来,此后每一代都必须兼容老软件。1985 年的 386 把它扩成 32 位;2003 年 AMD 又把它扩成 64 位(x86-64,也叫 AMD64),Intel 后来也采用了。所以今天的 Intel 和 AMD CPU 说的是同一种语言,同一份 Windows 两边都能装。

CISC 和 RISC:两种造词思路

早期内存又贵又小,人们希望一条指令能多干点活,比如“从内存读一个数、加上寄存器里的数、再写回内存”一步完成。这种思路叫 CISC(复杂指令集),x86 就是代表。缺点是指令长短不一(x86 一条 1 到 15 字节)、种类繁多,CPU 很难把它们做快。

1970 年代中到 1980 年代初,IBM 的 801 项目、伯克利的 RISC 项目和斯坦福的 MIPS 项目提出了反方向:只要简单、等长的指令,读写内存和计算分开,硬件做简单了反而能跑得更快。这叫 RISC(精简指令集)。今天手机里的 ARM、开源的 RISC-V 都属于这一派。

x86 的答案很聪明:外面说 CISC,里面做 RISC。1994 年 NexGen 的 Nx586、1995 年 Intel 的 Pentium Pro 开始,CPU 先用译码器把每条复杂的 x86 指令拆成几条简单的微操作(µop),后面的执行部分只处理 µop。今天所有的 x86 CPU 都这样做,代价是译码器又大又费电,所以还加了“µop 缓存”把译好的结果存起来重用。x86 与 ARM 的竞争见 x86 的未来。

x86(CISC):每条 1 到 15 字节 译码器得先找出“每条从哪开始” ARM(RISC):每条固定 4 字节 每条一样长,一眼就能切开 1 2 x86 的内部秘密:先翻译成微操作 µop add [rbx], rax 把内存里的数加上 rax,再写回 译码器 (翻译官) µop 1:从内存地址 rbx 读出数µop 2:把它和 rax 相加µop 3:把结果写回内存 3 4 后面的执行单元只处理这些简单的 µop,内部更像 RISC 示意:方块宽度代表指令字节数;真实拆分方式因型号而异
← 左右滑动查看 →
  1. 1变长指令:读到第一个字节才知道这条有多长,同时译很多条很难。
  2. 2定长指令:每 4 字节一条,可以并排同时译码 8 条甚至更多。
  3. 3译码器:x86 CPU 前端最复杂、最耗电的部件之一。
  4. 4微操作 µop:CPU 内部真正被调度执行的小指令。

x86 的长处

  • 四十多年的软件都能直接跑,兼容性无可替代。
  • 一条指令信息量大,程序占内存少。
  • 内部 µop 设计让它也能享受 RISC 的好处。

x86 的包袱

  • 译码复杂,前端费电、占面积。
  • 为兼容保留了 16 位、32 位时代的大量老规矩。
  • 只有 Intel、AMD 等少数公司有授权,别人不能随便做。
它解决了什么问题 · 一次做更多

核心与线程:从“一个人干”到“一群人干”

频率提不上去以后,CPU 改成在一颗芯片里放好几套“大脑”。

核心(Core)是一套完整的取指、译码、执行电路,能独立跑一串指令。2005 年以前,PC 的 CPU 基本只有一个核心,“同时开很多程序”其实是操作系统让它每秒切换几百上千次,快到你感觉不出。

2001 年 IBM 的 POWER4 第一次在一颗商用芯片上放了两个核心;2005 年 AMD 的 Athlon 64 X2 和 Intel 的 Pentium D 把双核带进了 PC。原因很直接:频率被热量卡住了,而晶体管还在一代代变多,多放几个核心是把晶体管变成性能最直接的办法。今天台式机常见 6 到 24 核,服务器芯片据报道已到 192 核甚至更多。

线程(Thread)是软件里“一串需要按顺序执行的指令”。一个程序可以拆成好几个线程,分给不同核心同时跑。还有一招叫同时多线程(SMT),Intel 叫它超线程,2002 年推出:核心在等内存数据时常常闲着,那就让一个核心同时挂两个线程,A 卡住时 B 顶上。所以你会看到“8 核 16 线程”的说法。

1 个核心 两件事轮流做 1 块之间的缝 = 切换任务的开销 2 个核心 两件事同时做 2 同时做完, 总用时约一半 1 核 + 超线程 两个线程共用一个核 3 线程 1 线程 2 虚线 = 线程 1 在等内存, 线程 2 趁机插进来 时间
← 左右滑动查看 →
  1. 1单核分时:看起来在同时做,其实是飞快地轮流,还要付切换的代价。
  2. 2多核:真正的同时做,前提是软件能拆成多份。
  3. 3超线程:一个核心的“空档”被第二个线程填上,通常多出一到三成性能,远不到翻倍。
示意图。蓝色是任务(线程)1,橙色是任务(线程)2。

多核和超线程的缺陷

  • 软件要会“分工”。很多程序有一部分只能一步接一步做,核心再多也帮不上忙。所以单核性能依然重要,游戏尤其如此。
  • 核心之间要对账。几个核心可能改同一份数据,必须有电路保证大家看到的一致,核心越多越复杂。
  • 超线程有安全隐患。两个线程共用一套部件,一个线程有可能“偷看”另一个的痕迹。加上它占面积、收益不稳定,Intel 在 2024 年的 Lunar Lake 和 Arrow Lake 里去掉了超线程,AMD 的 Zen 系列仍然保留。

另一个新趋势是大小核:Intel 从 2021 年的 Alder Lake 起,把高性能的大核(P 核)和省电省面积的小核(E 核)放在同一颗芯片里,详见 Intel 路线。

现状 · 一颗现代 CPU 的地图

一颗现代 CPU 里都有什么

今天的“CPU”早就不只是 CPU 核心了。它是一个把很多部件塞在一起的“片上系统”。

如果把一颗 2020 年代的台式机或笔记本 CPU 的芯片从上往下看,大概能看到这些区域。核心只占一部分,缓存、核显和各种“接口”占了大片面积。这种把整个系统做进一颗芯片的做法,叫 SoC(片上系统)。

核显(集成显卡)的故事很典型:2010 年 Intel 先把显卡芯片和 CPU 放进同一个封装,2011 年 Intel 的 Sandy Bridge 和 AMD 的 Llano 把它直接做进了同一颗芯片。好处是大多数人不用再买独立显卡;缺陷是它要和 CPU 抢功耗、抢内存带宽。2023 年以后的笔记本 CPU 又多了 NPU(神经网络处理器),专门省电地跑 AI 小任务。

一颗现代 CPU 芯片俯视(示意) 核心核心核心核心 核心核心核心核心 L2L2L2L2 L2L2L2L2 共享 L3 缓存 切成多片,所有核心共用 核显 GPU 画画面、玩轻度游戏 NPU AI 加速 媒体引擎 视频编解码 内存控制器 接 DDR5 输入输出 PCIe · USB 显示输出 1 2 3 4 5 6 7 8 9 示意:参考常见单片 CPU 的布局,不对应具体型号,不按比例 很多新 CPU 把这些部分拆成几颗小芯片再拼起来(芯粒 / tile)
← 左右滑动查看 →
  1. 1CPU 核心:真正执行程序的地方,每个都有自己的 L1 缓存。
  2. 2L2 缓存:每个核心私有的第二层仓库。
  3. 3L3 缓存:所有核心共享,常常是整颗芯片里最大的一块。
  4. 4片上互连:环形总线或网格,把核心、缓存和其他部件连起来。
  5. 5核显:集成显卡,负责画面输出和轻度图形计算。
  6. 6NPU:专做 AI 矩阵运算,比用 CPU 核心省电得多。
  7. 7媒体引擎:专门的视频编解码电路,看视频时 CPU 核心可以休息。
  8. 8内存控制器:管理和内存条之间的数据往来。
  9. 9输入输出:PCIe(接显卡、固态硬盘)、USB、显示接口等。
一颗还是几颗?

早年的 CPU 是“单片”:所有东西做在一整块硅上。芯片越做越大,良率和成本吃不消,AMD 从 2019 年的 Zen 2 起把核心和输入输出拆成多颗“芯粒”,Intel 从 2023 年的 Meteor Lake 起拆成多个“tile”,再用先进封装拼回来(原理见 芯粒与 UCIe)。拆开的具体做法见 AMD 路线 和 Intel 路线。

装进电脑 · 封装与插座

从芯片到主板:LGA、PGA、BGA

一小块硅片不能直接插到主板上。它要先装进封装,再通过针脚、触点或锡球连到主板。

CPU 的硅片(裸片)通常只有指甲盖大小,表面上有成千上万个连接点。它先被倒扣在一块小电路板(封装基板)上,靠密密麻麻的小凸点连接,这叫倒装。基板把细小的连接“放大”成主板能对上的间距。台式机 CPU 上面还盖一块金属顶盖(IHS),保护芯片,把热量均匀传给散热器。

封装底下怎么连主板,有三种主流方式:

  • PGA(针栅阵列):针脚长在 CPU 上,插进主板插座的小孔。1980 年代起普及,1990 年前后的“零插拔力”插座让用户可以自己换 CPU。缺陷是针容易弯,针也很难再做密。AMD 的 AM4(1331 针)是桌面上最后一代主流 PGA,2022 年起换成了 LGA。
  • LGA(触点栅阵列):反过来,CPU 底部只有平的金属触点,弹性针脚长在主板插座上。Intel 2004 年的 LGA775 开始在桌面使用。触点可以更密更多,比如 Intel 的 LGA1700、LGA1851,AMD 的 AM5(LGA1718)。缺陷是主板插座的弹针怕压弯,一弯就要修主板。
  • BGA(球栅阵列):底部是一颗颗锡球,直接焊在主板上,拆不下来(原理见 BGA)。最薄、最省空间、电气性能最好。2010 年代中期起,笔记本 CPU 基本都变成了 BGA,手机芯片更是一直如此。
PGA:针在 CPU 上 LGA:针在主板上 BGA:直接焊死 插座 主板 1 2 3 4 5 6 插座(弹针) 主板 主板(没有插座) 笔记本常不加顶盖 例:AMD AM4(1331 针) 例:Intel LGA1700 / 1851 AMD AM5(LGA1718) 例:几乎所有笔记本、手机 好插好拔,可自己升级 缺点:针容易弯,难再加密 触点更多更密 缺点:主板弹针怕压弯 最薄最省地方,触点最密 缺点:坏了不能单换 现状:桌面端已退役 现状:台式机、服务器主流 现状:移动设备主流
← 左右滑动查看 →
  1. 1顶盖 IHS:金属盖,保护芯片、把热量摊开交给散热器。
  2. 2裸片:真正的硅芯片,下面一层薄薄的是导热材料。
  3. 3凸点:芯片倒扣,用微小的焊点连到基板(倒装)。
  4. 4封装基板:多层小电路板,把芯片的细密连接扩展成主板能对上的间距。
  5. 5针脚 / 触点 / 锡球:封装和主板之间的连接,三种方式的区别就在这里。
  6. 6插座:PGA 和 LGA 才有,让 CPU 可以拆换。
剖面示意,不按比例,插座内部结构做了简化。一颗台式机 CPU 的底部有一千七八百个触点,大部分用来供电和接地。
为什么针越来越多

核心越多,需要的电流越大(高端台式 CPU 满载时据报道可超过 200 安培),只能靠更多的供电触点分担;内存通道、PCIe 通道也在增加。触点从 1990 年代的几百个,涨到今天桌面一千七八百个、服务器四五千个以上。Intel 下一代桌面平台据报道将改用 LGA1954。

汇总

这些基础概念从哪里来,到哪里去

每一项都是为了解决当时的一个具体痛点;解决的同时,也留下了新的问题。

技术诞生解决什么缺陷现状 / 去向
存储程序结构1945,冯·诺依曼的 EDVAC 报告换任务不用重新插线,程序和数据都放内存指令和数据挤一条通道,CPU 常等内存至今所有通用 CPU 的基础,用缓存缓解
微处理器1971,Intel 4004整个 CPU 做进一颗芯片,便宜、小早期很弱:4 位,约 740 kHz主流,几十亿到上百亿晶体管
同步时钟电子计算机诞生之初让所有电路踩同一个节拍,结果不乱功耗随频率猛涨,约 2005 年撞上频率墙最高约 5 到 6 GHz,靠睿频动态调节
片上缓存1968 IBM 大型机;1989 i486 进入 x86 芯片填补 CPU 和内存之间的速度差占面积大、费电,SRAM 难缩小三级缓存成标配,开始 3D 堆叠
前端总线 + 北桥1990 年代 PC用一条总线统一连接 CPU、内存、外设共享带宽,越快越堵退役2003(AMD)、2008(Intel)起被集成内存控制器取代
x86 指令集1978,Intel 8086一套语言,老软件一直能跑变长指令,译码复杂,历史包袱重PC 和服务器主流,面临 ARM 挑战
RISC1975 到 1981,IBM 801、伯克利、斯坦福简单等长指令,硬件好做快早期程序更长、更占内存ARM、RISC-V 主导手机和嵌入式
µop 翻译1994 Nx586、1995 Pentium Pro让 x86 内部享受 RISC 式设计译码器耗电、占面积所有现代 x86 都在用,配 µop 缓存
多核2001 IBM POWER4;2005 进入 PC频率提不动后靠并行提速软件要会分工,核间同步复杂主流:桌面 6 到 24 核,服务器上百核
超线程 SMT2002,Intel填满核心的空闲时间收益不稳,有安全旁路隐患分化AMD 保留,Intel 部分新品去掉
核显2010 同封装;2011 同芯片省掉独立显卡,降成本和功耗和 CPU 抢功耗与内存带宽主流,越来越强,旁边加了 NPU
PGA 插座1980 年代CPU 可插拔、可升级针易弯,密度受限退役桌面最后一代主流是 AMD AM4
LGA 插座2004,Intel LGA775触点更密更多主板弹针易损主流台式机和服务器
BGA 焊接1990 年代最薄、最密、电气最好不能更换,返修难主流笔记本和手机
一页纸总结
  1. CPU 由几十亿个晶体管开关组成,开关搭成逻辑门,逻辑门搭成加法器和整个处理器。
  2. CPU 只会一件事:按程序计数器取指令、译码、执行、写回,每秒几十亿次。
  3. 时钟让所有电路同步;性能约等于频率乘以每拍完成的指令数,频率在 2005 年前后撞墙。
  4. 内存比 CPU 慢上百倍,所以有寄存器、L1、L2、L3 多级缓存;内存控制器也搬进了 CPU。
  5. 指令集是 CPU 的语言。x86 是 CISC,内部把指令拆成 µop 按 RISC 方式执行。
  6. 频率提不动后改走多核与多线程;现代 CPU 还集成了核显、NPU 和各种接口。
  7. 芯片倒装在基板上,再以 LGA(台式)或 BGA(笔记本)连到主板;PGA 已退出桌面。
身边的例子与自测

看看你电脑里的那颗 CPU

身边的例子

Windows 上按 Ctrl + Shift + Esc 打开任务管理器,点“性能”里的 CPU,就能看到型号、“基准速度”(GHz)、“内核”和“逻辑处理器”数量,以及 L1、L2、L3 缓存的大小。如果逻辑处理器是内核数的两倍,说明开着超线程或 SMT。Mac 上的苹果芯片用的是 ARM 指令集,不是 x86,这也是早年一些 Windows 软件不能直接装到新 Mac 上的原因。

1. CPU 的“取指、译码、执行”循环里,程序计数器(PC)起什么作用?

它记着下一条指令在内存里的地址。取指时按它去取,取完自动加一;遇到跳转指令时被直接改写,程序就跳到别处执行。

2. 一颗 5 GHz 的 CPU 一定比 4 GHz 的快吗?

不一定。性能约等于频率乘以每个周期完成的指令数(IPC)。IPC 高的 4 GHz CPU 完全可能更快。Pentium 4 就是只追频率、实际性能不佳的例子。

3. 为什么 CPU 需要好几层缓存,而不是直接用内存?

内存在芯片外,一次读取约 80 到 100 纳秒,CPU 在这段时间里能执行几百条指令。缓存离核心近、速度快,把常用数据放在里面,CPU 就不用干等。

4. x86 是 CISC,为什么说它“里面像 RISC”?

从 1995 年前后开始,x86 CPU 先用译码器把每条复杂指令拆成几条简单的微操作(µop),后面的执行部分只处理这些简单 µop,结构和 RISC 处理器类似。

5. “8 核 16 线程”是什么意思?16 线程等于 16 个核心吗?

8 个物理核心,每个核心用同时多线程(超线程)挂两个线程。两个线程共用一个核心的部件,只是填补空闲,通常只多出一到三成性能,远不等于 16 个核心。

6. LGA 和 PGA 的区别是什么?笔记本为什么多用 BGA?

PGA 的针在 CPU 上,LGA 的针(弹片)在主板插座上,LGA 触点能做得更密。笔记本追求轻薄,BGA 直接把锡球焊在主板上,省掉插座的高度和面积,代价是不能自己更换 CPU。

资料来源

延伸阅读

  • J. von Neumann,“First Draft of a Report on the EDVAC”,1945;C. E. Shannon,“A Symbolic Analysis of Relay and Switching Circuits”,MIT 硕士论文,1937(1938 年发表)。
  • Intel 博物馆与官方资料:4004(1971,约 2300 个晶体管,最高约 740 kHz)、8086(1978)、i486(1989,片上 8 KB 缓存)、Pentium Pro(1995)、超线程技术(2002)、LGA775(2004)。
  • J. L. Hennessy、D. A. Patterson,《计算机体系结构:量化研究方法》与《计算机组成与设计》(CISC/RISC、存储层级、流水线);二人因 RISC 获 2017 年图灵奖。
  • IBM,System/360 Model 85(1968,首个商用缓存)与 POWER4(2001,首款商用双核处理器)资料。
  • AMD,K8(Athlon 64 / Opteron,2003,集成内存控制器与 HyperTransport)、Athlon 64 X2(2005)、AM4 与 AM5(LGA1718,2022)平台资料;Intel Nehalem(2008,QPI 与集成内存控制器)、Sandy Bridge(2011)、Alder Lake(2021)、Lunar Lake 与 Arrow Lake(2024)发布资料。
  • 各级缓存与内存延迟:Chips and Cheese、AnandTech 等对 Zen 4/Zen 5、Raptor Lake/Arrow Lake 的实测文章(典型量级,因型号而异)。
  • 关于 Intel 下一代桌面插槽 LGA1954 的报道(2025 到 2026 年,据报道,未经官方最终确认)。
  • 本站相关页面:晶体管与制程、倒装、BGA、AI 芯片、x86 五十年、CPU 微架构。
年份、型号与市场数据为公开报道或厂商资料,2026 年及以后的产品信息以厂商正式发布为准。 内容更新至 2026-10。