AI 芯片入门·GPU、TPU、NPU 到底在算什么
神经网络听起来神秘,拆开来只有一件事:海量的“乘一下、再加起来”。这一页从这件小事讲起,讲到为什么 GPU 赢了、TPU 和 NPU 是什么,以及一颗数据中心 AI 芯片的封装里装了哪些东西。
神经网络其实是一张巨大的乘法表
先弄懂 AI 在算什么,才明白为什么需要专门的芯片。
神经网络是一种程序,它由很多层“神经元”组成。每个神经元做的事情很简单:把前一层传来的每个数字乘上一个权重(一个可调的系数),全部加起来,再做一个很简单的“修整”(比如负数变成 0),然后传给下一层。
“乘一下再加起来”有个专门的名字,叫乘加运算(MAC,multiply-accumulate)。AI 芯片的所有本事,几乎都围绕着“每秒能做多少次乘加”展开。
一层神经元一起算,就是矩阵乘法
把一层所有神经元的权重排成一个方阵,把输入排成另一个方阵,整层的计算就变成数学里的矩阵乘法:结果里的每一格,都是“左边一行”和“上边一列”逐个相乘再相加。
为什么 CPU 算这个很慢
CPU(中央处理器,电脑和手机的“总管”)只有几个到几十个核心(独立干活的计算单元)。每个核心都很聪明:能猜下一步、能处理复杂的分支、能快速切换任务。可是这些聪明的电路占了大量面积,真正做乘法的部分只是一小块。
GPU(图形处理器)走的是另一条路:放几千个简单的小核心,每个只会按指令做算术,大家听同一个口令一起算。矩阵乘法正好是“很多格子同时算、互不干扰”的活,GPU 天生适合。
CPU 像一位教授,什么难题都能解,但一次只能解几道;GPU 像坐满一个体育场的小学生,每人只会算一道乘法,可是几万人一起举手,一秒钟就交出几万个答案。
GPU 怎么从打游戏变成训练 AI
- 1999
NVIDIA 推出 GeForce 256,首次用“GPU”这个名字。那时它只负责画游戏画面。
- 2006
NVIDIA 发布 CUDA(2007 年开放下载):程序员第一次能用类似 C 语言的方式,让 GPU 做任意计算,而不只是画三角形。
- 2012
AlexNet:多伦多大学的三个人用两块 GeForce GTX 580 游戏显卡训练了一个图像识别网络,在 ImageNet 比赛中把错误率大幅拉低。深度学习从此爆发,GPU 成了 AI 的标准工具。
- 2015–16
Google 在自家数据中心部署第一代 TPU(2015 年开始使用,2016 年对外公布),一颗专门做矩阵乘法的芯片。
- 2017
NVIDIA V100 首次加入 张量核心(Tensor Core):一条指令就能算一小块矩阵乘法。同年苹果 A11 首次带上神经网络引擎。
- 2020
A100 支持 BF16、TF32 等新数字格式,并采用 CoWoS 封装和 HBM2/2e 内存。
- 2022
H100 引入 FP8;ChatGPT 发布后,数据中心 GPU 需求暴涨,CoWoS 和 HBM 成了全球瓶颈。
- 2024–26
B200 把两颗光罩尺寸的裸片拼在一个封装里,支持 FP4;整机柜 NVL72 把 72 颗 GPU 连成“一台大电脑”。
三招提速:更多乘法器、更短的数字、更少的搬运
GPU 的张量核心、Google 的 TPU、手机里的 NPU,本质上都是这三招的不同组合。
第一招:张量核心,一次算一小块
普通 GPU 核心一次做一次乘加。张量核心是一块专门的电路,一个时钟周期里就能把一个小矩阵块(比如 4×4)乘完并累加。好比小学生不再一道一道写,而是拿到一张小乘法表一次填满。
第二招:把数字变短
计算机里的小数用浮点数表示,由三部分组成:符号位(正负)、指数位(数字有多大,决定范围)、尾数位(数字有多精确)。位数越少,电路越小、搬运越省,同样的芯片能算得越多。神经网络对“有点不准”很宽容,所以 AI 芯片一代代把数字变短:FP32 → FP16/BF16 → FP8 → FP4。
点下面的按钮,看同一个数字 π 在不同格式里长什么样。
相对张量算力(以 FP16 为 1,示意):
BF16 和 FP16 一样占 16 位,但把位数让给了指数,范围和 FP32 一样大,训练时不容易溢出。
FP8、FP4 太短,单独用会丢失太多信息。实际做法是把一组数字共用一个“缩放系数”(例如 MXFP4、NVFP4 这类格式),再配合软件仔细挑选哪些层可以降精度。算力翻倍的前提是精度损失可以接受。
第三招:脉动阵列,让数据流过去而不是搬来搬去
做乘法很便宜,搬数据很贵:从内存取一个数,耗的电可能是做一次乘法的几十到上百倍。Google 的 TPU 用了一种叫脉动阵列(systolic array)的结构:一大片乘加单元排成方阵,数据从左边和上边像心跳一样一拍一拍流进去,每个单元算完把数传给邻居,自己留下累加结果。一个数从内存取一次,可以在阵列里被用很多次。
第一代 TPU 有一个 256×256 的阵列,也就是 65,536 个 8 位乘加单元。下面用 3×3 的小阵列演示 C = A × B,按“下一拍”看数据怎么流。
第 0 拍还没有数据进入阵列。注意 A 的第 2、3 行和 B 的第 2、3 列各晚一拍、两拍出发,这样对应的数才会在正确的格子里相遇。
手机里的 NPU:只做推理的省电小专家
NPU(神经网络处理器)是放在手机或电脑芯片里的一块 AI 专用电路。它不负责训练模型,只负责用模型:识别人脸、处理照片、语音转文字。手机靠电池,所以 NPU 追求的是每瓦能做多少运算,通常用 8 位甚至更短的整数。
苹果从 2017 年的 A11 开始加入神经网络引擎(Neural Engine),当时约每秒 6000 亿次运算(0.6 TOPS);到 A17 Pro 已标称约 35 TOPS。高通、联发科、华为也都有各自的 NPU。它在整颗手机芯片里只占一小块,具体可以看 A20 Pro 拆解。
GPU
通用的并行计算机,加上张量核心。能训练也能推理,软件生态(CUDA)最成熟。代表:NVIDIA、AMD。
TPU / 定制 ASIC
为矩阵乘法量身定做,砍掉画图等用不上的电路,每瓦性能更高,但只适合自家软件栈。代表:Google TPU、AWS Trainium。
NPU
集成在手机和电脑芯片里,专做推理,极度省电,算力是数据中心芯片的百分之一到千分之一。代表:苹果神经网络引擎。
拆开一颗数据中心 AI 芯片
我们口中的“一颗 GPU”,其实是一个装了十几颗芯片的封装。
今天的旗舰 AI 加速器不是单独一块硅片,而是一个多芯片封装:中间是负责计算的裸片,旁边围着几摞 HBM 内存,它们一起坐在一层叫中介层的“硅地板”上,再整体焊到封装基板上。这套组合就是 CoWoS 一类的 2.5D 封装。
训练与推理,以及衡量一颗 AI 芯片的五把尺子
比芯片不能只看“算力”一个数字。
训练:教模型
把海量数据喂进去,算出错误,再反向调整每个权重,反复几万到几百万轮。需要极大的算力、显存和芯片之间的互连,常常上万颗 GPU 一起跑几周到几个月。
推理:用模型
模型训练好后回答问题。一次计算量小得多,但每天要回答几十亿次。更看重延迟、每瓦性能和成本。大模型逐字生成回答时,常常卡在读内存而不是计算。
| 尺子 | 大白话 | 单位 | 为什么重要 |
|---|---|---|---|
| 算力 | 每秒能做多少次运算 | TFLOPS / PFLOPS | 决定“炒菜”的速度;要注明是哪种格式、是否算了稀疏加速 |
| 内存带宽 | 每秒能从内存搬多少数据 | TB/s | 决定“上菜”的速度;生成文字时往往是它说了算 |
| 内存容量 | 芯片旁边能放多少数据 | GB | 模型装不下就得切到多颗芯片上,增加通信 |
| 互连带宽 | 芯片和芯片之间每秒能传多少 | GB/s / TB/s | 上千颗芯片合作训练时,慢的那根线拖累所有人 |
| 功耗 | 每颗芯片耗多少电 | W | 决定散热方式、机房电费和一个机柜能放几颗 |
几颗代表芯片(厂商公布值,约数)
| 芯片 | 年份 | 16 位稠密算力 | 内存 | 内存带宽 | 功耗 | 封装要点 |
|---|---|---|---|---|---|---|
| NVIDIA A100 SXM | 2020 | ≈312 TFLOPS | 40/80 GB HBM2/2e | 1.6–2.0 TB/s | 400 W | 单裸片 + 5 摞 HBM,CoWoS-S |
| NVIDIA H100 SXM | 2022 | ≈990 TFLOPS | 80 GB HBM3 | 3.35 TB/s | 700 W | 814 mm² 裸片 + 5 摞 HBM3,CoWoS-S |
| NVIDIA B200 | 2024 | ≈2.2 PFLOPS | 约 180–192 GB HBM3E | ≈8 TB/s | 约 1000 W | 两颗裸片 + 8 摞 HBM3E,CoWoS-L |
| AMD MI300X | 2023 | ≈1.3 PFLOPS | 192 GB HBM3 | 5.3 TB/s | 750 W | 8 颗计算芯粒 3D 叠在 4 颗 IO 芯片上,再上中介层 |
| Google TPU v5p | 2023 | ≈459 TFLOPS | 95 GB HBM2e | ≈2.8 TB/s | 未公布 | 单芯片 + HBM,大规模光交换组网 |
“16 位稠密算力”指 FP16/BF16 张量运算、不计稀疏加速。厂商常宣传带稀疏或 FP8/FP4 的数字,往往是这里的 2–8 倍。B200 的具体数值随整机配置(功耗、散热)不同而变化。Google 2025 年公布的 TPU v7(Ironwood)标称 FP8 约 4.6 PFLOPS、192 GB HBM,规格以官方文档为准。
屋顶线:是“炒得慢”还是“上菜慢”
有一个简单的图能判断一个任务被什么卡住,叫屋顶线模型(roofline)。横轴是算术强度:每从内存搬 1 个字节,能做几次运算。纵轴是实际能达到的算力。
强度低的任务(比如逐字生成回答)每搬一点数据只算一点点,芯片再快也在等数据,这叫内存受限,性能沿着斜坡走,斜率就是内存带宽。强度高的任务(比如训练时的大矩阵乘法)数据一次搬来能反复用,这叫计算受限,性能碰到平顶,也就是芯片的峰值算力。
从一颗芯片到一整个机柜
最大的模型一颗芯片装不下,要切成很多块分给许多芯片,它们每算一步都要交换数据。NVIDIA 的 GB200 NVL72 把 36 颗 Grace CPU 和 72 颗 Blackwell GPU 装进一个机柜,用 NVLink 交换机和铜缆把 72 颗 GPU 连成一个整体,对软件来说像一颗巨大的 GPU。据 NVIDIA 公布,整柜 HBM 约 13.5 TB;整柜功耗据报道在 120 千瓦量级,相当于几十户家庭的用电。
快是快了,代价也很大
今天 AI 芯片的大部分麻烦,都不在“乘法器不够多”。
做对了什么
- 把面积和电都花在乘加上,比 CPU 快几十到上百倍
- 短数字格式让同一块芯片的算力每代翻倍
- CUDA 等软件生态让研究者不用写底层电路代码
- 先进封装把内存贴到旁边,缓解了带宽问题
付出了什么
- 单颗功耗从 250 W 涨到 1 kW 以上,必须液冷
- 算力涨得比内存带宽快,大量时间在等数据
- 一颗旗舰卡价格以万美元计,HBM 和封装占了很大份额
- CoWoS 和 HBM 产能紧张,交货期以季度计
- 内存墙过去二十年算力增长了上万倍,内存带宽只增长了几十到上百倍。详见 AI 芯片撞上的三堵墙。
- 光罩极限单颗裸片最大约 858 mm²,想再大只能拆成几颗芯粒再拼起来,这就要靠先进封装。
- 利用率峰值算力是“理论值”,大模型训练的实际利用率常见在 30%–50% 左右,其余时间在通信或等数据。
- 软件锁定专用芯片每瓦更强,但软件迁移成本高;CUDA 的生态优势让替代者很难追上。
- 电力与散热数据中心的瓶颈正从“买不到芯片”变成“没有足够的电和冷却”。
算力的战场正在从晶体管转向封装
截至 2026 年 10 月的公开路线图,以及它们和封装的关系。
HBM4 与定制底层芯片
HBM4 把每摞数据线加倍到 2048 根,2026 年开始量产;客户开始定制 HBM 最底下那层逻辑芯片。
云厂商自研芯片
Google TPU、AWS Trainium、Meta MTIA、微软 Maia 等自研芯片增多,多由博通、Marvell 等协助设计,再交给台积电制造和封装。
FP4 与块缩放格式
推理大量转向 4 位格式,训练也在尝试 FP8 乃至更低精度;芯片按“格式”而不只是“频率”提速。
你每天都在用 AI 芯片
手机拍照时的夜景模式、人像虚化、相册里按人脸自动分组,跑在手机芯片的 NPU 上,不用联网。
你向聊天机器人提问时,答案是在远方数据中心里的 GPU 或 TPU 上一个字一个字生成的;每个字都要把模型的大部分权重从 HBM 里读一遍。
玩游戏的显卡也有张量核心,用来做画面放大(如 DLSS),这是“AI 芯片”回到老本行的例子。
1. 神经网络里最常见的一种运算是什么?
乘加运算(MAC):把输入乘以权重再加起来。一层神经元一起算,就是矩阵乘法。
2. 为什么 GPU 比 CPU 更适合训练神经网络?
矩阵乘法的每一格可以同时独立计算。GPU 有几千个简单核心和张量核心,面积大部分用于算术;CPU 核心少,大量面积花在控制和预测上。
3. BF16 和 FP16 都是 16 位,区别在哪?
BF16 有 8 位指数、7 位尾数,范围和 FP32 一样大但精度低;FP16 有 5 位指数、10 位尾数,精度高些但范围小,训练时更容易溢出。
4. 脉动阵列为什么省电?
数据从内存取一次后在阵列里一格格传递、被反复使用,减少了昂贵的内存访问。搬数据比做乘法耗电得多。
5. 聊天机器人逐字生成回答时,通常是算力受限还是内存受限?为什么?
通常是内存受限。每生成一个字都要读一遍大量权重,但对每个字节只做很少的运算,算术强度低,落在屋顶线的斜坡上。
6. 为什么说 AI 芯片离不开先进封装?
单颗裸片受光罩极限约束,需要多颗拼接;HBM 每摞上千根数据线只有中介层能接;功耗上千瓦需要特殊的散热和供电结构。这些都在封装层面解决。
延伸阅读
- Krizhevsky, Sutskever, Hinton, “ImageNet Classification with Deep Convolutional Neural Networks”, NeurIPS 2012(AlexNet,两块 GTX 580 训练)。
- Jouppi et al., “In-Datacenter Performance Analysis of a Tensor Processing Unit”, ISCA 2017(TPU v1:256×256 脉动阵列,2015 年部署)。
- NVIDIA,Tesla V100、A100、H100 架构白皮书与产品规格页;DGX B200、GB200 NVL72 规格页(2024–2025)。
- AMD Instinct MI300X 数据手册与 Hot Chips 2024 报告。
- Google Cloud TPU 文档:TPU v5p 规格;Google 2025 年 Ironwood(TPU v7)发布材料。
- Apple,A11 Bionic(2017)与 A17 Pro(2023)发布会资料中的神经网络引擎数据。
- Williams, Waterman, Patterson, “Roofline: An Insightful Visual Performance Model for Multicore Architectures”, CACM 2009。
- IEEE 754 浮点标准;OCP Microscaling(MX)格式规范 v1.0(2023)。
- Gholami et al., “AI and Memory Wall”, IEEE Micro 2024。