Yiek Heng 的知识空间
首页芯片封装AI 芯片与前沿快速增长诞生:2012 起
AI 芯片与前沿 · 第 1 页

AI 芯片入门·GPU、TPU、NPU 到底在算什么

神经网络听起来神秘,拆开来只有一件事:海量的“乘一下、再加起来”。这一页从这件小事讲起,讲到为什么 GPU 赢了、TPU 和 NPU 是什么,以及一颗数据中心 AI 芯片的封装里装了哪些东西。

算的是乘加一次回答要做上万亿次乘法和加法,每一次都很简单。
赢在“人多”几千个小核心一起算,比几个聪明的大核心快得多、省电得多。
卡在“喂数据”算力涨得比内存快,所以 AI 芯片越来越依赖先进封装和 HBM。
它为什么诞生

神经网络其实是一张巨大的乘法表

先弄懂 AI 在算什么,才明白为什么需要专门的芯片。

神经网络是一种程序,它由很多层“神经元”组成。每个神经元做的事情很简单:把前一层传来的每个数字乘上一个权重(一个可调的系数),全部加起来,再做一个很简单的“修整”(比如负数变成 0),然后传给下一层。

“乘一下再加起来”有个专门的名字,叫乘加运算(MAC,multiply-accumulate)。AI 芯片的所有本事,几乎都围绕着“每秒能做多少次乘加”展开。

一个很小的神经网络 x₁x₂x₃y 输入层 隐藏层 输出层 放大一个神经元 y y = x₁·w₁ + x₂·w₂ + x₃·w₃ 例:2×0.5 + 1×(−1) + 3×0.2 = 0.6 3 次乘法 + 3 次加法 = 3 次乘加 w 是权重,训练就是在调这些数字 真实大模型:几十层到上百层, 权重有几十亿到上万亿个
← 左右滑动看全图 →
要点:图里每条线都是一个权重。红线标出了计算 y 需要的三条线。线越多,乘加越多;大模型的“线”多到以万亿计。

一层神经元一起算,就是矩阵乘法

把一层所有神经元的权重排成一个方阵,把输入排成另一个方阵,整层的计算就变成数学里的矩阵乘法:结果里的每一格,都是“左边一行”和“上边一列”逐个相乘再相加。

输入 A(每行一个样本) 权重 B 结果 C 2130.5−10.20.6 × = 蓝色一行 × 橙色一列,逐个相乘再相加,得到绿色那一格
← 左右滑动看全图 →
要点:3×3 乘 3×3 的矩阵要做 27 次乘加。大模型里的矩阵是几千乘几千,一次就要几十亿次乘加。好消息是:每一格的计算互不依赖,可以同时算。这一点决定了 AI 芯片的设计方向。

为什么 CPU 算这个很慢

CPU(中央处理器,电脑和手机的“总管”)只有几个到几十个核心(独立干活的计算单元)。每个核心都很聪明:能猜下一步、能处理复杂的分支、能快速切换任务。可是这些聪明的电路占了大量面积,真正做乘法的部分只是一小块。

GPU(图形处理器)走的是另一条路:放几千个简单的小核心,每个只会按指令做算术,大家听同一个口令一起算。矩阵乘法正好是“很多格子同时算、互不干扰”的活,GPU 天生适合。

CPU 像一位教授,什么难题都能解,但一次只能解几道;GPU 像坐满一个体育场的小学生,每人只会算一道乘法,可是几万人一起举手,一秒钟就交出几万个答案。

CPU:少数聪明的大核心 大核心 1大核心 2大核心 3大核心 4控制、预测、缓存控制、预测、缓存控制、预测、缓存控制、预测、缓存 算术单元(绿)只占一小块 擅长:复杂逻辑、分支多、顺序执行 GPU:成千上万个小核心 大部分面积都在做算术 擅长:同一件事对海量数据同时做
← 左右滑动看全图 →
要点:示意图,不按比例。一颗 H100 有 1 万 6 千多个 CUDA 核心和 528 个张量核心;一颗服务器 CPU 通常是几十到一两百个核心。

GPU 怎么从打游戏变成训练 AI

  1. 1999

    NVIDIA 推出 GeForce 256,首次用“GPU”这个名字。那时它只负责画游戏画面。

  2. 2006

    NVIDIA 发布 CUDA(2007 年开放下载):程序员第一次能用类似 C 语言的方式,让 GPU 做任意计算,而不只是画三角形。

  3. 2012

    AlexNet:多伦多大学的三个人用两块 GeForce GTX 580 游戏显卡训练了一个图像识别网络,在 ImageNet 比赛中把错误率大幅拉低。深度学习从此爆发,GPU 成了 AI 的标准工具。

  4. 2015–16

    Google 在自家数据中心部署第一代 TPU(2015 年开始使用,2016 年对外公布),一颗专门做矩阵乘法的芯片。

  5. 2017

    NVIDIA V100 首次加入 张量核心(Tensor Core):一条指令就能算一小块矩阵乘法。同年苹果 A11 首次带上神经网络引擎。

  6. 2020

    A100 支持 BF16、TF32 等新数字格式,并采用 CoWoS 封装和 HBM2/2e 内存。

  7. 2022

    H100 引入 FP8;ChatGPT 发布后,数据中心 GPU 需求暴涨,CoWoS 和 HBM 成了全球瓶颈。

  8. 2024–26

    B200 把两颗光罩尺寸的裸片拼在一个封装里,支持 FP4;整机柜 NVL72 把 72 颗 GPU 连成“一台大电脑”。

它是怎么工作的

三招提速:更多乘法器、更短的数字、更少的搬运

GPU 的张量核心、Google 的 TPU、手机里的 NPU,本质上都是这三招的不同组合。

第一招:张量核心,一次算一小块

普通 GPU 核心一次做一次乘加。张量核心是一块专门的电路,一个时钟周期里就能把一个小矩阵块(比如 4×4)乘完并累加。好比小学生不再一道一道写,而是拿到一张小乘法表一次填满。

第二招:把数字变短

计算机里的小数用浮点数表示,由三部分组成:符号位(正负)、指数位(数字有多大,决定范围)、尾数位(数字有多精确)。位数越少,电路越小、搬运越省,同样的芯片能算得越多。神经网络对“有点不准”很宽容,所以 AI 芯片一代代把数字变短:FP32 → FP16/BF16 → FP8 → FP4。

点下面的按钮,看同一个数字 π 在不同格式里长什么样。

← 左右滑动看全图 →
符号位指数位(范围)尾数位(精度)
存下来的 π3.140625
能表示的最大数3.4×10³⁸
700 亿参数模型占内存140 GB

相对张量算力(以 FP16 为 1,示意):

BF16 和 FP16 一样占 16 位,但把位数让给了指数,范围和 FP32 一样大,训练时不容易溢出。

注意

FP8、FP4 太短,单独用会丢失太多信息。实际做法是把一组数字共用一个“缩放系数”(例如 MXFP4、NVFP4 这类格式),再配合软件仔细挑选哪些层可以降精度。算力翻倍的前提是精度损失可以接受。

第三招:脉动阵列,让数据流过去而不是搬来搬去

做乘法很便宜,搬数据很贵:从内存取一个数,耗的电可能是做一次乘法的几十到上百倍。Google 的 TPU 用了一种叫脉动阵列(systolic array)的结构:一大片乘加单元排成方阵,数据从左边和上边像心跳一样一拍一拍流进去,每个单元算完把数传给邻居,自己留下累加结果。一个数从内存取一次,可以在阵列里被用很多次。

第一代 TPU 有一个 256×256 的阵列,也就是 65,536 个 8 位乘加单元。下面用 3×3 的小阵列演示 C = A × B,按“下一拍”看数据怎么流。

B 的每一列从上方流入(向下) A 的每一行从左边流入
← 左右滑动看全图 →

第 0 拍还没有数据进入阵列。注意 A 的第 2、3 行和 B 的第 2、3 列各晚一拍、两拍出发,这样对应的数才会在正确的格子里相遇。

手机里的 NPU:只做推理的省电小专家

NPU(神经网络处理器)是放在手机或电脑芯片里的一块 AI 专用电路。它不负责训练模型,只负责用模型:识别人脸、处理照片、语音转文字。手机靠电池,所以 NPU 追求的是每瓦能做多少运算,通常用 8 位甚至更短的整数。

苹果从 2017 年的 A11 开始加入神经网络引擎(Neural Engine),当时约每秒 6000 亿次运算(0.6 TOPS);到 A17 Pro 已标称约 35 TOPS。高通、联发科、华为也都有各自的 NPU。它在整颗手机芯片里只占一小块,具体可以看 A20 Pro 拆解。

GPU

通用的并行计算机,加上张量核心。能训练也能推理,软件生态(CUDA)最成熟。代表:NVIDIA、AMD。

TPU / 定制 ASIC

为矩阵乘法量身定做,砍掉画图等用不上的电路,每瓦性能更高,但只适合自家软件栈。代表:Google TPU、AWS Trainium。

NPU

集成在手机和电脑芯片里,专做推理,极度省电,算力是数据中心芯片的百分之一到千分之一。代表:苹果神经网络引擎。

它是怎么工作的

拆开一颗数据中心 AI 芯片

我们口中的“一颗 GPU”,其实是一个装了十几颗芯片的封装。

今天的旗舰 AI 加速器不是单独一块硅片,而是一个多芯片封装:中间是负责计算的裸片,旁边围着几摞 HBM 内存,它们一起坐在一层叫中介层的“硅地板”上,再整体焊到封装基板上。这套组合就是 CoWoS 一类的 2.5D 封装。

计算裸片计算裸片 HBMHBM 1 2 3 4 5 6 7 剖面示意,不按比例;红虚线 = 计算裸片与 HBM 之间的高速连线
← 左右滑动看全图 →
  1. 1液冷冷板:里面流着冷却液,一颗芯片发热可达 1 千瓦以上,风扇已经压不住。
  2. 2HBM 内存:8–12 层 DRAM 叠成一摞,每摞上千根数据线,见 HBM。
  3. 3计算裸片:放张量核心的地方。B200 用两颗,各自接近光罩极限尺寸。
  4. 4中介层:带极细走线的硅(或有机加硅桥)地板,让芯片之间连上万根线,见 中介层。
  5. 5封装基板:十几到二十多层的有机电路板,把细线放大成主板能焊的间距。
  6. 6锡球与主板:几千个锡球把整个封装焊到 PCB 上,见 BGA。
  7. 7供电:电压不到 1 伏、电流上千安培,靠板上大量稳压模块和电容从下方送电。
一颗 AI 芯片的性能,一半看计算裸片,一半看封装:HBM 能放几摞、芯片之间能连多少线、热能不能导出去、电能不能送进来。
它解决了什么问题

训练与推理,以及衡量一颗 AI 芯片的五把尺子

比芯片不能只看“算力”一个数字。

训练:教模型

把海量数据喂进去,算出错误,再反向调整每个权重,反复几万到几百万轮。需要极大的算力、显存和芯片之间的互连,常常上万颗 GPU 一起跑几周到几个月。

推理:用模型

模型训练好后回答问题。一次计算量小得多,但每天要回答几十亿次。更看重延迟、每瓦性能和成本。大模型逐字生成回答时,常常卡在读内存而不是计算。

尺子大白话单位为什么重要
算力每秒能做多少次运算TFLOPS / PFLOPS决定“炒菜”的速度;要注明是哪种格式、是否算了稀疏加速
内存带宽每秒能从内存搬多少数据TB/s决定“上菜”的速度;生成文字时往往是它说了算
内存容量芯片旁边能放多少数据GB模型装不下就得切到多颗芯片上,增加通信
互连带宽芯片和芯片之间每秒能传多少GB/s / TB/s上千颗芯片合作训练时,慢的那根线拖累所有人
功耗每颗芯片耗多少电W决定散热方式、机房电费和一个机柜能放几颗

几颗代表芯片(厂商公布值,约数)

芯片年份16 位稠密算力内存内存带宽功耗封装要点
NVIDIA A100 SXM2020≈312 TFLOPS40/80 GB HBM2/2e1.6–2.0 TB/s400 W单裸片 + 5 摞 HBM,CoWoS-S
NVIDIA H100 SXM2022≈990 TFLOPS80 GB HBM33.35 TB/s700 W814 mm² 裸片 + 5 摞 HBM3,CoWoS-S
NVIDIA B2002024≈2.2 PFLOPS约 180–192 GB HBM3E≈8 TB/s约 1000 W两颗裸片 + 8 摞 HBM3E,CoWoS-L
AMD MI300X2023≈1.3 PFLOPS192 GB HBM35.3 TB/s750 W8 颗计算芯粒 3D 叠在 4 颗 IO 芯片上,再上中介层
Google TPU v5p2023≈459 TFLOPS95 GB HBM2e≈2.8 TB/s未公布单芯片 + HBM,大规模光交换组网

“16 位稠密算力”指 FP16/BF16 张量运算、不计稀疏加速。厂商常宣传带稀疏或 FP8/FP4 的数字,往往是这里的 2–8 倍。B200 的具体数值随整机配置(功耗、散热)不同而变化。Google 2025 年公布的 TPU v7(Ironwood)标称 FP8 约 4.6 PFLOPS、192 GB HBM,规格以官方文档为准。

屋顶线:是“炒得慢”还是“上菜慢”

有一个简单的图能判断一个任务被什么卡住,叫屋顶线模型(roofline)。横轴是算术强度:每从内存搬 1 个字节,能做几次运算。纵轴是实际能达到的算力。

强度低的任务(比如逐字生成回答)每搬一点数据只算一点点,芯片再快也在等数据,这叫内存受限,性能沿着斜坡走,斜率就是内存带宽。强度高的任务(比如训练时的大矩阵乘法)数据一次搬来能反复用,这叫计算受限,性能碰到平顶,也就是芯片的峰值算力。

换更快的 HBM:斜坡变陡 平顶 = 峰值算力 内存受限 在等数据 计算受限 乘法器满负荷 拐点 逐字生成 大批量训练 算术强度:每搬 1 字节做几次运算 → 能达到的算力 →
← 左右滑动看全图 →
要点:示意图,两个轴实际都是对数刻度。H100 的拐点大约在每字节几百次运算;大模型逐字生成时的强度常常只有个位数到几十,所以带宽比算力更值钱。这正是 HBM 和先进封装身价暴涨的原因。

从一颗芯片到一整个机柜

最大的模型一颗芯片装不下,要切成很多块分给许多芯片,它们每算一步都要交换数据。NVIDIA 的 GB200 NVL72 把 36 颗 Grace CPU 和 72 颗 Blackwell GPU 装进一个机柜,用 NVLink 交换机和铜缆把 72 颗 GPU 连成一个整体,对软件来说像一颗巨大的 GPU。据 NVIDIA 公布,整柜 HBM 约 13.5 TB;整柜功耗据报道在 120 千瓦量级,相当于几十户家庭的用电。

1 颗 GPU 封装 两颗计算裸片 + HBM 约 1 千瓦 ×4 1 个计算托盘 CPUCPU 4 颗 GPU + 2 颗 Grace CPU 液冷 ×18 1 个 NVL72 机柜 72 GPU,NVLink 全互连 示意图,不按比例
← 左右滑动看全图 →
要点:灰色窄条是计算托盘(共 18 个),橙色是 NVLink 交换托盘(共 9 个)。机柜背后有约 5000 根铜缆。再往上,几十到几百个机柜用光纤和交换机连成上万颗 GPU 的集群;那一段的耗电问题就交给 共封装光学。
它的缺陷

快是快了,代价也很大

今天 AI 芯片的大部分麻烦,都不在“乘法器不够多”。

做对了什么

  • 把面积和电都花在乘加上,比 CPU 快几十到上百倍
  • 短数字格式让同一块芯片的算力每代翻倍
  • CUDA 等软件生态让研究者不用写底层电路代码
  • 先进封装把内存贴到旁边,缓解了带宽问题

付出了什么

  • 单颗功耗从 250 W 涨到 1 kW 以上,必须液冷
  • 算力涨得比内存带宽快,大量时间在等数据
  • 一颗旗舰卡价格以万美元计,HBM 和封装占了很大份额
  • CoWoS 和 HBM 产能紧张,交货期以季度计
  1. 内存墙过去二十年算力增长了上万倍,内存带宽只增长了几十到上百倍。详见 AI 芯片撞上的三堵墙。
  2. 光罩极限单颗裸片最大约 858 mm²,想再大只能拆成几颗芯粒再拼起来,这就要靠先进封装。
  3. 利用率峰值算力是“理论值”,大模型训练的实际利用率常见在 30%–50% 左右,其余时间在通信或等数据。
  4. 软件锁定专用芯片每瓦更强,但软件迁移成本高;CUDA 的生态优势让替代者很难追上。
  5. 电力与散热数据中心的瓶颈正从“买不到芯片”变成“没有足够的电和冷却”。
现状与未来

算力的战场正在从晶体管转向封装

截至 2026 年 10 月的公开路线图,以及它们和封装的关系。

更大的封装

多颗光罩尺寸裸片拼在一起

NVIDIA 路线图上的 Rubin、Rubin Ultra 继续增加裸片和 HBM 数量;封装面积逼近圆晶圆中介层的极限,推动向 面板级封装 过渡。

更高的楼

3D 堆叠与混合键合

把缓存或 IO 芯片叠在计算芯片下面,缩短距离、增加带宽,AMD MI300 已经这样做。见 3D 与混合键合。

更快的内存

HBM4 与定制底层芯片

HBM4 把每摞数据线加倍到 2048 根,2026 年开始量产;客户开始定制 HBM 最底下那层逻辑芯片。

更多定制

云厂商自研芯片

Google TPU、AWS Trainium、Meta MTIA、微软 Maia 等自研芯片增多,多由博通、Marvell 等协助设计,再交给台积电制造和封装。

更短的数字

FP4 与块缩放格式

推理大量转向 4 位格式,训练也在尝试 FP8 乃至更低精度;芯片按“格式”而不只是“频率”提速。

用光连接

共封装光学

机柜之间乃至芯片之间改用光,降低每比特能耗,延长距离。见 共封装光学。

一句话总结:今天比较 AI 芯片,问“几纳米”已经不够,还要问“几摞 HBM、怎么封的、怎么连的、怎么散热”。接下来几页会逐一讲这些封装问题,先从 三堵墙 开始。
身边的例子 · 自测

你每天都在用 AI 芯片

身边的例子

手机拍照时的夜景模式、人像虚化、相册里按人脸自动分组,跑在手机芯片的 NPU 上,不用联网。

你向聊天机器人提问时,答案是在远方数据中心里的 GPU 或 TPU 上一个字一个字生成的;每个字都要把模型的大部分权重从 HBM 里读一遍。

玩游戏的显卡也有张量核心,用来做画面放大(如 DLSS),这是“AI 芯片”回到老本行的例子。

1. 神经网络里最常见的一种运算是什么?

乘加运算(MAC):把输入乘以权重再加起来。一层神经元一起算,就是矩阵乘法。

2. 为什么 GPU 比 CPU 更适合训练神经网络?

矩阵乘法的每一格可以同时独立计算。GPU 有几千个简单核心和张量核心,面积大部分用于算术;CPU 核心少,大量面积花在控制和预测上。

3. BF16 和 FP16 都是 16 位,区别在哪?

BF16 有 8 位指数、7 位尾数,范围和 FP32 一样大但精度低;FP16 有 5 位指数、10 位尾数,精度高些但范围小,训练时更容易溢出。

4. 脉动阵列为什么省电?

数据从内存取一次后在阵列里一格格传递、被反复使用,减少了昂贵的内存访问。搬数据比做乘法耗电得多。

5. 聊天机器人逐字生成回答时,通常是算力受限还是内存受限?为什么?

通常是内存受限。每生成一个字都要读一遍大量权重,但对每个字节只做很少的运算,算术强度低,落在屋顶线的斜坡上。

6. 为什么说 AI 芯片离不开先进封装?

单颗裸片受光罩极限约束,需要多颗拼接;HBM 每摞上千根数据线只有中介层能接;功耗上千瓦需要特殊的散热和供电结构。这些都在封装层面解决。

资料来源

延伸阅读

  • Krizhevsky, Sutskever, Hinton, “ImageNet Classification with Deep Convolutional Neural Networks”, NeurIPS 2012(AlexNet,两块 GTX 580 训练)。
  • Jouppi et al., “In-Datacenter Performance Analysis of a Tensor Processing Unit”, ISCA 2017(TPU v1:256×256 脉动阵列,2015 年部署)。
  • NVIDIA,Tesla V100、A100、H100 架构白皮书与产品规格页;DGX B200、GB200 NVL72 规格页(2024–2025)。
  • AMD Instinct MI300X 数据手册与 Hot Chips 2024 报告。
  • Google Cloud TPU 文档:TPU v5p 规格;Google 2025 年 Ironwood(TPU v7)发布材料。
  • Apple,A11 Bionic(2017)与 A17 Pro(2023)发布会资料中的神经网络引擎数据。
  • Williams, Waterman, Patterson, “Roofline: An Insightful Visual Performance Model for Multicore Architectures”, CACM 2009。
  • IEEE 754 浮点标准;OCP Microscaling(MX)格式规范 v1.0(2023)。
  • Gholami et al., “AI and Memory Wall”, IEEE Micro 2024。
图中尺寸除特别说明外均为示意,不按真实比例。年份与数值为行业常见说法或公开报道,具体以厂商资料为准。 内容更新至 2026-10。