PoP 叠层封装·内存叠在处理器头上
手机主板只有巴掌大,处理器和内存又必须挨得很近。PoP(Package on Package)的办法是把两个封装好的芯片上下叠起来焊在一起。它统治了智能手机将近二十年,直到热量和带宽把它逼到了墙角。
手机主板太小,内存又不能离太远
2000 年代中期,彩屏、拍照、上网把手机处理器和内存都变大了,主板却不能跟着变大。
每颗手机处理器(行业叫 SoC,System on Chip,把 CPU、图形、基带等功能做在一颗芯片上)都需要一颗 DRAM 内存放正在运行的程序和数据。处理器干活时一刻不停地读写内存,两者之间的线越短,速度越快、越省电。
早期手机把两颗芯片并排焊在主板上。可到了 2000 年代中期,手机要塞进摄像头、大电池、更大的屏幕,主板面积被挤得越来越小。工程师想到:能不能把内存直接叠在处理器头上?
左右滑动查看完整图
为什么不干脆把两颗芯片封在一个壳里?
还有一种更“彻底”的叠法:把内存芯片直接叠在处理器芯片上,装进同一个封装(这属于 SiP 的芯片堆叠,早期功能手机的多芯片封装就常这样做)。它更薄,为什么旗舰手机反而选择了“叠两个封装”?
- 可以分开测试。裸芯片很难在封装前完全测好。如果把一颗没测透的内存和一颗昂贵的处理器封在一起,任何一颗坏了,整个封装都得扔掉。PoP 里的两颗芯片各自封装、各自测试合格,再叠到一起。
- 来自不同公司。处理器由高通、苹果、联发科等设计,内存由三星、SK 海力士、美光等生产。PoP 让双方各做各的封装,交接的只是一个标准化的焊球接口。
- 可以晚点决定配置。同一款处理器可以在组装主板时,才决定叠 8 GB 还是 12 GB 的内存,甚至换一家内存供应商。
拆开看:楼上内存,楼下处理器
底层封装的“屋顶”上留了一圈焊盘,上层封装的锡球就焊在这圈焊盘上。
左右滑动查看完整图
关键在第 5、6 号:处理器芯片占了下层封装的中间,所以上层封装的焊球只能落在外圈,绕开中间的芯片。内存发出的每一个信号,都要走“内存芯片 → 金线 → 上层基板 → 外圈焊球 → 下层基板 → 处理器”这条路。这比主板上并排走线短得多,但比芯片之间直接相连还是长不少。
PoP 的几代变化
PoP 最难的地方,是让上层的焊球“跨过”下层的处理器芯片。芯片有厚度,焊球就得足够高;焊球高了就得做大,做大了就排不密。二十年来的改进,基本都是在解决这个矛盾:
1. 早期 PoP(2000s 中期)
下层芯片外露,上层用大焊球直接跨过去。球大,间距约 0.65–0.5 mm,外圈只能排一两排,连接数有限。
2. 穿塑封通孔 TMV(约 2008 年起)
下层先整体塑封,再在塑封料上激光打孔、填焊料。上层焊球可以变小、变密(约 0.4 mm 间距),塑封料还让下层更不容易翘。
3. 中介层 PoP(2010s)
在下层芯片上方再加一层薄基板(橙色,叫中介层),四周用铜柱或焊球连下去。上层封装的焊球就能铺满整个面,不必挤在外圈。代价是更厚、更贵。部分安卓旗舰据报道用过这种结构。
- 2000s
日本、芬兰等地的手机厂商与封装厂开始在手机里使用叠层封装;约 2005 年前后,JEDEC 等组织为 PoP 的外形和焊球位置制定了标准,内存厂可以按统一接口供货(具体年份各资料说法略有出入)。
- 2007
初代 iPhone 的处理器据拆解采用 PoP,内存叠在三星制造的处理器之上。此后的 iPhone 一直沿用叠层结构。
- 2008
约 2008 年前后,Amkor 等封装厂推出穿塑封通孔(TMV)PoP,叠层间距从约 0.5 mm 走向 0.4 mm。
- 2016
iPhone 7 的 A10 处理器首次采用台积电 InFO-PoP,去掉了下层基板。据报道这是台积电拿下苹果处理器独家代工的重要原因之一。
- 之后
2016–2025 年的 A 系列处理器据拆解都沿用 InFO-PoP;安卓旗舰多使用基板式 PoP,内存也从 LPDDR4 升级到 LPDDR5X。
- 2026
据报道和初步拆解,A20 Pro 改用 WMCM:内存不再叠在上方,而是和处理器并排放进同一片塑封料,见 A20 Pro。
怎么叠焊:一次回流焊好两层
PoP 通常不是在封装厂叠好再卖,而是在手机组装厂的贴片线上现场叠。两层封装加上主板,一次通过回流炉,同时焊好:
1印锡膏,放下层
主板焊盘上印锡膏,贴片机把处理器封装放上去。
2上层蘸助焊剂
吸嘴吸起内存封装,让焊球在一盘薄薄的助焊剂里“点”一下,叫 dip-in-flux。
3叠上去
对准下层封装顶面外圈的焊盘放下。此时什么都没焊,全靠助焊剂的黏性“粘”住。
4一次回流
整块主板过回流炉(无铅焊料峰值约 240–250 °C),上下两层焊点同时熔化、同时凝固。
面积、距离、分工,一次搞定
和“并排放在主板上”相比,PoP 在手机里几乎全面占优。
| 处理器和内存并排焊在主板上 | PoP 叠层 | |
|---|---|---|
| 主板面积 | 两颗之和,还要留走线 | 约一颗,省出约一半 |
| 内存走线长度 | 十几毫米,在主板里绕 | 几毫米,上下穿过封装 |
| 主板布线难度 | 几十根高速线要在主板上并行走,容易互相干扰 | 内存信号不经过主板,主板简单一些 |
| 测试与分工 | 各自封装、各自测试 | 同样各自测试,保留了这个好处 |
| 换内存容量 | 容易 | 也容易,组装时选不同的上层封装 |
| 散热 | 两颗各自散热 | 热量叠在一起(见下一节) |
这就是为什么从 2000 年代后期到 2020 年代,几乎所有智能手机的主处理器都采用了 PoP 或它的变种。它用很低的代价,同时满足了“小”“快”“能分工”三件事。
翘曲、热量、外圈焊球
两层小楼看起来省地方,可楼上楼下互相拖累。
1. 翘曲:两块饼干受热弯得不一样
封装由塑封料、基板、硅等好几种材料粘成,它们受热膨胀的快慢不同,所以封装加热时会像饼干一样弯起来,这叫翘曲。一颗封装弯一点问题不大,可 PoP 是两颗封装面对面焊在一起:如果上层往一个方向弯、下层往另一个方向弯,外圈的焊球就会被拉开,焊料熔化时够不着对面,形成开路,或者只是“搭”在一起没有真正融合(叫枕头效应,head-in-pillow,像头枕在枕头上,贴着但没长在一起)。拖动温度看看:
数字为示意,真实产品的翘曲随材料和尺寸不同。
行业的对策包括:用 JEDEC 规定的方法(如 JESD22-B112)在加热过程中实测翘曲;让上下两家封装厂协调材料,使两层“弯得一样”;用 TMV 或中介层让下层更硬;以及在焊盘上加更多焊料,给缝隙留余量。
2. 热量:处理器被“捂”在内存下面
处理器是手机里最热的东西,满载时可能有好几瓦热量要散出去。可在 PoP 里,处理器头顶正压着内存,热量只能穿过内存封装,再传到手机的金属中框或均热板。
内存偏偏又怕热。DRAM 靠电容存数据,电容会慢慢漏电,需要定期“刷新”。温度越高漏得越快,一般超过约 85 °C 就得把刷新频率加倍,更费电、更占带宽。于是处理器热,把内存烤热;内存热,又让处理器不得不降频。手机玩大型游戏时“越玩越卡”,部分原因就在这里。
左右滑动查看完整图
3. 带宽:内存的线只能走外圈
上层焊球只能排在下层芯片的四周,这又回到了倒装芯片那一页讲过的“周长问题”:焊球数量受周长限制,而且间距约 0.3–0.5 mm,远比芯片上的凸点粗。下面算一算一颗 14 mm 见方的 PoP 外圈能排多少球:
示意计算:封装 14 mm 见方,外留 0.5 mm 边,中间约 9 mm 是处理器区域。
几百颗球听起来不少,但手机内存的总线宽度一般只有 64 位左右(比如 4 个 16 位通道),再要加宽就塞不下了。想要更高的带宽,只能把每根线跑得更快:从 LPDDR4 到 LPDDR5X,单根线的速率翻了好几倍,可越快越难,也越费电。HBM 走的是另一条路:线多到上千根,每根跑得慢一点,但这需要芯片和内存并排放在中介层上,PoP 结构做不到。
优点
- 省主板面积,约一半
- 内存离处理器近,比主板走线短得多
- 处理器和内存各自测试,良率损失小
- 不同厂商分工,接口标准化
- 组装时才决定内存容量,供应灵活
缺点
- 处理器的热量要穿过内存,散热差
- 内存被烤热,刷新更频繁、更费电
- 两层翘曲不匹配,容易开路或枕头效应
- 互连只能走外圈焊球,总线宽度受限
- 整体更厚,叠焊多一道工艺风险
旗舰手机开始“拆楼”:从叠放到并排
PoP 仍是大多数手机的主流,但最顶级的芯片开始转向并排。
到了 2020 年代中期,手机里跑起了本地 AI 模型。AI 计算特别“吃”内存带宽,又特别发热,PoP 的两个天花板同时被撞上了。
据公开报道和初步拆解,苹果 2026 年的 A20 Pro 改用台积电的 WMCM(晶圆级多芯片模块):内存不再叠在处理器上方,而是和处理器并排嵌在同一片塑封料里,下面共用一套 RDL 走线。处理器头顶不再压着内存,热量可以直接往上散;内存的线也不必挤在外圈焊球里,可以在 RDL 里横着走过去。代价是占的面积变大,部分抵消了当年 PoP 省下的地方。另有报道称,标准版 A20 可能仍用 InFO-PoP。
左右滑动查看完整图
| PoP(含 InFO-PoP) | SiP 芯片堆叠 | WMCM(A20 Pro) | HBM + 中介层 | |
|---|---|---|---|---|
| 内存在哪 | 另一个封装,叠在上方 | 裸片叠在处理器上,同一封装 | 裸片或颗粒,并排在同一塑封料里 | 多层内存堆叠,并排在中介层上 |
| 怎么连 | 外圈焊球 + 通孔 / 铜柱 | 金线(或硅通孔) | RDL 横向走线 | 中介层上的微凸点和细线 |
| 连接数量级 | 几百 | 几十到几百 | 据报道明显多于 PoP(具体未公开) | 每叠上千根数据线 |
| 内存带宽(量级) | 约 50–80 GB/s(LPDDR5/5X,64 位) | 低,多用于低端芯片 | 高于 PoP,具体规格仅有爆料 | 每叠约 1 TB/s 以上(HBM3E) |
| 主板面积 | 最小 | 最小 | 较大 | 很大(AI 芯片不在乎) |
| 散热 | 差,热量穿过内存 | 差 | 好,处理器上方无遮挡 | 好,有大散热器 |
| 分开测试 | 能,最大优点 | 难,必须用已知合格裸片 | 要求已知合格的内存 | 要求已知合格的 HBM |
| 代表 | 多年 iPhone、大部分安卓旗舰 | 功能手机、物联网芯片,见 QFN 内置 DRAM | A20 Pro | CoWoS 上的 AI GPU |
你的手机里大概率就有一颗
自测一下
1. PoP 和“在一个封装里叠芯片”相比,最大的好处是什么?
处理器和内存可以各自封装、各自测试合格后再叠在一起,坏一颗不会连累另一颗;双方厂商也能各做各的,组装时再选内存容量。
2. 为什么上层内存的焊球只能排在外圈?
下层封装的正中间是处理器芯片,焊球必须绕开它,只能落在四周。这让连接数受周长限制。
3. 什么是枕头效应?
回流时上下两层封装翘曲方向不同,外圈焊球被拉开,熔化的焊球只是贴着对面的焊料,没有真正融合,就像头枕在枕头上。冷却后看起来连着,其实一碰就断或接触不良。
4. InFO-PoP 比传统 PoP 改进在哪?
下层去掉了基板,处理器嵌在塑封料里,下面直接做 RDL 走线,上下靠塑封料里的铜柱(TIV)连接。整体更薄,散热和电气性能更好。
5. A20 Pro 为什么不再把内存叠在处理器上?
主要是散热和带宽:叠放时处理器的热要穿过内存,内存的线只能走外圈焊球。并排的 WMCM 让处理器上方直接散热,内存信号也能在 RDL 里横向走更多、更短的线。代价是面积更大。
延伸阅读
- Wikipedia:Package on a package(结构、历史、JEDEC 标准)
- Amkor:PoP 与 TMV PoP 产品介绍
- JEDEC JESD22-B112:高温下封装翘曲测量方法
- 台积电 3DFabric:InFO 技术介绍(InFO-PoP)
- TechInsights:Apple A10 InFO-PoP 及后续 A 系列拆解报告
- MacRumors:A20 Pro 改用 WMCM 的泄露图(2026 年 6 月)
- AppleInsider:A20 Pro 封装与散热(2026 年 6 月)
- Wccftech:标准版 A20 可能不采用 WMCM
PoP 早期年份、各代间距和带宽数字为公开资料中的典型值;A20 Pro 的内存规格和 WMCM 细节目前只来自报道和初步拆解,图中画法仅为示意。