首页大模型
专题二 · 大模型
大模型推理图解.
从 Transformer 讲到 AFD:为什么要把 Attention 和 FFN 拆到不同的芯片上。
- 0
先认识 Transformer
神经网络、训练与推理、语言模型、和 RNN 的区别、整体结构
- 1
文字怎么变成数字
Token、向量、Embedding、隐藏维度
- 2
模型本体是什么
参数、矩阵乘法、层、残差
- 3
Attention:词与词互相参考
Q/K/V、Softmax、亲手算一遍 QKV、多头、GQA、位置编码、因果掩码
- 4
模型怎么一个字一个字地写
输出层与采样、自回归、Prefill、Decode、KV Cache、上下文窗口
- 5
同时服务很多人
Batch、FFN、MoE
- 6
芯片的视角
显存、带宽、算力、算术强度、Roofline。和芯片专题的 HBM 一页是同一件事的两面。
- 7
AFD:把两块拆开
冲突、拆分、流水线、和 PD 分离的区别
- 附
术语速查表
40 个术语,一句话解释,标出在哪一节讲