Yiek Heng 的知识空间
首页大模型
专题二 · 大模型

大模型推理图解.

从 Transformer 讲到 AFD:为什么要把 Attention 和 FFN 拆到不同的芯片上。

  1. 0

    先认识 Transformer

    神经网络、训练与推理、语言模型、和 RNN 的区别、整体结构

  2. 1

    文字怎么变成数字

    Token、向量、Embedding、隐藏维度

  3. 2

    模型本体是什么

    参数、矩阵乘法、层、残差

  4. 3

    Attention:词与词互相参考

    Q/K/V、Softmax、亲手算一遍 QKV、多头、GQA、位置编码、因果掩码

  5. 4

    模型怎么一个字一个字地写

    输出层与采样、自回归、Prefill、Decode、KV Cache、上下文窗口

  6. 5

    同时服务很多人

    Batch、FFN、MoE

  7. 6

    芯片的视角

    显存、带宽、算力、算术强度、Roofline。和芯片专题的 HBM 一页是同一件事的两面。

  8. 7

    AFD:把两块拆开

    冲突、拆分、流水线、和 PD 分离的区别

  9. 附

    术语速查表

    40 个术语,一句话解释,标出在哪一节讲