全部学习路线Read in English →

PATH 01 · 8

大模型:从第一个 token 开始

从张量、注意力和训练目标,到真实模型输入输出、检索、MoE 与推理时计算。

  1. 01

    文字怎样变成模型能读的张量?

    从词表索引、embedding 查表和 padding 入手,建立 B、T、D、V 四个维度的直觉。

  2. 02

    亲手算一遍 Attention:Q、K、V 与因果遮罩

    用四个 token 看懂打分、归一化和加权聚合,理解为什么遮罩必须放在 softmax 之前。

  3. 03

    Transformer 不只有 Attention:残差、归一化、FFN 与位置

    沿着一个 decoder block 的数据流,辨认哪些运算混合 token,哪些只变换特征。

  4. 04

    从预训练到对齐:模型到底在优化什么?

    区分 next-token loss、SFT、LoRA 和偏好优化,动手检查 shifted labels 与有效监督位置。

  5. 05

    从 logits 到一句话:采样、KV cache 与停止条件

    亲手计算 softmax、温度与 top-p,分清生成策略和模型分布,也理解缓存如何避免重复计算。

  6. 06

    真实模型实验:token、hidden states、attention 与 embedding

    浏览器加载 MiniLM,Notebook 加载 GPT-2;用实际张量理解 encoder、decoder 和 pooling 的差别。

  7. 07

    Embedding、RAG 与评估:会检索不等于会回答

    把检索召回、重排、上下文构造和答案归因分开测量,用失败类型推动系统改进。

  8. 08

    走向前沿:MoE、长上下文、推理时计算与验证

    用计算、内存、通信和验证四个问题理解前沿设计,避免只背模型名和排行榜。