Meta · Multimodal LLMs
PATH 01 · 8 章
大模型:从第一个 token 开始
从张量、注意力和训练目标,到真实模型输入输出、检索、MoE 与推理时计算。
- 01
文字怎样变成模型能读的张量?
从词表索引、embedding 查表和 padding 入手,建立 B、T、D、V 四个维度的直觉。
- 02
亲手算一遍 Attention:Q、K、V 与因果遮罩
用四个 token 看懂打分、归一化和加权聚合,理解为什么遮罩必须放在 softmax 之前。
- 03
Transformer 不只有 Attention:残差、归一化、FFN 与位置
沿着一个 decoder block 的数据流,辨认哪些运算混合 token,哪些只变换特征。
- 04
从预训练到对齐:模型到底在优化什么?
区分 next-token loss、SFT、LoRA 和偏好优化,动手检查 shifted labels 与有效监督位置。
- 05
从 logits 到一句话:采样、KV cache 与停止条件
亲手计算 softmax、温度与 top-p,分清生成策略和模型分布,也理解缓存如何避免重复计算。
- 06
真实模型实验:token、hidden states、attention 与 embedding
浏览器加载 MiniLM,Notebook 加载 GPT-2;用实际张量理解 encoder、decoder 和 pooling 的差别。
- 07
Embedding、RAG 与评估:会检索不等于会回答
把检索召回、重排、上下文构造和答案归因分开测量,用失败类型推动系统改进。
- 08
走向前沿:MoE、长上下文、推理时计算与验证
用计算、内存、通信和验证四个问题理解前沿设计,避免只背模型名和排行榜。