Meta · Multimodal LLMs
PATH 02 · 8 章
LLM Infra:让模型高效运行
vLLM、SGLang、TensorRT-LLM、Megatron-LM、DeepSpeed,以及 GPU/TPU、内核、分片和性能分析。
- 01
推理为什么慢:Prefill、Decode、KV cache 与排队
先建立延迟与显存账本,再讨论 continuous batching、分页和 prefill/decode 分离。
- 02
vLLM:从 PagedAttention 到可测量的服务
把 scheduler、KV block manager、model runner 和 API 服务串起来,设计一个公平的吞吐实验。
- 03
SGLang:共享前缀、结构化生成与 PD 分离
从重复系统提示出发理解 RadixAttention,再计算把 KV 跨机器传输的代价。
- 04
TensorRT-LLM:硬件感知优化与量化的账本
理解 fusion、量化、kernel 选择与运行时调度,并学会在相同质量条件下衡量收益。
- 05
Megatron-LM:TP、PP、DP 与序列分片究竟切哪里?
通过一层矩阵乘拆开 tensor parallelism,计算通信量,并理解 pipeline bubble 与 context parallelism。
- 06
DeepSpeed ZeRO:把训练状态逐层拆账
从 Adam 的权重、梯度与优化器状态出发,算清 ZeRO-1/2/3 的收益与通信代价。
- 07
GPU、TPU 与 Kernel:为什么 FLOPs 解释不了速度?
用 Roofline 理解 HBM、片上存储、矩阵单元、tiling 与 fusion,再看 Triton/Pallas 的作用。
- 08
XProf / Nsight:从时间线找到真正瓶颈
先看端到端时间线,再深入慢 kernel,用 warm-up、同步和对照实验避免性能测量陷阱。