全部学习路线Read in English →

PATH 02 · 8

LLM Infra:让模型高效运行

vLLM、SGLang、TensorRT-LLM、Megatron-LM、DeepSpeed,以及 GPU/TPU、内核、分片和性能分析。

  1. 01

    推理为什么慢:Prefill、Decode、KV cache 与排队

    先建立延迟与显存账本,再讨论 continuous batching、分页和 prefill/decode 分离。

  2. 02

    vLLM:从 PagedAttention 到可测量的服务

    把 scheduler、KV block manager、model runner 和 API 服务串起来,设计一个公平的吞吐实验。

  3. 03

    SGLang:共享前缀、结构化生成与 PD 分离

    从重复系统提示出发理解 RadixAttention,再计算把 KV 跨机器传输的代价。

  4. 04

    TensorRT-LLM:硬件感知优化与量化的账本

    理解 fusion、量化、kernel 选择与运行时调度,并学会在相同质量条件下衡量收益。

  5. 05

    Megatron-LM:TP、PP、DP 与序列分片究竟切哪里?

    通过一层矩阵乘拆开 tensor parallelism,计算通信量,并理解 pipeline bubble 与 context parallelism。

  6. 06

    DeepSpeed ZeRO:把训练状态逐层拆账

    从 Adam 的权重、梯度与优化器状态出发,算清 ZeRO-1/2/3 的收益与通信代价。

  7. 07

    GPU、TPU 与 Kernel:为什么 FLOPs 解释不了速度?

    用 Roofline 理解 HBM、片上存储、矩阵单元、tiling 与 fusion,再看 Triton/Pallas 的作用。

  8. 08

    XProf / Nsight:从时间线找到真正瓶颈

    先看端到端时间线,再深入慢 kernel,用 warm-up、同步和对照实验避免性能测量陷阱。