THE MODEL LEARNING STUDIO · 01—04

Read in English →

把模型拆开, 再亲手运行。

从零建立直觉,用张量和代码验证理解。每条路线都包含完整中英文章、可操作的实验和进阶阅读。

01

Token → Tensor / Train → Align / Inspect → Evaluate

大模型:从第一个 token 开始

从张量、注意力和训练目标,到真实模型输入输出、检索、MoE 与推理时计算。

8 章 · 原理 / 实验 / Notebook
02

Serve / Shard / Profile

LLM Infra:让模型高效运行

vLLM、SGLang、TensorRT-LLM、Megatron-LM、DeepSpeed,以及 GPU/TPU、内核、分片和性能分析。

8 章 · 原理 / 实验 / Notebook
03

Align / Reconstruct / Ground

多模态:从像素到内容理解

图像 patch、CLIP、masked reconstruction、视觉语言模型与视频时间轴:理解模型看见了什么。

5 章 · 原理 / 实验 / Notebook
04

Sequence / Transduce / Rank

HSTU:从行为序列到生成式推荐

逐张量拆解 HSTU,训练一个微型序列推荐器,再理解 ragged execution、候选打分与离线评估。

4 章 · 原理 / 实验 / Notebook

按问题学习,不必一次读完。

第一次接触大模型?从路线 01 开始。模型太慢?进入路线 02。处理图文视频?从路线 03 的 patch 和对齐入手。研究推荐?在路线 04 里沿着行为时间轴动手。

实验标明计算方式:教学数值模型、浏览器内真实预训练模型、或需要 Python / GPU 的 Notebook。估算值不代表硬件实测。