Meta · Multimodal LLMs
PATH 04 · 4 章
HSTU:从行为序列到生成式推荐
逐张量拆解 HSTU,训练一个微型序列推荐器,再理解 ragged execution、候选打分与离线评估。
- 01
HSTU 的起点:推荐是在预测什么序列?
区分内容、行为、目标与候选,理解 sequential transduction 和数据泄漏的边界。
- 02
逐张量拆解 HSTU:SiLU 聚合、时间偏置与门控
比较 softmax attention 与 pointwise aggregation,辨认 U/Q/K/V、norm 与 residual 的各自作用。
- 03
训练一个微型 HSTU 推荐器:数据、Loss 与 Top-k
从零训练可执行的 PyTorch 教学模型,检查因果性、padding、梯度与推荐输出。
- 04
HSTU 规模化:Ragged、候选摊销与多模态内容表示
把长短序列浪费、候选相关计算和内容 embedding 分开分析,连接推荐与多模态理解。