全部学习路线Read in English →

PATH 04 · 4

HSTU:从行为序列到生成式推荐

逐张量拆解 HSTU,训练一个微型序列推荐器,再理解 ragged execution、候选打分与离线评估。

  1. 01

    HSTU 的起点:推荐是在预测什么序列?

    区分内容、行为、目标与候选,理解 sequential transduction 和数据泄漏的边界。

  2. 02

    逐张量拆解 HSTU:SiLU 聚合、时间偏置与门控

    比较 softmax attention 与 pointwise aggregation,辨认 U/Q/K/V、norm 与 residual 的各自作用。

  3. 03

    训练一个微型 HSTU 推荐器:数据、Loss 与 Top-k

    从零训练可执行的 PyTorch 教学模型,检查因果性、padding、梯度与推荐输出。

  4. 04

    HSTU 规模化:Ragged、候选摊销与多模态内容表示

    把长短序列浪费、候选相关计算和内容 embedding 分开分析,连接推荐与多模态理解。