专题系列 · 00–20

推荐系统如何学会“说出答案”:20 篇论文读懂生成式推荐

从 BPR 的打分器,到 OneReason 的推荐推理

推荐系统从“给所有商品打分”,是怎样一步步变成“直接生成商品、列表,甚至推荐理由与思考过程”的?

Read in English

序章 · 已发布

生成式推荐到底在生成什么?

在进入论文之前,先分清模型是在生成语言、商品 ID、完整列表,还是一个看起来像推理的过程。

从序章开始

一张图看懂主线

同一条问题,分成两条支线,最后重新汇合。

BPR打分与排序
GRU4Rec → SASRec → BERT4Rec行为序列
05–15模型究竟生成什么?
P5 → LLaRA生成语言答案
DSI → ETEGRec生成商品标识
HSTU → OneRec → OneReason统一、规模化与推荐推理

20 篇论文路线图

每一篇都由上一篇未解决的问题推出来。

01–04

前世:从打分到序列

先学会比较商品,再学会理解行为发生的顺序。

01

BPR

推荐系统原本是一台打分机

从隐式反馈、正负样本和 pairwise loss 开始,建立传统推荐的基本范式:学习 s(u,i),然后排序。
写作中
02

GRU4Rec

用户不是一个点,而是一段正在发生的故事

用户兴趣会变化,于是推荐第一次认真建模行为顺序。
写作中
03

SASRec

历史很长,真正相关的可能只有几步

用 causal self-attention 代替 RNN,解释注意力如何寻找与下一次行为相关的历史。
写作中
04

BERT4Rec

把商品当成词,把购物记录当成句子

Item ID 变成 token,行为序列变成句子,Cloze/MLM 正式进入推荐系统。
写作中

05–09

LLM 支线:把推荐写成语言任务

统一任务、迁移知识,也暴露语言能力与偏好理解之间的鸿沟。

05

P5

所有推荐任务都能改写成一句话吗?

把评分、序列推荐、解释生成统一成 text-to-text,推荐不再只有一个任务头。
写作中
06

M6-Rec

一个模型承包召回、排序、解释和创作

从学术统一走向工业 foundation model:prompt tuning、开放任务与推理效率。
写作中
07

TALLRec

通用 LLM 并不天然懂“喜欢”

解释语言能力与推荐能力之间的 domain gap,以及 LoRA/SFT 为什么有用。
写作中
08

ReLLa

上下文放得下,不等于模型看得懂

长行为序列直接塞进 prompt 反而可能更差;引出行为检索和相关历史筛选。
写作中
09

LLaRA

世界知识与协同行为怎样合体?

传统推荐器懂共现,LLM 懂商品语义;这一篇讲两种表示空间如何对齐。
写作中

10–15

Semantic ID 支线:直接生成商品

从生成文档 ID 到设计推荐 tokenizer,商品第一次真正成为可解码的 token。

10

DSI

如果检索不再查索引,而是直接生成 ID

生成式检索的祖先:把 doc ID 当成输出 token,直接学习 P(ID|query)。
写作中
11

TIGER

给每件商品一串有语义的门牌号

RQ-VAE、Semantic ID、逐 token 解码,以及语义 ID 为什么有利于大规模检索和冷启动。
写作中
12

GPTRec

Top-K 不是唯一答案,推荐列表也能逐个写出来

SVD 子 ID、Next-K generation,以及生成整个列表为什么能优化多样性等整体目标。
写作中
13

LC-Rec

语义上相似,不代表同一群人喜欢

区分 language semantics 和 collaborative semantics,并介绍量化编码与对齐任务。
写作中
14

LETTER

一个好 ID,必须懂内容、共现和均衡

深挖生成式推荐最核心的 tokenizer 问题:层次语义、协同正则和 codebook 塌缩。
写作中
15

ETEGRec

Tokenizer 不该只是离线前处理

Tokenizer 与推荐模型联合优化,讲清双重对齐目标和 alternating optimization。
写作中

16–20

工业汇合:统一、规模化与推理

两条路线在超长序列、统一召排、工程约束和推荐推理中汇合。

16

HSTU

推荐模型也存在 Scaling Law 吗?

Meta 将推荐重写为 sequential transduction,讨论超长行为、工业效率与规模化。
写作中
17

OneRec

召回和排序,能否由一个模型一次完成?

Session-wise generation、Sparse MoE、DPO,把 retrieve–rank 多阶段管线统一起来。
写作中
18

MTGR

传统交叉特征真的应该全部扔掉吗?

对纯序列生成路线提出工程反思:保留 DLRM cross features、用户级压缩与部署成本。
写作中
19

OneRec-Think

推荐也需要先想后答吗?

Item–text alignment、推荐 CoT、偏好奖励,推荐开始尝试显式、可控的推理。
写作中
20

OneReason

看起来会思考,不代表真的懂偏好

用 perception 与 cognition 重新审视推荐推理,为系列留下真正开放的问题。
写作中

统一阅读方法

零基础能进入,工程师能复现,读论文的人能质疑。

01

零基础层

生活例子、上一代模型的困难,以及这一篇的一句话答案。

02

工程层

输入输出、tensor shape、训练数据、推理过程和复杂度。

03

论文层

一个核心公式、一张关键实验、一个重要 ablation,以及论文没有证明什么。

贯穿全系列的玩具世界

同一个用户,同一组商品,看模型如何一代代改变。

固定行为序列是“网球 → 攀岩 → 羽毛球 → 游泳”。每篇都画前后对比、数据流、公式拆解和证据图,让变化发生在同一份数据上。

🎾
🧗
🏸
🏊