01
BPR
推荐系统原本是一台打分机
从隐式反馈、正负样本和 pairwise loss 开始,建立传统推荐的基本范式:学习 s(u,i),然后排序。写作中
Meta · Multimodal LLMs
专题系列 · 00–20
从 BPR 的打分器,到 OneReason 的推荐推理
推荐系统从“给所有商品打分”,是怎样一步步变成“直接生成商品、列表,甚至推荐理由与思考过程”的?
Read in English →序章 · 已发布
在进入论文之前,先分清模型是在生成语言、商品 ID、完整列表,还是一个看起来像推理的过程。
从序章开始 →一张图看懂主线
20 篇论文路线图
01–04
先学会比较商品,再学会理解行为发生的顺序。
BPR
GRU4Rec
SASRec
BERT4Rec
05–09
统一任务、迁移知识,也暴露语言能力与偏好理解之间的鸿沟。
P5
M6-Rec
TALLRec
ReLLa
LLaRA
10–15
从生成文档 ID 到设计推荐 tokenizer,商品第一次真正成为可解码的 token。
DSI
TIGER
GPTRec
LC-Rec
LETTER
ETEGRec
16–20
两条路线在超长序列、统一召排、工程约束和推荐推理中汇合。
HSTU
OneRec
MTGR
OneRec-Think
OneReason
统一阅读方法
生活例子、上一代模型的困难,以及这一篇的一句话答案。
输入输出、tensor shape、训练数据、推理过程和复杂度。
一个核心公式、一张关键实验、一个重要 ablation,以及论文没有证明什么。
贯穿全系列的玩具世界
固定行为序列是“网球 → 攀岩 → 羽毛球 → 游泳”。每篇都画前后对比、数据流、公式拆解和证据图,让变化发生在同一份数据上。