前六篇不断增加生成式推荐的能力:ID 可学习、路径可推理、表示可连续、商品可创造、页面和广告可部署。最后必须停下来问一句:
总体 NDCG 提升,究竟来自一种新能力,还是测试集里恰好有更多适合这种模型的样本?
How Well Does Generative Recommendation Generalize? 不再提出一个更大的生成模型,而是重新切分证据。它比较 Atomic Item ID 模型与 Semantic ID 生成模型,发现两者擅长的不是同一种题。
30 秒看懂本文
- 常见叙事:SID 共享语义 token,因此能组合已知 token,预测训练中少见或未见的商品转移。
- 论文的诊断:测试样本应拆成依赖已见转移的“记忆型”和需要组合新路径的“泛化型”。生成模型通常更强于后者,Atomic ID 模型却常在前者占优。
- 最尖锐的发现:item-level 未见不一定是真泛化。目标商品转移虽然未出现,其组成 token 的局部转移可能已经被大量见过,这仍可能是一种 token-level memorization。
怎样把测试集拆开
考虑训练中出现过:
攀岩鞋 → 防滑粉
泳帽 → 速干毛巾
测试样本是:
攀岩鞋 → 速干毛巾
完整 item transition 从未出现,看起来需要泛化。但若两件商品的 SID 共享 <sport>、<gear> 等 token,模型可能早已见过对应 token transition。
因此至少需要三类样本:
- Item memorization:完整前项到目标商品的转移在训练中出现;
- Token composition:完整 item transition 未见,但组成 token 的局部转移已见;
- Sparse generalization:连关键 token 组合也很少或未见。
若只报告总体 NDCG,三类样本的比例会遮住模型真正的能力结构。
为什么 SASRec 与 TIGER 会互补
Atomic ID 为每件商品保留独立参数。它不擅长把信息迁移到未见商品,却能精确记住高频、稳定的具体转移。
SID 模型共享 token。它牺牲一部分精确记忆,换取跨商品共享统计和组合能力。
可以用两个分数表示:
[ s_{\text{atomic}}(i\mid H_u),\qquad s_{\text{sid}}(i\mid H_u). ]
固定平均并不理想。论文进一步构造与记忆信号相关的自适应融合:
[ s(i\mid H_u)
\alpha(H_u),s_{\text{atomic}} + (1-\alpha(H_u)),s_{\text{sid}}. ]
当请求更像已见转移时,提高 Atomic ID 权重;当请求需要组合时,提高 SID 权重。结论不是谁永久取代谁,而是谁在什么样本上更可信。
这对实验设计意味着什么
以后读生成式推荐论文,至少要问:
- 测试集中多少转移在训练中出现过;
- “冷商品”是 item 未见,还是 token 也未见;
- 随机切分是否泄露未来转移;
- 全量候选与采样候选是否混用;
- 总体提升来自哪个样本桶;
- 模型是否只在某个桶显著更好。
同一个总体指标,可能由完全不同的能力组合得到。模型 A 更会记忆,模型 B 更会组合,如果测试分布改变,排名就可能反转。
它没有证明什么
这篇论文主要围绕代表性的 Atomic ID 与 SID 模型展开,不能自动推广到 DIGER、ContRec、页面级 RL 或工业广告模型。
“组合未见转移”也不等于开放世界泛化。真实系统还会遇到:
- 新商品与新类目;
- 时间漂移和潮流变化;
- 跨市场迁移;
- 价格、库存与政策突变;
- 用户兴趣突然改变。
更严格的评估应把时间、商品新颖度和 token 新颖度同时控制,而不是只看一个未见标签。
第二季的结论
2026 年的生成式推荐不再只有“怎样生成 ID”这一个问题。七篇论文分别把边界向外推:
- DIGER:ID 能否被推荐损失改写;
- CARE:前缀错误怎样层层放大;
- ContRec:离散 SID 是否必要;
- DualFashion:推荐是否能生成商品;
- GenRec:训练单位能否变成整页;
- GR4AD:生成系统怎样进入广告主链路;
- 泛化审计:总体提升究竟来自什么能力。
它们共同给出一个更成熟的判断:
生成式推荐不是一种模型,而是一组关于表示、解码、目标、系统和证据的选择。
第二季到这里结束,但真正值得继续追踪的方向已经出现:动态商品语言、可验证推荐推理、长期反馈、开放世界冷启动,以及 Atomic ID 与生成模型的请求级协作。