从零开始的完整讲解
“前沿”首先意味着在约束下换一种资源分配
理解新架构时,先别问哪个缩写更新,而要问它想缓解哪种约束:参数容量、每 token 计算、KV 显存、通信、上下文长度,还是复杂任务上的搜索不足。不同方法可能优化不同瓶颈,不能放进一个不注明任务的排行榜里直接比较。
本章是机制导读,不把某个 checkpoint 宣称为长期 SOTA。模型支持和框架接口会变化,但“把总参数、激活参数、运行时内存和实际质量分开测量”的方法长期有效。
MoE:总参数多,不代表每次都全部计算
Mixture of Experts 在某些层放置多个专家网络,再由 router 为每个 token 选择少数专家。假设有 8 个专家、每次选 2 个,总专家参数容量来自 8 份网络,而单 token 的专家计算主要来自被选中的 2 份。共享层、路由与合并也有成本,不能简单说整模型计算恰好降为四分之一。
如果许多 token 都去同一个专家,设备负载就不均衡。训练通常需要负载管理;分布式 expert parallel 还涉及把 token 发到专家所在设备,再把结果送回。专家分工不一定人类可解释,更不等于 8 个独立机器人投票。
长上下文与压缩 KV 解决不同问题
长上下文让模型接收更多位置,但稠密 attention 的计算和 KV 的存储会增加。滑窗 attention 限制可直接读取的局部范围,改变连接结构;FlashAttention 主要改变内存访问与中间结果存储策略,保持标准 attention 的数学目标。这两者不能混为一谈。
MLA 通过低维 latent 表示压缩某些 KV 信息,再借助结构化投影参与注意力计算。它不同于简单减少 KV heads 的 GQA。实际收益取决于模型设计、缓存布局和支持的推理内核;把理论压缩比直接当成端到端速度提升会忽略解压、投影和其他开销。
推理时多算一点,为什么可能更好
最简单的办法是生成多个候选,用验证器或打分规则选择。代码题可以运行测试,数学题可以检查部分约束;这种外部反馈比单纯“写得更长”更可靠。若每个候选独立成功概率为 p,n 次至少成功一次的概率是 1-(1-p)^n,但真实候选常相关,而且系统还必须识别哪个候选正确。
例如 p=0.2、n=5,理想独立条件下至少一次成功约为 0.672。这个数字不是最终准确率承诺:如果验证器把错误答案选出来,收益会消失。样本相关、测试覆盖不足、预算限制都会影响实际结果。
将预算和效果放在同一张实验表
比较两种方案时固定题目集,记录正确率、平均及尾部延迟、生成 token 数、候选数、验证成本和失败类型。用同样 token 预算比较单条长回答与多候选短回答,才能讨论资源应如何分配。若一种方法只在容易验证的编程题上有效,不应直接推广到开放式事实问题。
长思考文本也不保证忠实反映模型内部决策。可验证的答案、过程中的可检验对象和干预实验,比把生成的自述当作内部机制更稳妥。
从入门走向论文复现
阅读论文时写下四句话:基线是什么,改了哪一步,代价增加在哪里,哪些实验能支持作者的主张。再找最小可执行子问题,例如比较同一小任务的 top-1 与 best-of-4,或计算 GQA 与普通 MHA 的 KV 账本。先复现一个局部机制,再尝试大规模训练,能避免把环境故障与算法问题混在一起。
前沿是几个瓶颈的重新分配
本章不把“SOTA”当成永久冠军。模型能力、任务定义、成本预算和软件版本都在变化。更持久的读法是:它减少了什么,代价转移到了哪里,哪些实验能反驳它?读报告时分别记录训练计算量、推理激活参数、总参数、上下文长度与实际吞吐。
MoE:少算一些专家,增加路由问题
Mixture-of-Experts 通常用 router 给每个 token 选择部分 FFN experts。总参数决定存储需求,active parameters 更接近每 token 的计算,但不等于实际 FLOPs 或延迟。负载不均、跨卡 all-to-all 和小矩阵效率都可能吞掉计算收益。Expert parallelism 不等于普通 tensor parallelism。
例如 8 个专家每次选 2 个,仅专家 FFN 部分激活 1/4,并不说明整个模型计算下降到 1/4,因为 attention、router、共享专家及通信依然存在。报告同时需要路由负载分布和 token drop / capacity 策略。
长上下文:装得下,不代表用得好
GQA 减少 KV heads,MLA 以低秩 latent 缓存等设计压缩缓存;这两种架构不能套用同一条 KV 公式。RoPE 扩展处理位置外推,检索/压缩处理证据选择,稀疏 attention 改变可读范围。它们作用于不同层面。长上下文测试应控制证据位置、干扰文本、所需推理跳数,并记录 TTFT 和缓存成本。
推理时计算:多想之后必须能验证
多次采样、搜索、过程推理与工具使用,把部分预算从训练移到测试时。数学、代码等任务可以用可验证反馈训练或筛选,但 verifier 有覆盖范围:通过测试并不保证没有未覆盖 bug。把更多生成 tokens 与更高 pass@k 分开报告,不能拿 k=64 对比别人 k=1 后只讲模型更聪明。
# 完整枚举的 toy pass@k:独立同分布假设下的示意,非真实估计器。
p = 0.2
for k in [1, 4, 16]:
print(k, 1 - (1-p)**k)
实际样本相关、预算不同,且使用有限样本估计 pass@k 时需要正确无偏估计器。本式只解释为什么增加尝试次数本身会提高“至少成功一次”。
自测
问题: 模型总参数翻倍、active parameters 不变,推理内存也不变吗?
展开答案
不一定。更多 experts 的权重仍需要存储、分片或搬运。active parameters 描述一次路由参与计算的部分,不能替代总权重存储和通信预算。原始资料与继续阅读
资料核对:2026-09-10。教学示例不代表生产基准;框架 API 和模型支持请以所链接版本为准。