Huiyu Chen / LABEXPERIMENT 001

THE MODEL OBSERVATORY

打开模型的黑箱。

给它一段记忆。追踪信息流。切断一个头,看看它会忘记什么。

试试

例如 red = fox 表示“red 对应 fox”;最后单独的 red 问它:对应谁?这里只识别 15 个 token 的受控词表。

查看词表与输入规则

red blue green gold pink cyan · fox owl cat elk bee yak · = ;

系统自动添加 <bos>。训练格式是 2–4 对不重复的颜色与动物,分号分隔,末尾只接一个已有颜色。其他合法 token 组合也能运行,但不保证正确。最多 31 个输入 token。

正在加载本站的微型模型…

FIELD NOTES

从看见,到理解。

01

它在“记忆”什么?

red 和 fox 并没有固定关系。训练时,每个样本随机重新配对颜色和动物。所以你把 fox 改成 owl,模型必须读取当前上下文,不能只依赖“red 通常对应谁”。这是一种受控的关联回忆任务。先运行前两个例子:输入结构几乎不变,但正确答案改变了。

02

一格颜色是什么意思?

每个 token 先变成 32 个数,加上位置向量,形成最左侧矩阵。每经过一层,注意力先混合前文的信息,MLP 再逐位置变换;两者都加回残差流。每个平面是一层计算后的 token × channel 矩阵,绿色是正值,珊瑚色是负值,三层使用共同色标。白框跟随你选中的 token。

03

看一眼,还不能解释模型。

连线展示 softmax(QKᵀ/√8) 的权重,表示一个头从各位置读取多少信息。权重大不代表“这个位置决定了答案”:V 的内容、输出投影和其他头也会影响结果。切断实验将一个头的 AV 置零,然后重算后续层。概率下降说明这个干预在当前输入上有影响,但不能据此证明该头在所有任务中都不可替代。

04

小模型,完整的计算。

这是本站从零训练的两层、四头、32 维、pre-norm causal Transformer,使用 learned positional embeddings、GELU MLP 和下一 token 分类头。它不是聊天模型,也没有自然语言理解能力的评测。训练还显式引导 L1H1 从动物读取颜色、L2H1 找到答案动物;另用仅在训练时使用的颜色分类头,帮助首层保留绑定信息。这是带注意力与表示监督的教学模型,不是“自动发现涌现电路”的证据。浏览器加载本站权重,用 JavaScript 实际计算每层。动画只追踪这些计算结果;它不表示真实硬件的执行时序。