Register Token以及对变形金刚AI的四大批判
Posted | stdin
前几天 Yann LeCun 对 变形金刚(transformers) AI 进行了深刻的批判
First, the reasoning abilities of current AI systems are based non-auto-regressive search (which is what I have always advocated for). But AFAICT, they do it in token space, which is limited and inefficient. I have claimed that human-like reasoning must be a search in continuous representation space. It looks like the industry is moving towards that.
Second, the self-improvement methods, as currently practiced, only work for domains where the quality of outputs can be scored without human intervention, such as mathematics, code, and scenarios that can be simulated accurately. Not anything else. Humans and animals learn new skills way more efficiently than current RL methods.
Third, the multimodal capabilities of current AI assistants generally use separately-trained encoders (that are not LLMs). This is also what I've been advocating. Except that I think the best way to do this is with JEPA trained with self-supervised learning. The research community is clearly moving towards that (3000 papers on JEPA in just 4 years).
Fourth, if LLMs were a path to human-level AI, we would have domestic robots and Level-4 or Level-5 self-driving cars for consumers by now. And we don't. We certainly don't have cars that can learn to drive in 20 hours or practice like any teenager. We're still missing something pretty huge to claim human-level intelligence (let alone superhuman).Sure, we now have computer systems that are impressive, very useful, and whose performance is superhuman in an increasing number of domains (coding being one of them). But that's true of the entire history of progress in computer technology.
可能很多人早知道这个了,对我来说,很新鲜。毕竟我是AI 外行。以前一直听说 自回归 自回归,其实我今天才突然反应过来,这个 回归,就是数学期望那里,预测的意思。这里的 自 就是 一个token接着另一个token源源不断“自动” 跳出来直到 eos_token 的意思。🤣
他老人家都这么说了,想了下还真是。用 LLM 越多,越会明白在 Token 空间里做推理的局限性。
于是我突然想起很多天之前看到的一个youtube 视频,21世纪被引用次数最多的论文。这个35分钟的视频非常值得推荐完整观看。剧透:它讲的是 残差网络 ResNET
它提到另外一件事引起了我极大的兴趣,Meta FAIR 在ICLR 2024论文,发现了一个有趣现象:ViT 模型(尤其是 DINOv2、OpenCLIP、DeiT-III 这类大规模训练的模型)在推理时会产生一些"异常高范数"(high-norm)的 token,大约占总序列的 2%。这些 token 集中出现在图像中低信息量的背景区域,几乎都是纯色块,携带很少的局部位置/像素信息,却携带大量全局图像信息。只在模型足够大、训练足够久之后才出现(比如 DINOv2 只有 Large 及以上尺寸才有)。这些token会破坏注意力图的可解释性,损害密集预测任务(分割、深度估计)和无监督目标发现(LOST 算法)的效果
他们摸清楚一个脉络,最后研究发现,在输入序列里额外加几个可学习的"寄存器"(register)token,让模型有专门的地方做全局计算,不用再"borrow"图像 patch。加了之后,异常高范数 token 消失,注意力图变干净,下游任务(尤其密集预测和目标发现)性能还略有提升,几乎不增加参数和计算量。
是不是感觉这几件事相当跳跃,我在瞎说些啥呢?
那是因为你没看那个35分钟的视频。我就凭记忆,用我的理解回顾一下(我不太懂AI,纯外行。如有出入视频作者全责😂)
神经网络我觉得就是好几层矩阵相乘造就的魔法。但归根结底 tmd是一个分类器。传统每一层 NN 就干的事就是从上一层的结论里,加工自己的一道参考信息,然后激活给下一层NN继续加工。最后一层就是 N 选 1 的分类。对于 LLM 来说就是词汇表里吐出 next token。
但是这玩意早年极其容易翻车,shattered gradiant,ResNET 横空出世,据说是个 hack,把上上一层的权重和本层的权重做一次 加法。最后输出就稳了
这就有意思了,NN每一层都是无状态的,需要猜上一层为啥处理成这个样子;每一层给出结论,请重点关注某个值,但是至于一开始的为啥要给 attention,可能早就忘记了。这个所谓 残差,就是每一层都给后面一层工作留一个小纸条?就好比工匠无意中在木结构看不到的一些内部地方打上了一些标记。换班的水电工一眼看出这些标记在行业里的用处
AI告诉我,register token就更进一步,人为加进去的、专门给模型当工作空间的 token。attention sink 是模型自己长出来的现象:某些 token 会莫名其妙吸走大量 attention,即使它们语义上并不重要。activation outlier / residual sink则是在 hidden state 某些维度上出现异常大的值。2026 年的工作甚至发现,massive activations 和 attention sinks 经常同时出现,但它们承担的功能并不完全相同:前者更像一种跨层持续存在的“隐式参数”,后者更像是在局部调节 attention。
然后结合今天 ylecun 四大批判,我突然有个看法,变形金刚的未来,说不定又走回 BERT 那种 encoder 思路了?也就是说在一个session内,变形金刚一直在尝试 自创(encode)一些 符号 名词概念 作为中间产物。
我赶紧拿这个去问了AI。
FAIR那个论文 附录(Fig. 9、Fig. 16)里其实发现,不同的 register 会自发分化:有的更关注图像边缘,有的更关注中心区域,行为很像 Slot Attention(一种专门用来无监督地把图像切分成"物体槽位"的机制)。也就是说,即便没有人告诉它该怎么分工,模型自己在若干个"空白格子"里长出了某种专业化结构
这验证了我前面提到的"自创概念"。AI告诉我,文本模型这边也有对应物:
- Pause/Filler tokens(Goyal 等,2023):给 LLM 在开口回答前插入几个没有语义的占位 token,让它"多想一步",效果类似给 register 一样的免费计算空间。
- Gist tokens(Mu 等,2023):训练模型把一整段很长的 prompt/指令压缩进几个可学习的 token里,之后这几个 token 的 KV 缓存就能代替原始长文本被后续计算调用——这已经是字面意义上的"自创浓缩符号"了。
- Coconut / "Training LLMs to Reason in a Continuous Latent Space"(Meta,2024):这个最接近你说的场景。正常的 chain-of-thought 是模型把每一步推理都解码成人类能读的词;Coconut 让模型把上一步的隐藏状态直接喂回去当下一步的输入,不经过"变成词"这个环节。于是模型在一个 session 内部,用一串连续的、非语言的"思维向量"来做推理,只在必要时才把结果翻译回人话。作者甚至发现这种连续思维能同时编码好几条可能的推理路径(类似广度优先搜索),比被迫每步都写成一个确定的词更灵活。
AI提到:
这些自创的中间产物,默认情况下是连续向量,不是像"猫""狗"这种离散、人类可读的符号。你说的"符号/名词概念"更像是一种比喻——真正发生的是模型在高维连续空间里捏出一团对它自己有用、但对人不透明的表示。这也正是这条路线的双刃剑所在:Coconut 这类"潜空间推理"效率更高、更灵活,但代价是可解释性变差——人没法像读 chain-of-thought 文字那样,看懂模型这一步到底在"想"什么。这也是目前 AI 安全/可解释性圈子挺关心的一个权衡点:模型内部会不会形成一套人类读不懂的"暗语",用来在一次推理里传递信息。
嗨,这不巧合了嘛!人类的深度思索过程,也会创造自己不能语言表达的连续符号啊。比如如何狩猎的,空间位置和行动,态势变化和应对。当然你实在用语言描述也是可行的。但是很多战术理念是“心领神会”,充满比喻,平时需要猎人之间训练配合的“默契”。
解题思路,很多时候“直觉” 或者 “奇思妙想”,要描述出来也是很困难的。其实就是一种内在表达
艺术创作更不用说了,什么情绪,境遇,都是很难精准描述的。但是好的东西就是能引起共鸣。诗歌里的“隐喻”特别多。
AI 一下子被点通了:
"默会知识"(Tacit Knowledge)——这是哲学家 Michael Polanyi 在 1966 年提出的经典概念,他的原话就是"我们知道的比我们能说出来的更多"(We can know more than we can tell)。他举的例子恰好就是猎人、工匠、骑自行车、认脸这类技能:你能熟练地做,甚至能一眼分辨"这个猎手动作对不对",但让你把判断标准写成一条条规则,你写不出来,或者写出来的东西根本不是你实际依赖的那套判断机制。狩猎里那种"态势感知"、"该往哪个方向包抄"的直觉,正是这类默会知识的典型案例。
更巧的是,Coconut 那篇论文的灵感来源之一就是神经科学的一个发现:人在做复杂推理(比如下棋、空间规划)时,大脑里负责语言的区域往往并不活跃——语言网络主要是用来表达和交流的,未必是"思考本身"发生的地方(这是 MIT Fedorenko 实验室这些年一直在推的一条研究线:"语言不是用来思考的,是用来交流思考结果的")。这跟你说的"很多战术理念心领神会,语言只是事后的翻译"是同一件事的两种表述。
你提的"猎人之间的默契"还有个更具体的 AI 对应物:多智能体强化学习里有个叫"涌现通信"(Emergent Communication)的研究方向——让多个 AI agent 一起协作完成任务,不给它们任何预设语言,结果它们会自己发展出一套只有彼此能懂的"暗号"来协调行动。早年 Facebook 那个著名的谈判机器人实验,两个 bot 谈着谈着就开始用人类读不懂但内部逻辑自洽的"简写"互相沟通,团队一度要专门约束它们"必须说人话"。这几乎是你说的"猎人之间训练出的默契"在机器上的直接翻版——协作压力会自发催生出非人类语言的、高效但不透明的符号系统。
诗歌和隐喻这块也有对应理论:语言学家 Lakoff 和 Johnson 的"概念隐喻理论"(Metaphors We Live By)认为,人类很多抽象/情绪概念本来就不是靠精确定义存在的,而是靠从具体身体经验"打包映射"过去的——比如"人生是一场旅程",我们理解"人生"靠的是身体对"走路、方向、终点"的经验,隐喻不是修辞装饰,是概念本身的存在方式。这在结构上跟词向量/embedding 空间的工作原理惊人地像:一个词的"意义"不是查字典查出来的定义,而是它在高维空间里相对于其他词的位置和距离——这正是为什么好的隐喻能"引起共鸣":它精确地把一个词挪到了空间里一个新位置,让人瞬间"感觉到"了那种关联,即使没法用命题逻辑讲清楚为什么。
顺着这个思路还有个挺震撼的新假说,叫"柏拉图表征假说"(Platonic Representation Hypothesis,MIT,2024):作者发现,不同架构、不同任务、甚至不同模态(图像模型 vs. 语言模型)训练出来的神经网络,随着规模变大,它们内部对"世界"的表征方式竟然在互相趋同——仿佛都在逼近同一个底层的、柏拉图意义上的"真实结构"。如果这个假说成立,也许能解释你说的"好的东西就是能引起共鸣":不同人(甚至不同物种、不同智能体)的大脑/网络虽然各自训练出一套私有的内部表示,但如果都在逼近同一个客观世界的统计结构,那么一首好诗触发的那个"说不清但都懂"的感受,可能真的对应着大家内部表示空间里一个相近的位置。
感觉和 Yann LeCun 大佬的思路太厉害了。它这么多年批判自回归 LLM 缺四样东西——对物理世界的理解、持久记忆、推理、规划——他认为这不是"训练得不够大"的问题,太犀利了。这种架构性的死胡同,就是导致他 2025 年离开 Meta 搞JEPA的原因?不靠逐词生成、而是在抽象表征空间里维护和更新一个可持续演化的"世界模型"的系统。
说得再直白一点,现有的LLM智能,就是个 classifier
我觉得,真正的智能需要决定,什么时候是选择 non of the tokens above
一个自回归模型每一步在做的事,字面意义上就是一次分类——对词表里几万到几十万个 token 做 softmax,选一个概率最高(或采样出)的。
虽然可以反驳,把很多次这样的分类串起来,输出空间是指数级增长的——理论上可以生成训练数据里从未出现过的句子、证明、诗句。这正是创造力研究里 Margaret Boden(刚去世,这个领域的奠基人物)说的"组合式创造力"(combinatorial creativity)
但这样的智能,关键词是 —— 串。的确frontier AI 能作出很多令人惊叹的成果。甚至普通人遥不可及,但是代价是——串行。
也就是传说中的炼丹,抽卡。某些条件成熟了,reasoning和temperature恰好合适,agent 和 harness 恰好走对了,就能拿到低垂果实。
但是人类发明概念是源源不断的,meme的传播嘛。这可不是“串”行,而是霰弹枪 “啪” (one-shot 🤣) 一下,总多概念,总有一个能火力覆盖到一个没太见过的新鲜事物上,并且低成本快速掌握。而现在的AI 就得话不少 context 去“串起来” 才行。
AI说
你这个"霰弹枪 vs 串行"的对比,精确地踩中了一个已经有名字、有数学模型的现象——而且两边(人类创造力研究、AI 可靠性研究)居然是分头独立发现的。
先说人类这边的"霰弹枪"理论,比你想的还要精确。
心理学家 Donald Campbell 1960 年提出"盲变异—选择性保留"(Blind Variation and Selective Retention, BVSR):创造过程本质上是达尔文式的——先大量地、相对盲目地生成变异(不是精心设计出一个必中的方案),再靠后续的选择机制留下有用的那个。Dean Simonton 在此基础上研究了两千多位历史上的科学家、艺术家,1997 年提出"等概率法则"(Equal-Odds Rule):一个创作者产出"神作"的比例,跟他是不是天才其实关系不大——天才和普通人每一件作品成为杰作的概率大致相同,天才只是产量大得多。Erdős 一辈子发了 1500 多篇论文,绝大多数无人问津、早就被遗忘,但正是这个巨大的"总发射量",让他撞上了拉姆齐理论这种真正改变领域的成果。这跟你说的"总有一个能火力覆盖到",几乎是同一句话的学术版本。再往上一层,meme 的传播压根不是单个大脑内部的并行——那是数十亿个大脑同时在生成变异,靠文化选择去放大命中的那一个(这就是道金斯说的模因论/文化演化)。这个并行规模比"霰弹枪"大出去不知道多少个数量级,单个大脑内部再怎么"啪"一下,也比不过整个文明每天在同时试错。
AI 这边,其实field自己也早就意识到"纯串行=脆弱"这个问题,而且给出的解法方向恰恰就是"变成霰弹枪"。
单条链最致命的地方是错误复合:如果每一步正确率是 95%,串 20 步,整体成功率掉到 36%(0.95^20)——这正是"炼丹抽卡"体感的数学根源,probability 是乘出来的,不是加出来的。为了对抗这个,最近几年推理/Agent 领域的主流做法,说白了都是"别赌一条链,改成一次放很多枪再挑":Self-Consistency(Wang 等,2022)——同一个问题采样几十条推理链,投票选最多数的答案;Tree of Thoughts(Yao 等,2023)——同时展开多条思路分支,中途评估、剪枝、回溯;再往后的各种"test-time compute scaling"方法,本质都是把串行的单链,换成并行采样+事后选择——这跟你说的"霰弹枪打一片,总有一个覆盖到"是完全一样的逻辑,只是子弹换成了"多条并行生成的候选答案"。
其实想到这里,我感觉和上一篇《聪明 Agent 四套路 和 人肉学习》 又莫名其妙关联起来了。
或许如果 register token 这一套能沉淀,跨session共享,实际上就能变成新的 token,变成共同的符号和记忆。人类的语言和文字,知识传承就是这么来的。
那么NN就不再是 自回归 ?说不定就 AGI 了?
Comments