这是Transformer系列的第四篇。前三篇诊断了三件事:走不到理解、验证权留不住、缺验证轴。这一篇,从“怎么修”退一步,先回答一个更基础的问题:这六个死穴,到底是不是Transformer的错?结论是:不是。它们是概率引擎的共同难题,Transformer的架构让它们更复杂、更难解,但根源不在Transformer本身。这不代表前三篇的判断被推翻。“走不到理解”是架构层面的边界判断;这六个死穴是工程层面的技术症状。两者不在一个层级,不能互相替代。
【导论】
如果你没读过前三篇,这里是一句话版本:
- 第一篇:Transformer靠概率预测,走不到真正的理解。
- 第二篇:就算加上验证机制,验证权也留不住,不能由系统自己掌握。
- 第三篇:概率引擎在做两场概率游戏——token预测和压缩——缺第三轴:验证轴。
三篇连起来,一直在拆“缺什么”。但拆完之后,有一个问题必须回答:这些缺口,是Transformer的错吗?如果是,那唯一的出路就是换架构,等下一个Transformer。如果不是,那问题就变成了:在现有概率引擎上,外面该建一套什么样的工程系统。这一篇要说的就是:Transformer作为概率引擎,没有被冤枉。它只是被要求做了它本不该独自承担的事——验证、状态管理、因果分类、停止与换纸。这些本该是外面工程系统的职责。这里要先说清楚“概率引擎”指的是什么。
不是所有概率模型。贝叶斯系统可以有显式状态,概率图模型可以有显式因果,概率规划可以有显式控制流,概率数据库可以有可审计状态。它们不是这篇文章的对象。这篇文章说的“概率引擎”,特指:以高维概率生成为核心、把状态、推理、记忆、验证都压进参数和生成过程的那一类架构。Transformer是它今天最突出的代表,但不是它唯一的载体。这里也要说清楚三个概念的区别:
- 锚点:不可被AI系统自身改写的信任根。
- 真值标尺:基于锚点形成的可操作验证标准。
- 验证权:谁有权判定、否决、作废。
三者是递进的。锚点是基础,真值标尺是从锚点长出来的,验证权是持有并使用真值标尺的权力。这里也要和第三篇说清楚关系。第三篇说“缺验证轴”,指的是概率引擎自己长不出这根轴。这一篇进一步说:这根轴本来就不该由引擎自己长。它该是外面工程系统的职责。所以问题不是“Transformer缺了一根轴”,而是“概率引擎外面,那套本该承担验证轴的工程系统,还没建起来”。这两句话不矛盾。第三篇是诊断“引擎做不到”,第四篇是归位“这件事本就不该引擎做”。是往前推了一层,不是改口。
四篇连起来看,递进是这样的:
- 第一篇:走不到理解(架构边界)
- 第二篇:验证权留不住(权力归属)
- 第三篇:缺验证轴(结构缺失)
- 第四篇:这些不是Transformer的错,是工程系统缺位(归位)
第一部分 六个死穴,同一个性质
前三篇已经讨论了三个更根本的问题:理解、验证权和验证轴。剩下这六个,看起来一个比一个棘手,但在这套理论里,它们属于工程层面的死穴,相对而言并不重要——不是因为它们容易解决,而是因为它们不是概率引擎走向理解的根本边界。不重要,不等于不难。不重要,是说它们不是最底层那道墙。它们是症状,不是病根。这六个死穴,是从第三篇提出的处理轴、存储轴框架里抽出的工程死穴。它们看起来各不相同:有的关于计算,有的关于推理,有的关于记忆,有的关于因果,有的关于验证。但它们有一个共同性质:
它们都不是Transformer独有的缺陷,而是这一类概率引擎的共同难题。Transformer的架构,让它们变得更复杂、更难解。具体来看:
死穴一:长程依赖与计算尺度。上下文窗口扩大,不等于状态变准确。这个问题所有概率系统都有。Transformer的全局注意力,让上下文里所有token的权重同时计算,没有天然的模块边界,所以状态隔离比结构化系统更难做。
死穴二:离散可验证推理的缺失。概率生成可以给出一个看起来完整的推理链,但并没有天然提供一个可审计、可逐步验证的离散中间状态。这不是Transformer独有的,但Transformer的连续概率空间,让这个缺失更加明显:程序可以留下每一步状态;概率生成往往只留下最终答案。
死穴三:停止与规划的缺失。模型的本能是“预测下一个token”,它没有内生的停止环。外挂这个环,同样面临成本高、延迟大的问题。Transformer没有显式的控制环,外挂接口和协调成本更高。
死穴四:序列位置不等于因果。Transformer有序列的位置关系,但序列的位置关系本身不是因果关系。它可以学习“先发生什么”,却不因此自动获得“为什么发生”。这不是Transformer独有的,但并行训练让这个区别更加难以被模型自己识别——它学到的“先后”,是训练数据里反复出现的时序纹路,不是物理意义上的因果不可逆。更进一步,它更容易把训练数据里的统计共现,误当成物理不可逆的因果约束。这里要说明:“因果伪造”不是一个被严格证明的机器学习性质,而是描述一种倾向——模型可能把统计上的时序关联,生成成具有因果意味的叙述。它不意味着模型没有因果理解的能力,它意味着这种理解是概率化的,不可靠的。
死穴五:灾难性遗忘。参数化存储不是天然适合持续在线更新、同时保持旧知识可验证性的状态系统。所有神经网络都有这个问题。Transformer的规模、稠密表示、无显式记忆结构,让代价更大,平衡更难找。纯参数化持续更新,天然存在新旧知识干扰问题。
死穴六:权重是不可审计的沉积岩。预训练加多轮SFT、RLHF、LoRA,全糊进同一批浮点。没有可剥离的历史层,就没有“作废”这个动作。这不是Transformer独有的设计,是所有稠密参数网络的共同特征。Transformer的规模,让这个问题更难处理。
六个死穴,一个性质:不是Transformer独有的,是它让问题更复杂、更难解。这六个是文章中最后列出的死穴。第三篇提到的幻觉空穴、奖励欺骗、自我模型缺失、OOD置信度不降等,本质上属于同一类问题——都落在“概率引擎缺少外部工程支撑”这个共同结构里,后续展开时会一并处理。
第二部分 六个死穴,三类性质
虽然都是“更难解”,但难度类型不一样。可以分成三类:
第一类:可以通过外挂状态账本隔离的。死穴一(长程依赖)和死穴六(权重不可审计),本质上是一个状态管理与不可审计问题。如果把状态从模型内部抽出来,做成外部的、可审计的账本,问题就能极大缓解。上下文不再是混在一起的token流,而是带时间戳、带状态标记的结构化输入。死穴六的“权重不可审计”特性,正是状态账本要解决的核心。这不需要改Transformer,只需要在外面加一层。
第二类:不是Transformer独有,但被它放大的成本/速度平衡问题。死穴二(离散推理)、死穴三(停止与规划)、死穴五(灾难性遗忘),本质上都是一道工程平衡题:要速度,还是要准确性?要低成本,还是要高可靠?要快速更新,还是要保住旧知识?在传统系统里,这些平衡问题都存在,但可控。在Transformer上,因为它的输出是连续概率、参数量巨大、没有显式控制环,这些平衡问题变得更加极端。解决它们,不是靠更大的模型,是靠在外面设计一套分级验证、异步检查、多级缓冲的工程系统。
第三类:源于分类处理设计的缺失。死穴四(因果伪造)最特殊。它不是算力问题,也不是速度问题,是分类处理设计的缺失。文本的先后顺序,和因果的不可逆,在Transformer里被混在同一个扁平的注意力空间里。它把“先后发生”当成“因为所以”,把“看起来像”当成“真的理解”。这不是概率引擎的错,是分类层没有把“顺序”和“因果”分开。但这里有一个最难的地方,需要说清楚。
最难的不是“分不分开”,是开放世界里“因果”本身没有先验标签。体育比赛里,计时器和计分器是两个独立字段,绝不能混。前者记录“什么时候发生”,后者记录“谁赢了”。AI缺的就是这个显式的、外挂的分类层。这句话要记住。它是五项原则的共同死穴——外挂的东西本身也可能被概率游戏同化。所有外挂工程系统的终极瓶颈,都回到这个问题。而这个风险,在今天的市面上,已经大量存在。
外壳陷阱。现在很多RAG、Agent方案,看起来做了外部系统,加了检索、加了工具调用、加了验证模块。但仔细看,那些“验证模块”本身也是调用大模型。检索回来的内容怎么判定相关?工具调用的结果怎么判断对错?还是让另一个大模型去看一眼,说“看起来对”。这不是外挂独立系统,这是换了一层壳的概率游戏。真正的外挂,必须有一个不依赖大模型的判断标准。而这个标准从哪儿来——这就是锚点问题。而这个“外挂也可能被同化”的风险,会在第五部分展开。
第三部分 锚点——没有真值标尺
这六个死穴,各自看是工程难题。合起来看,指向同一个根因:大模型没有真值标尺。自检、自我纠错、自我对齐,这套AGI叙事里最诱人的承诺,本质上是同一个概率游戏。
- 自检,是处理轴上的又一次概率采样。它问的是“下一个token听起来对不对”,不是“我当前的推理前提是否还成立”。
- 自我纠错,需要真值标尺。概率模型只能纠“统计上不合理”的错,纠不了“前提已过期”的错。
- 自我对齐,需要外部标准。如果标准本身也是概率模型训出来的,那对齐的只是内部一致性,不是外部真值。
AGI叙事里最诱人的那部分——自我改进、自我校正、自我对齐——恰恰是验证轴缺失最严重的表现。不止如此。第三篇提到的幻觉、奖励欺骗、OOD置信度不降、没有自我模型——这些看起来各不相同的问题,追溯到根上,都是同一个东西:没有真值标尺。幻觉,是因为它没有标尺来检查自己说的话是不是真的。奖励欺骗,是因为它没有标尺来分辨“拿到高分”和“做对事情”。OOD置信度不降,是因为它没有标尺来识别“我已经进入了一个我没见过的区域”。没有自我模型,是因为它没有标尺来回答“我现在站在哪里”。但要清楚:锚点缺失是共同根因之一,不是唯一根因。不能说所有问题都是因为没有锚点。有些问题有独立的结构性原因。锚点缺失是其中最根本、最普遍的那一个,但不是全部的答案。把概率游戏玩到极致,不会长出真值标尺。幻觉的根源就在这里。
这就是第四篇真正的中心词——不是“六个死穴”,是“真值标尺”。六个死穴是入口,真值标尺才是核心。
第四部分 外挂工程系统——五项原则
真值标尺缺失,具体表现在五个维度上:分类、状态、验证、更新、存储。下面五项原则,分别对应这五个维度。展开程度不一。有的我想得比较清楚,有的我还没想清楚。这不是隐藏短板,是老实说:方向知道,方案不知道。这五项原则,其实构成一个闭环:识别 → 记录 → 验证 → 作废 → 重建。
第一,外挂分类层。它解决的是识别。任务:把“顺序”和“因果”分开,把“模式”和“真值”分开。输入不再是扁平token流,而是带结构标签的输入。为什么必须外挂:分类标准不能被生成目标改写。如果分类器本身也参与梯度优化,它就会学会按“听起来合理”来分类,而不是按“事实上属于哪一类”来分类。最难的地方:开放世界的分类体系,不是事先定死的。分类体系本身可能需要生长,而生长就需要验证——这就又回到了锚点问题。
第二,外挂状态账本。它解决的是记录。任务:每一轮生成的状态,先在外部账本登记。记录来源、依赖关系、有效期。没有经过账本确认的token,不进入下一轮。为什么必须外挂:权重是不可审计的沉积岩,账本必须可审计。如果账本也在模型内部,那它同样会被梯度污染。最难的地方:账本本身也会被污染。如果模型学会生成“看起来像可指认依据”的假记录,账本如何识别?账本的可信度,依赖于一个独立于模型的写入权限。
第三,外挂硬卡口。它解决的是验证。任务:在分流后、合成前,插一个不接梯度、不接奖励信号的检查桩。它只问一句话:这一步有没有可指认依据?为什么必须外挂:这个卡口一旦进入奖励图,就会被优化绕过。RLHF不是装了验证轴,是把验证轴也做成了一层可微的存储轴。最难的地方:怎么判断“有没有可指认依据”?这个判断本身就是一个语义问题,需要一个独立于模型的裁判。而这个裁判从哪儿来?
第四,外挂换纸机制。它解决的是作废。任务:当账本显示某个前提已过期,或者硬卡口被触发,外部系统有权强制切换状态、作废旧图纸、重新推演。为什么必须外挂:换纸权不能留在系统内部。第二篇说“否决权不能留在系统内部”,第三篇说“验证轴必须独立”。换纸权是验证轴的最后一步,必须由外部持有。外部工程系统不需要掌握“绝对真理”,它只需要锚定几根核心的承重墙。一旦系统运行碰触到这些不可逾越的证伪边界,硬卡口就会触发,强制清空当前上下文的逻辑推演,完成换纸。最难的地方:谁来持有这个权力?第二篇问过同样的问题,答案是:不能是技术判断,必须是方向判断。那谁有资格做方向判断?
第五,显式与隐式的混合架构。它解决的是重建。任务:把需要精确记忆、频繁更新、严格作废的知识,放进显式的数据库/账本里。把需要泛化、模式识别、生成的能力,交给隐式的神经网络。账本精确作废,模型专注生成。为什么必须外挂:纯参数化存储,天然存在新旧知识干扰问题。只有显式存储,才能精确作废;只有隐式模型,才能泛化生成。两者必须分工。最难的地方:显式与隐式之间的接口,不只是技术问题,是信任边界问题。模型什么时候该“放手让账本接管”?账本什么时候该“把控制权还给模型”?这个切换本身需要判断——而判断又回到了那个老问题:谁持有验证权?
五项原则,方向是清楚的。方案,还没有标准答案。而这五项最难的地方,最终都指向同一个问题:验证权归谁。
也要说清楚一件事:这五项原则,不是通向理解的路径。它们是工程手段,用来缓解概率引擎的技术症状。它们可以降低幻觉、减少状态漂移、改善因果判断。但它们不能补上那个根本的缺口——概率游戏走不到理解这道墙。工程手段是打补丁,不是换地基。但这五项原则本身,也必须回答一个更底层的问题——它们的信任根在哪里?
第五部分:外挂系统本身,也需要锚点
外挂工程系统,本身也需要验证。分类层从哪里获得分类标准?状态账本如何保证自己不被污染?硬卡口如何保证自己不被绕过?换纸权的持有者,如何保证自己不被收买?如果这些问题的答案是:“再外挂一层系统来验证它”,那就等于说:验证权在外挂层的外挂层。外挂一层,不够。外挂两层,可能还不够。一直外挂下去,最终还是得回答一个问题——这个链条的尽头,锚在哪里?外挂工程系统不是终点。任何工程系统都必须回答:它的真值锚点是什么?锚点不是一个抽象概念。它可以是几种不同的东西:
- 物理事实锚点:传感器读数、时间戳、硬件安全模块。
- 制度锚点:法律、审计、多方签名、人类委员会。
- 密码学锚点:不可篡改日志、承诺方案。
- 共识锚点:多源交叉验证。
但说到底,没有绝对锚点。不存在一个不可质疑的、永恒可靠的“真值源头”。现实世界里,所有锚点都可能出错、被污染、被收买。我们真正需要的,不是“绝对锚点”,而是“对当前AI系统不可单方面改写”的信任根。它的可靠性不来自绝对真理,来自它不在AI系统的控制范围内。只要它不被AI单方面改写,它就足以构成一个可用的验证基础。如果锚点仍然来自概率模型,那么只是把概率游戏移到了系统外面。所以,真正的问题不是“Transformer换不换”。真正的问题是:AI系统最终把“不可被自身改写的事实”放在哪里?这个东西,无论它是上面哪一种,必须满足一个条件:它不能被AI系统自己改写。否则,它就不是锚点,它只是另一层外壳。
【下一步问题清单】
这套工程系统要建起来,有五个问题必须先回答:
第一,开放世界的分类标准如何生长?如果分类体系本身不是事先定死的,它怎么长?长出来的新类别,谁确认它有效?
第二,状态账本的写入权如何独立?账本不能被模型污染,那谁有写入权?这个写入权如何被监督?
第三,硬卡口如何防止被奖励优化绕过?卡口一旦能被优化,就会被绕过。怎么保证它真的“不接梯度、不接奖励”?
第四,换纸权归谁?谁拥有“承认这条路走不通、必须换纸”的权力?这个权力不能是技术判断,必须是方向判断。那谁有资格做方向判断?
第五,显隐接口的信任边界如何设计?模型什么时候该放手让账本接管?账本什么时候该把控制权还给模型?这个切换的标准从哪来?
这五个问题,我还没有答案。但我知道一件事:如果这五个问题没有一个被认真回答,外面那套工程系统就建不起来。而建不起来的后果,不是AI变笨——是它继续以“我不知道自己正依据哪张过期图纸在跑”为默认状态,跑得越来越快。如果我知道所有的边界在哪儿,我就不写文章了——直接去当OpenAI的CTO了。
【结语】
六个死穴,一个锚点。锚点是:大模型没有真值标尺,所以“自检、自纠、自对齐”这套AGI承诺,不是解决方案,是同一个问题的另一种说法。六个死穴不是Transformer的错。它们是概率引擎的共同难题,Transformer的架构让它们更复杂、更难解。真正的出路不在换架构,不在等下一个Transformer,而在外面建一套工程系统:分类层、状态账本、硬卡口、换纸机制、显隐混合架构。这套系统还没建起来。这就是AI今天真正的缺口。但必须说清楚:这六个死穴不是Transformer的错,不代表“走不到理解”这个判断也要收回。第一篇讲的是架构能不能跨过理解这道墙——那是一个更根本的判断,涉及的是概率游戏本身的边界,不是工程能补上的。这一篇讲的是六个具体技术症状能不能被工程手段缓解——那是另一个层级的问题,是概率引擎之上可以打补丁的地方。两者不在一个层次上,不冲突,也不能互相替代。外挂工程系统做得再好,也只是让概率引擎少犯工程错误。它不会让概率引擎长出理解。
【附记:关于这把量尺的边界】
写到这里,必须说清楚几件事。第一,我没有内部资料。这篇文章里对AI系统的所有分析,基于的都是公开信息。我能做的,是用三十多年写交易系统的经验,从一个系统架构师的角度,去推演另一套系统可能的结构性问题。我看不到它们的代码,但我能看到它们面临的问题类型。第二,六个死穴都不是Transformer独有的。它们是概率引擎的共同难题。Transformer的架构让它们变得更复杂、更难解,但根源不在Transformer本身。换一个架构,这些问题可能减轻,但不会消失。因为根源在“用高维概率生成为核心智能引擎”这个范式的共同特征里。第三,这六个死穴和“走不到理解”是两个层级的问题。六个死穴是工程层面的技术症状。走不到理解是架构层面的边界判断。工程手段可以缓解症状,但不能跨越边界。两者不能混为一谈。第四,真正的出路是工程,不是架构革命。对于这六个具体死穴,不是等下一个Transformer,而是在现有概率引擎外面,建一套分类、验证、状态管理、显隐混合的工程系统。这套系统还没建起来,这就是缺口。第五,这套工程系统目前没有标准答案。分类的锚点在哪、状态账本如何不被污染、硬卡口如何防止被绕过、显隐如何高效协同——这些都是未解难题,属于工程平衡问题,需要时间、实践和反复试错才能找到答案。如果哪天我找到了答案,你们会在新闻上看到我的新职位。
【附录:核心概念速查】
- Transformer:概率引擎,预测下一个token。
- 处理轴:token预测,模仿当下判断,但没有赌注。
- 存储轴:压缩,模仿状态,但没有账本。
- 验证轴:判断前提是否还成立,Transformer没有。
- 图纸:预先画好的路径预判。
- 证伪边界:一条线,触发后要重新核实。
- 承重墙:硬边界,击穿后换纸。
- 换纸:旧图纸作废,画新图。
- 锚点:不可被AI自己改写的信任根。
- 真值标尺:从锚点长出来的验证标准。
- 验证权:谁有权判定、否决、作废。
- 外壳陷阱:外挂系统仍然依赖大模型,等于换壳。
- 伪验证轴:验证轴被做成可微的存储轴,穿裁判服的选手。
提前规划好对AI技术本质的理解,能帮助我们在工程上走得更稳。

