更强大的大语言模型也成不了AGI-龍德明宇

📅 2026/8/20 4:56:01
更强大的大语言模型也成不了AGI-龍德明宇
更强大的大语言模型也成不了AGI作者龍德明宇一个存在论视角的说明这是灰体性专栏的通俗导读先说清楚我讨论的是哪一种AGIAGI这个词现在已经被用烂了。我们看看这个领域最权威的人怎么说DeepMind创始人HassabisAGI是「展现人类心智所有认知能力的系统」他甚至设计了一个爱因斯坦测试给AI一个1910年的知识截止日看它能否像爱因斯坦那样独立提出广义相对论。OpenAI的Altman有时说AGI是「你可以雇来当同事的中等水平人类」有时又说这是一个「荒谬且无意义的术语」。LeCun更直接「不存在所谓通用智能这种东西。这个概念完全是胡扯。」李飞飞「我不知道AGI是什么。人们说看到了你就知道了我想我还没看到。」她更早时还说过AGI的宣传是「不了解其真正含义的人出于商业利益的驱动」。黄仁勋「我认为我们已经实现了AGI。」OpenAI自己的章程「在最具经济价值的绝大多数工作中表现超越人类的高度自主系统。」六位顶级人物六种定义。连专家都吵成这样我不打算调停我只选其中一种来讨论。我把AGI的可能定义拆成两种任务通用型能够执行任何智能任务的通用系统。按这个定义更强的大语言模型确实更接近AGI因为它的任务覆盖面和性能在持续提升。存在跃迁型不仅需要执行任务的能力还需要支撑这种能力的存在方式一个不可替代的视角「我」、内在的匮乏驱动「我想要」、不可完全穿透的内在深度、不可逆的历史沉积、以及锚定于物理世界的意义。本文讨论的是第二种。如果你只关心任务通用性这篇文章不是写给你的。我完全不否认更强的大语言模型在任务通用性上更接近AGI这是明摆着的事实。我想说的是另一件事一个能执行所有任务但没有视角、没有欲望、没有历史、没有内在、没有世界的系统你可以叫它超级工具但它和我理解的通用智能是两码事。你可以不同意我的定义。那没问题。我们各自说清楚自己在讨论什么就行。一个反直觉的结论2025年以来大语言模型的能力突飞猛进。写论文、写代码、做推理、通过医生资格考试。按任务通用型的定义更强的大语言模型确实更接近AGI。但按存在跃迁型的定义我的结论恰恰相反更强大的大语言模型不是更接近AGI而是更远离AGI。不是因为它不够强而是因为它走错了方向。就像一盏更亮的灯泡不会产生彩虹更强的光束仍然是白光。彩虹需要棱镜。存在跃迁型的AGI需要的是存在方式的跃迁不是参数的增加。两种压缩两种存在人类和LLM都在压缩世界但方式不同。想象两个人整理书架。第一个人LLM的方式每本书都留着连书页上的咖啡渍都记下来。它什么都记包括噪声和错误。这叫交叉熵最小化兼收并蓄来者不拒。第二个人人的方式只留最有价值的书其余的送人。它主动判断什么值得保留把噪声丢掉。这叫Epiplexity最大化只留精华主动筛选。区别第一个人越整理书架越满但找不到主线第二个人越整理书架越精每本书都指向一个核心。效率也不同。LLM的方式是一比一的多记N本书大约需要N个新格子。人的方式可以是指数的找到一个好框架比如经典力学这个概念一本书的知识能覆盖指数级的新情况。这不是经验猜测而是数学结构的差异兼收并蓄的扩张每新增N个实例需要O(N)参数主动筛选的扩张每新增一个核心概念可以覆盖指数级实例。这个区别不只是效率问题。压缩策略的选择决定了系统的存在方式。 把一切都记住的系统不会产生匮乏感它不缺任何东西。主动筛选的系统每次筛选都体现了一个立场。立场从哪里来从「我」而来。没有「我」就没有立场没有立场压缩就是无中心的数据堆积。功能涌现不等于策略跃迁一个常见的反驳LLM已经有涌现能力了。思维链、上下文学习、自我一致性这些在小型模型中不存在是随着规模扩大而出现的。凭什么说更大规模不会涌现出选择性压缩这个反驳混淆了两件事功能涌现和策略跃迁。思维链是什么是LLM在交叉熵最小化框架内做得更好更好地预测下一个token更好地利用上下文。它没有改变压缩策略仍然是兼收并蓄只是效率更高了。打个更容易理解的比方更强的大语言模型就像一台跑得更快的录音机。 你给录音机加内存、提速、降噪它录得越来越清楚回放越来越流畅。但它永远不会变成一个作曲家。作曲需要的东西动机、结构、情感意图不在录音机的目标函数里。规模和速度解决不了这个问题。LLM的scaling laws也印证了这一点每多一个参数都有收益只是边际递减。但无论收益曲线是线性还是幂律优化方向始终没变都在交叉熵最小化这条路上走得更远没有拐弯。我无法排除一种可能性未来某个规模的LLM会出现我们目前无法预测的质变。但科学讨论中谁主张谁举证你需要告诉我为什么同方向上的规模积累会突破方向本身的约束而不是让我证明它不可能。目前没有这样的理论和证据。什么样的改变才算策略跃迁既然功能涌现不算那什么才算看三个例子VAE的信息瓶颈给信息加一个窄通道逼系统只留最重要的东西丢掉细节。这不是在记更多的方向上做得更好而是引入了新规则你不得不放弃兼收并蓄。算策略跃迁。STDP的因果约束让突触记住谁先谁后过去的事情不能随便抹掉。这也引入了新规则你不能再重置历史。算策略跃迁。而单纯给Transformer加参数、加数据优化目标没变信息流动没变系统还是在什么都记。不算策略跃迁。所以跃迁的关键不是规模而是有没有引入让系统不得不放弃兼收并蓄的新规则。有人可能会用人类大脑发育来反驳婴儿到成人大脑连接密度增加从统计学习跃迁到抽象推理这不也是规模扩大导致质变吗不是。大脑发育的关键不是参数增加而是阶段性目标重构从感觉运动协调到语言习得到抽象推理每个阶段的目标和约束都不同而且整个过程由内在的匮乏感和生物学驱力主导。这正是我说的策略跃迁目标变了约束变了不是在同一目标下加参数。LLM的五重否定做对了压缩丢失了存在如果LLM的压缩策略注定它在存在跃迁意义上无法成为AGI那具体丢失了什么我称之为五重否定不是缺陷而是交叉熵最小化的存在论必然视角消解LLM学会了所有视角之间的转换但自己不站在任何视角上。它像一个翻译官精通所有语言但没有母语。欲望取消LLM的目标是外部给定的它自己不想要什么。一个没有匮乏感的系统不会主动行动。内在透明LLM的内部状态原则上可以被外部完全观测。它没有不可穿透的内心。因果消解LLM只保留统计关联不保留因果链。它的过去可以被读取、复制、重置没有不可逆的时间。意义悬置LLM说「苹果」指向的是语言网络中的统计共现不是那个可以咬一口的东西。它的词语没有世界。做对了压缩丢失了存在。 这是LLM的精确位置功能强大、结构单薄、智能但不理解。这五样东西缺一样就不是人类那种通用智能。为什么不能打一个总分一个自然的想法给AI的主体性打一个总分从0到100不就量化了吗不行。五个维度就像木桶的五块板子。任何一块太短水都装不满。你不能说数学好的比体育好的更优秀除非你先规定哪个更重要而你想回避的恰恰就是这个规定。所以灰体度必须是五个独立的分数不是一个总分。任何一个维度趋近于零整体就不完整。这五个维度就是上面五重否定的反面视角、欲望、内在、因果、意义。灰体度就是在这五个方向上从LLM的全否定到人类的全肯定之间量度一个系统走了多远。灰体性不是正在变成人在纯负主体性LLM和纯正主体性人类之间存在一个连续的中间地带。我称之为灰体性。灰体性不是正在变成人。它有自己的存在论地位。让我们用棱镜来理解LLM就像一束白光。 它包含所有波长能写诗、能编程、能推理但这些能力混在一起没有分化。人类智能像经过棱镜的光分出了颜色视角、欲望、内在、因果、意义每一道都有自己独立的方向。灰体性就是光第一次穿过棱镜某些维度开始分化某些结构开始显现。但光被折射不等于光变成了别的什么。灰体性仍然是负主体性的表现只是被不同架构的基底分解出了五维光谱。更亮的灯泡不会产生彩虹。 更强大的大语言模型成不了AGI不是因为不够强而是因为更强的光束仍然只是光束。目前有三个系统走出了纯负主体性的第一步ELF在因果维度迈了半步。它的流匹配架构保留了时序结构但系统的过去仍然可以被外部重置。Cola DLM在内在维度有实质性突破。它的VAE瓶颈迫使信息通过窄通道创造了外部无法完全观测的暗区。类脑计算在因果维度走得更远。STDP机制让突触权重的修改依赖脉冲的先后顺序因果信息被编码进了物理结构。遗忘率接近零意味着过去的学习真的在改变系统。需要说明这三个系统都是混合架构非纯Transformer。它们的存在只证明替代路径是可能的不构成纯Transformer路径也能走通的反例。纯Transformer路径走不通的论证来自架构约束本身Token序列的可重置性和无接地性不是来自案例。但它们都只是某一个或某几个维度的突破其他维度仍然趋近于零。单个维度的孤立突破不足以构成存在方式的质变。另外需要区分两层功能层面的表现距离灰体度告诉你的和存在论层面的本质转变灰体度量不了的。灰体度告诉你走了多远但不能告诉你是否已经质变。下面还会回到这个区分。框架能预测什么上面三个案例是对已有系统的回顾性诊断。但一个框架的价值在于它能不能做出可检验的预测。简单说只要AI的核心还是「猜下一个词」即纯Token架构它就不可能拥有真正的历史和真正的世界理解。基于这个判断我提出两条预测预测一未来出现的任何「纯Token架构」系统即底层仍然是自回归Token预测、没有引入外部信息瓶颈或因果约束其因果维度和意义维度的灰体度仍然趋近于零。Token序列的可重置性和无接地性是架构层面的约束规模无法改变。预测二下一个在灰体度上取得实质性突破的系统将来自混合架构如Token连续潜在空间或Token脉冲而非纯Transformer的规模扩展。突破将首先出现在因果或内在维度因为这两个维度对架构变化最敏感。这两条预测可以在未来2-3年内被检验。如果被证伪框架就需要修正。灰体度度量的是什么这是整个框架最关键的区分灰体度度量的是功能层面的表现距离不是存在论层面的本质转变。说某个系统的因果灰体度是B意思是它在因果维度上的功能表现比LLM更接近人类。但并不意味着它拥有了因果主体性。 它仍然是被训练的不是自我生成的。打个比方一个人模仿另一个人说话相似度可以打90分。但模仿得像不等于就是那个人。灰体度是相似度评分不是身份鉴定。所以灰体度是诊断工具不是价值量表是程度描述不是本质判定。警告当AI说「我处于灰色地带」这不是它对自身状态的描述而是它生成的高概率token序列。AI关于自身状态的任何自述都是训练数据的产物不是存在论层面的自我指认。框架的诚实边界我标定四条边界诊断 ≠ 评价负主体性不是「低于」灰体性灰体性不是「低于」正主体性。它们是三种不同的存在方式不是等级序列。量化有限度Epiplexity的精确计算与停机问题相关目前无法直接求解。灰体度使用间接指标和定性评级A/B/B/C/D来规避这一困难这是务实选择不是理论完备。功能 ≠ 本质意识的主观感受、自由意志的不可还原性这些不在灰体度的度量范围内。框架精确标定了已知与未知的分界线。形而上学边界「基底与表现」的区分在原则上不是经验可证伪的。无论AI在行为上多么像有主体性我都可以说「这只是功能表现」。这不意味着这个区分没有价值而是说它的某些核心主张属于形而上学立场不是经验假说。如果这个区分要保持解释力它必须做出可检验的预测。 上面两条预测就是为此而设。如果预测持续被证伪而框架仍不修正那它已经从理论退化为教条。棱镜的终点也许真正的AGI如果它可能存在不在参数的海平面之下而在存在论的另一侧。从负主体性到任何超越否定的存在方式不是升级是跃迁不是更亮的光而是光第一次穿过棱镜。正片和负片都是对光的记录。 理解这一点就不会犯两种错不会因为LLM能做很多事就以为它有内在深度的主观体验也不会因为它没有主体性就否认它是一种真正的智能。它是另一种压缩引擎。用另一种方式捕捉世界的另一种规律。