GPT 5 推出之后大家照例让它算 10.9 和 10.11 的差。它照例失败了,成了新一轮笑柄。倒是真的实现了传说中的 Ph.D level,因为博士生一般来说算术都不好。

当然这不是它一家的问题,别家 AI 也在这个简单的题目上纷纷翻车,包括我很喜欢用的 Gemini Pro 2.5。但 Gemini 翻车的姿势还要更炫酷一点:作为一款思维链模型,它知道这种时候应该调用 Python 来算。但当 Python 返回了正确结果之后,它的反应居然是:「我觉得 Python 算的不对,还是我自己来心算好了。」然后算错了。

这个错误虽然好笑,但暴露的是这一整轮 agentic AI 发展的致命弱点。Agentic AI 作为一个框架要能运行,前提条件是 AI 知道什么时候该使用并依赖外部工具。当然,这里的分界是模糊的:一个小孩子如果在算三位数乘法的时候掏出计算器,你不会批评。如果这个小孩算一位数乘法也要用计算器,你会怀疑是不是智力有点问题——当然无论如何至少结果是对的,但你会心想一个高级一点的大脑是不是应该合理判断这个问题不值当用外部工具。而现在的问题是这个小孩算一位数乘法,掏出计算器算了个结果,然后觉得不对扔掉了,自己心算了一个错误的答案出来。这是人类有可能犯的错误吗?

其实也是。而且如果你细想,这恰恰是非常「人类」的错误。人类的思维之所以不可靠,就是因为我们常常把直觉凌驾于客观证据之上。不是因为我们缺乏证据,而是因为我们不信任证据(例如曼德拉效应)。对人类来说,仅仅因为看到了和自己内心信念不一致的信息就放弃旧有信念不仅是困难的,而且是痛苦的。

但我们发明 AI 本意不就是避免这个缺陷?

于是我们面临着一个尚未有定论的问题,就是以大语言模型为基座的 AI 是不是先天继承了人类的心理偏见机制。我们对 AI 的期待是它能尽量不偏不倚。当然,在社会政治文化领域这是困难的,没有人能指望 AGI 在巴以冲突问题上能做到只看事实没有立场。但在别的更数字更技术的领域呢?给 AI 一份几万字的报表,AI 能够忠实灵敏地查阅所有细节,然后在回答问题的时候精确合理地引用某个细节吗?这不仅仅是我们对 AGI 的期望,这还是要撑起它所联动的万亿市值市场的前提条件。

今天的 AI 尚不能实现这一点,是因为这里有个内在的技术困难:思维链条不是数据库,而是把数据以自然语言的形式有损压缩在中间状态。这种压缩本质上就类似于人类以印象代替现实的思考模式,也是诞生偏见和误解的根源所在。要从根源上铲除它的土壤,就是要让这种压缩在事实上变成无损的。

于是我们面临两种可能的技术前景:

要么下一代思维链条(或者思维树,思维网络,或者不管什么别的数据结构)真的能实现对数据不依赖印象的理解和综摄。这在实践上已有尝试,比如程序化中间表示(JSON-graph、逻辑项、SQL、符号代数),或者对数字、日期、单位、表格索引做硬约束解码。简而言之,找到绕过以文字为思维载体的办法,把图像、数据和表格原生嵌入 AI 思考流程。

要么我们撞上了自然语言的先天限制。AI 将和人类一样,无论再怎么用力检查、对比、参考、判断,也只是不断用一层又一层的新的印象覆盖旧的印象,新的记忆调和旧的记忆,直到自己迷失在真实和幻觉之间的缝隙里。

前者是一种达芬奇式的前景,后者是一种博尔赫斯式的前景。或者用东方哲学的话说,前者意味着更强大的语言模型能够实现「坐照」之境,而后者意味着除非在底层重写技术框架,否则我们将不可避免的撞进文字障。

目前还没有证据证明哪个前景更有可能。前者如果成真,则立足于 AGI 的人类社会工业再数字化不但可行,而且指日可待。后者如果成真,则 AGI 不过是大号的人类,会在分裂和偏见之上引入新的分裂和偏见,不知伊于胡底。

大多数人对 AGI 的期待似乎是前者,并且这种期待如此底层,以至于甚至不需要宣诸纸面而是视为理所应当。然而如果人类运气不佳(一向不佳),我们很可能正在走向后者。
 
 
Back to Top