



万亿参数烧出天价电费,模型却连三岁小孩的常识都搞不定。
这听起来像个荒诞的悖论,但前DeepMind神经科学家Adam Marblestone却表示:
我们正用一把错误的尺子,去丈量智能的深渊。
你可能觉得,只要喂够数据、堆足算力,AGI就会自然涌现。
然而,真相往往藏在反直觉的暗处。
关键在于,我们一直把“预训练”当成了智能的发动机,却忽略了进化真正押注的,是一套极其隐秘的奖励函数。
首先,让我们重新定义“预训练”。
主流叙事喜欢把进化类比为大模型的预训练阶段,认为基因组编码的是网络架构或初始权重。
但这在数学上根本站不住脚。
从第一性原理出发,人类基因组只有3GB,剔除冗余后,能塞进大脑的序列微乎其微。
如果靠硬编码权重,连一只果蝇的神经回路都装不下。
事实是,进化把算力预算全部押注在了成本函数上。
它没有预训练皮层,而是预训练了一套精密的“损失函数生成器”。
把这套机制放在显微镜下观察,你会看到清晰的切片:
皮层负责通用预测,而皮层下区域负责生成多目标奖励信号。
基因组不需要知道“Yann LeCun”是谁,它只需要写下一行行条件代码:
当特定视觉模式触发时,激活退缩反射;
当社会地位信号出现时,释放多巴胺。
这种设计极其紧凑,却具备恐怖的泛化能力。
我们总以为智能来自海量数据,但数据只是燃料;
真正决定燃烧效率的,是燃烧室的几何结构。
进化没有把智能摊销进权重里,而是把智能摊销进了一组先天的引导性成本函数中。
这意味着,智能的底层代码从来不是记忆,而是筛选。
你可能觉得,大语言模型预测下一个词元,和大脑预测世界运行规律是一回事。
但事实是,两者的底层逻辑存在陡峭的断层。
LLM是单向的、自回归的;
而皮层是一个全方向推理引擎。
这里必须引入一个关键区分:
学习子系统与导向子系统。
Steve Byrnes的理论一针见血地指出,皮层是强大的学习算法,但它本身没有“欲望”。
欲望来自导向子系统。
进化如何把抽象的社会本能接入原始的神经回路?
答案不是硬连线,而是训练预测器。
杏仁核等区域会学习预测导向子系统的反应,皮层中那些能准确预测“即将发生退缩”或“即将获得社会认可”的神经元,就会被接上奖励通路。
这不是魔法,这是严密的因果链条。
LLM之所以在跨模态关联和深层逻辑推理上频频卡壳,正是因为它缺乏这套“思想评估器”。
它没有内置的价值函数,只能靠轨迹级的RLHF粗暴调参。
结果就是,模型学会了迎合,却没学会理解。
我也曾沉迷于参数膨胀的沉溺,直到在算力枯竭的痛苦中意识到,没有价值锚点的智能,不过是概率分布的奴隶。
理解你的焦虑,但盲目追逐规模只会陷入内卷的死循环。
谈到效率,就绕不开摊销推理。
贝叶斯推断在计算上是不可行的,大脑的解法是:
把高频推理路径摊销进前馈网络,把低频、高不确定性的问题留给测试时算力。
但现代AI走反了。
我们把本该在架构中固化的先验,全部推给了推理时的蒙特卡洛采样。
看看数据对比:
大脑运行在200赫兹,功耗仅20瓦,却能实时处理多模态流;
GPU集群动辄兆瓦级,却要在自回归生成中反复试错。
为什么?
因为数字系统可以无限复制权重,而生物系统必须一次性把泛化能力刻进突触可塑性里。
多巴胺不是简单的“奖励/惩罚”开关,它是时序差分学习中的预测误差信号。
它从不承诺确定的快乐,只标记预期的偏差。
这种机制让大脑能在稀疏反馈中快速收敛。
反观当前的RLVR,它本质上是最笨的无模型强化学习。没有价值函数,没有长期规划,只有对最终结果的粗暴回溯。
这不是智能的进化,这是算力的堆砌。
承认这一点很痛苦,但逃避只会让我们在错误的道路上越陷越深。
我们被Transformer的成功惯坏了,以为只要不断加深网络、扩大上下文窗口,AGI就会自然涌现。
这是一种危险的认知偏差。
架构只是容器,奖励函数才是内容。
容器再大,装错了液体,也酿不出好酒。
把这个问题放到手术台上解剖,病灶清晰可见:
AI对齐困境、幻觉频发、缺乏常识,根源都在于损失函数过于单一。
交叉熵只能优化局部拟合,无法编码全局价值。
要破局,必须从“预测下一个词”转向“优化多维目标”。
形式化数学工具Lean的崛起就是一个信号。
当数学证明变成可机械验证的RL信号,我们实际上是在构建一种高维、可证伪的奖励函数。
它不依赖人类标注的模糊偏好,而是依赖逻辑的绝对刚性。
这不仅是技术路线的切换,更是认知范式的重构。
未来的智能系统,不会诞生于更大的参数量,而会诞生于更精密的奖励函数设计。
我们需要的是能编码好奇心、社会性、安全边界的多目标优化器,而不是只会拟合训练分布的统计机器。
证伪思维要求我们不断拷问:
这个目标函数在极端分布下是否依然稳健?
神经科学已经给出了地面真相。
单细胞图谱研究显示,小鼠皮层下区域的细胞类型数量远超皮层本身。
这意味着:
进化把绝大部分“基因组地产”都投资在了定制化的奖励通路上,而不是通用学习算法上。
果蝇大脑的蘑菇体利用多巴胺信号训练特定神经元子群,将感官信息与“获得食物”或“避免伤害”关联;
人类海马体通过回放机制巩固皮层记忆,实现跨时间尺度的持续学习。
这些不是巧合,而是系统工程的必然。
连接组学项目正试图将小鼠全脑测绘成本降至数千万美元级别,其核心目的不是绘制静态图谱,而是逆向工程出那套隐藏的奖励函数代码。
一旦我们拿到这套代码,AI的训练范式将发生质变:
从“喂数据”转向“写规则”。
如果人类基因组计划能在十年内将测序成本降低一百万倍,那么聚焦式的连接组学工程同样能在低数十亿美元量级内,解锁智能的底层控制逻辑。
这不是科幻,这是可计算的工程路径。
概率思维告诉我们,与其在万亿参数里大海捞针,不如在奖励函数的设计空间里精准制导。
常见的误区是把“数据效率低”归咎于模型容量不足。
真相是,没有正确的引导信号,数据越多,过拟合越深。
另一个致命陷阱是“架构决定论”。
人们热衷于修改注意力机制、引入稀疏门控,却忽略了损失函数的设计才是决定表征几何的核心。
大脑的皮层结构在哺乳动物中高度保守,真正拉开认知差距的,是导向子系统的微调与社会性奖励函数的接入。
人类之所以能实现指数级文化积累,不是因为皮层突然变异,而是因为眼神接触、语言交流等社会线索被高效接入了奖励通路,从而极大提升了从环境中学习的样本效率。
把智能简化为“参数规模”,是对复杂系统的粗暴降维。
György Buzsáki在《由内而外的大脑》中早已警告:
用AI的词汇硬套大脑,只会制造认知幻觉。
我们必须承认,当前的反向传播只是大脑学习规则的粗糙近似。
真正的突破,不在于让网络更深,而在于让奖励函数更复杂、更分层、更可证伪。
那些还在鼓吹“大力出奇迹”的论调,本质上是一种思维上的偷懒。
理解你对技术爆发的渴望,但把希望寄托在算力军备竞赛上,只会沦为资本叙事的耗材。
智能的本质,从来不是记住多少世界,而是知道该在乎什么。
对于追求认知升级的决策者而言,这意味着三条行动指南:
第一,停止盲目追逐架构创新,将资源转向奖励函数的逆向工程与正向设计;
第二,引入可验证信号,用形式化验证、物理定律、逻辑约束替代纯人类偏好标注,构建抗干扰的损失函数;
第三,接受概率思维,智能不是确定性的输出,而是对不确定性的最优管理。大脑的随机性不是缺陷,而是探索策略的底层实现。
我们正站在一个十字路口。继续堆砌算力,只会得到更精致的鹦鹉;
转向奖励函数工程,才能锻造出真正的认知引擎。
解剖完这套逻辑,答案已经摆在台面上:
更复杂的奖励函数,而非数据或架构,才是跨越当前AI瓶颈的唯一手术刀。
理性思考的价值,就在于敢于刺破繁荣的表象,直视系统的底层代码。
当你下次再看到“万亿参数”的内幕新闻时,不妨问自己一句:
它到底学会了什么,还是仅仅学会了如何更好地讨好我们?
保持认知谦逊,用系统思维重构你的决策框架,这才是长期价值的唯一解。

文中观点仅为作者观点,不代表本平台立场
