

你最近有没有那种感觉——AI越来越聪明了,但你越来越看不懂它了?没错,就在全网蹲守GPT-6发布时间的时候,一个重磅消息直接把科技圈炸翻了:OpenAI下一代模型Astra用了一种叫「循环深度」的全新推理方法,思考用的Token少了一大截,性能却直线拉爆!这也太反直觉了吧?别急,咱们慢慢拆。
说真的,一开始听到「循环Transformer」这名字,我也是一脸懵。但把这事讲明白了,你可能会惊呼:卧槽,原来还能这么玩!
先把时间拨回从前。传统的Transformer模型,就像一栋只能走一遍的高楼。数据从第一层吭哧吭哧爬到最后一层,做固定次数的运算,然后吐出一个Token。你想让它推理得更深?那就只能把楼盖更高、参数堆更大。代价呢?极其高昂的算力和显存开销啊朋友们!每一层都是在烧钱。
「循环Transformer」换了个极其暴力的思路——既然盖楼太贵,那就让它转起来!啥意思?信息不再是从网络里单向穿过一次,而是把同一组Transformer层反复循环使用。第一圈算出来的隐藏状态,直接送回起点继续加工,转上好几轮,最后才吐出结果。它就像一段盘旋向上的楼梯——还是那几级台阶,但只要多绕几圈,照样能到达顶层!
🌟 关键来了:这条路,学界早就走通了!
谷歌2025年发了一篇论文,结果特别直白:一个只有k层、循环L次的Transformer,在不少推理任务上,可以接近拥有k×L层的普通模型。参数量没变大,有效计算深度却被拉长了。还有个更逆天的案例。今年2月一篇论文里,研究人员拿一个只有35亿参数的小模型,让中间核心块反复循环跑。结果怎么着?转的圈数足够多的时候,这个小身板直接打出了500亿参数大模型的成绩!
⚠️ 这等于啥?相当于给算力开了一个「超频开关」——不加参数、不占额外显存,光靠原来的权重多跑几圈,能力就越级狂飙!
难怪刚被Anthropic在营收上反超、急需断层式突破的OpenAI,看到这技术就走不动道了。
技术是好技术,但这里藏着一个天大的隐忧——Astra的思考过程,完全「隐身」了!
过去的推理模型,想得再深,也必须从「输出下一个Token」这个狭窄的漏斗里挤出来。正是这一挤,把抽象的计算逼成了人类能读懂的文字。这也是过去两年,人类唯一能「看透」AI脑子里在想什么的最大底气。
「循环深度」直接把这个漏斗拓宽了。固定层数的模型,每吐一个Token前能做的串行推理是有限的。但现在,模型在中间的循环块里转了r圈,每个Token背后就塞进了r倍的串行计算。原本必须挤在字面上的长链条推理,现在能在向量世界里默默转完——全程不吐一个字!更麻烦的是,它在潜空间里「想」的,未必是人话。
Meta早前在「连续思维链」(Coconut)研究里就说了:模型用数字、用向量去推理,可能比被逼着用人类语言更准、更省!
💡 这逻辑其实很简单——大模型理解概念的方式,本来就是数学向量,你非强迫它每一步都翻译成人话,反而白白损失信息。
这技术的杀伤力在于,能让小体积模型发挥超大模型实力,成本骤降,省内存、省带宽。只是,在省下算力成本的同时,也彻底关上了人类的视线。
对数学和编程来说,「循环Transformer」的吸引力大得惊人。
很多真实任务本来就得靠「多次迭代」:先提方案,再查错误,更新中间状态,继续求解。而「循环Transformer」简直是为这类算法量身定做的!
过去想让模型多想一会儿,就得让它生成更多思维链Token。现在?一部分计算可以在输出Token之前就悄悄完成。模型表面上可能只停顿片刻,内部状态却已经迭代了很多轮。
Astra的实力,大家也是有目共睹——虽还没正式发布,但一些demo已经验证了它在前端领域的统治力。奥特曼自己也承认,在计算机使用方面,Astra水平直接媲美人类!不仅如此,基于这套新架构,Astra还打通了「持续性智能体」——只要你不喊停,它能连轴转好几周!
今天,全网都在屏息等待。OpenAI的多位研究员,包括大家熟悉的那些面孔,都在疯狂暗示这个强大的Astra。掐指一算,GPT-6,可能真的要来了。
技术越强大,我们就越需要保持清醒。当AI的思考开始「隐身」,人类睁大眼睛也看不见的时候,信任和监管就成了最难的课题。
你能接受一个“想什么你不知道”的AI吗?欢迎在评论区聊聊你的看法!如果这篇文章让你对AI又有了新认知,记得点个「在看」,转发给同样在蹲GPT-6的朋友!