

朋友,你最近有没有一种感觉——几乎每天睁开眼,AI圈都在放大招?
昨天还在为GPT-5.6的「突破」惊叹,今天GPT-6 Astra就横空出世,直接把各大榜单全线刷爆。连老黄都亲自站台,认证OpenAI是全球首个拿下AGI的团队。这场竞赛,到底进入到什么段位了?
别急,我花一晚上啃完了最新一批实测demo,带你看看这个「10万张GPU训出的怪兽」到底有多离谱。
就在今天,最新的3D空间推理基准MazeBench放榜了。
MazeBench是什么来头?它是两位开发者Pappas在7月底搭的一个3D世界——200多个房间,藏着100颗宝石,捡到一颗算1分,满分100。
房间里的谜题全是「推箱子」升级版:电梯砖、可开关的墙、会打滑的冰面。一个不留神掉进深渊,只能撤销、重置,或者传送回以前到过的房间。
最狠的是,这是真3D。同一面墙,从俯视看和从侧面看完全是两回事,模型得先脑补出立体结构,再规划路线。
你猜猜7月底刚发布时最强的是谁?
开着Python代码辅助的GPT-5.6 Sol拿了13%,Fable 5拿了11%,Opus 5拿了9%。不开Python?全都到不了1%!
结果Astra一来,不开代码辅助,直接拿下14%。
这是什么概念?测试团队甚至为了省Token,让GPT-6改用「批量出招」,一次往前看10到20步。原本要烧掉的30亿Token,硬生生砍到3.5亿。
热力图上看得更直观——其他模型在角落转一小圈就停了,Astra几乎把整张地图翻了个底朝天。
话说回来,Astra想真正啃下这硬骨头,路还长着呢。
它在ARC-AGI 3上已经打到99.9%,可在这3D迷宫里,最强也只捡到14颗宝石。为啥?
因为它偏科!更爱用俯视视角看关卡,一些只有3D平视才看得见的墙,直接被它当成「空气墙」穿过去了。教程关能过,可一碰到方块叠超三层的立体谜题,当场就抓瞎。
说白了,能打,但还称不上完美的3D「脑」。
刷完榜单,真正的看点来了——全网开发者已经拿着Astra解决现实问题,一个比一个惊艳。
一位叫Daniel的老哥直呼「昨天我真切感受到了什么叫AGI」!
他录了段4分钟视频,吐槽浴室地漏老被头发堵,掏起来太恶心。然后拿着数显卡尺把零件量了一圈,反手把视频甩给Astra:帮我想个招。
Astra的操作直接绝了——它对上视频里每一帧量尺寸的动作和语音描述,先是给出了一套能轻松清理毛发的设计方案,还甩出交互式草图让人确认。
确认完草图,它直接接管电脑,自己打开Fusion 360画零件,全程参数化建模。老哥就坐旁边干看,顺便偷师了几个隐藏技巧。
最后随便一句「加个倒角」,丢进3D打印机,打出来往地漏上一扣——第一次装就严丝合缝!
另一个开发者让它先建个细胞模型,再解释Ozempic怎么起作用。一小时后,Astra交出一份11章交互式分子旅程,3D模型随便转,实时显示受体激活数。
更神的还在后头——网友Max甩给Astra一张梅尔频谱图,不给音频,直接问「这是什么声音」。
它看了一眼就判定:狗在反复吠叫,还带上一点粗糙低吼。甚至连叫声节奏都脑补出来了:woof-woof, woof…
换了张频谱图更神,它直接给出一串画面感:光剑点火、低频嗡鸣、最后关剑熄灭。
最刺激的还是neal.fun上的「I"m Not a Robot」游戏——48关验证码,一关比一关刁钻,很多人自己都过不去。
结果Sharif让Astra去打,一把全过了!
围观网友直呼「验证码已死」,连游戏原作者都不淡定了,只能无奈留下一句:「行吧,我尽力了,祝大家好运。」
看完这波demo,真的忍不住感慨:我们对Astra的打开方式,还是太保守了!
现在再去争论它算不算「真·AGI」,其实意义不大了。因为眼下的牌局已经变了——AI亲自写代码、训练下一代AI,AI研究实习生正式入职,各家下一代模型都在酝酿。
大家拼的重点,早就从「谁先抵达AGI」,转向「谁能让智能自我加速」。
AGI这场竞逐已经提前收官,长夜尽头,剩下的赛道只有一条——ASI。人类亲手锻造的尺子,正被新物种一把接一把地崩断。
AGI的视界已经越过。ASI,我们在最终的城池内等你。
我的看法是:别急着喊「时代结束了」,也别当没看见。每一次刷屏的背后,都是我们认知边界的一次松动。与其焦虑被替代,不如先想清楚——AI能替你干的那些脏活累活,你愿不愿意放手?
你最近用AI做过最「超出预期」的一件事是什么?评论区聊聊,我先蹲一个「用AI给老板画了个饼」的故事!
觉得有用的话,点个「赞」+「在看」,转发给还在原地观望的朋友,别让认知差越拉越大。