

你还在为Claude Opus 4.8每百万Token 25美元的API价格肉疼吗?
别急,就在昨晚,一款匿名测试六天、火爆全球的开源模型正式揭面——GLM-5.3-Flash,总参数320B,激活仅18B,价格直接打到号称最强闭源模型的1/40!
更炸的是:它背后的算力,全部来自国产芯片!
8月26日晚,智谱正式开源GLM-5.3-Flash。此前它一直以Ox-Alpha的名字在OpenRouter、OpenCode上匿名测试,结果迅速成为当周最受欢迎模型,还创下两个平台的调用量新高。
大家一边用一边猜,这到底是哪家的神仙模型?结果揭晓那一刻,很多人直接惊掉下巴。
先看关键数字:GLM-5.3-Flash的价格仅为自家GLM-5.3的1/10,限时折扣期进一步降到1/20;对比Anthropic旗舰Claude Opus 4.8,大约是1/40!
再亮一个更狠的对比——Artificial Analysis上,Claude Opus 4.8的Intelligence Index拿57分,GLM-5.3-Flash也是57分!
💡 也就是说,一款开源、开放的模型,已经在第三方综合测评中摸到了高价闭源旗舰的天花板。虽然单项Benchmark、长任务稳定性仍有差距,但它确实闯进了那个曾经只有闭源巨头敢站的能力区间。
匿名测试期间,用户根本不知道背后是谁,也不知道用的是什么芯片,纯粹靠速度、稳定性和效果投票。就这样,一款前沿模型在真实流量下接受了考验。
⚠️ 智谱确认:这些请求的算力,全部由国产芯片提供!
据悉,智谱调用了超过10万张国产芯片集群来承载这个模型,这是它首次用大规模国产集群直接承接全球开发者的真实线上负载。
结果呢?端到端服务性能直接提升了3倍,硬件效率和单Token成本已经和主流NVIDIA GPU相当!
⚠️ 注意,这里的1/40不是说国产芯片硬件成本只有海外GPU的1/40,而是:一款全由国产芯片集群承载的前沿模型,把面向用户的价格压到了Claude Opus 4.8的约1/40。这个概念,别搞混了。
价格能打下来,另一半功劳在模型结构。
GLM-5.3-Flash总参320B、激活18B、45层;而GLM-4.5是355B总参、32B激活、92层。每Token实际参与计算的参数量和网络深度都明显下降了,可综合能力反而超过了参数更大的GLM-5.2!
💡 “Flash”这次不再是把旗舰模型简单缩小,而是从架构层面重新设计了推理成本。
它是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型:
效果有多猛?与GLM-5.3相比,注意力计算量降低3.01倍,KV缓存大小降低4.44倍!
这组数据,就解释了为什么价格能打下来。尤其Coding和Agent任务一跑就是几十分钟甚至几小时,上下文持续增长,注意力计算量和KV缓存直接决定要烧多少显存和算力。
GLM-5.3-Flash还是GLM-5系列第一款原生多模态模型。但它加视觉能力,不是为了陪你聊图,而是为了服务Coding和Agent。
思考一下:模型生成的不仅是代码,还有屏幕上的页面、交互、3D场景。它得能“看见”自己生成的结果,才能发现按钮错位、页面没渲染、场景不对劲,然后继续改。
💡 官方案例里,GLM-5.3-Flash在没有外部素材的情况下,独自跑了16小时,在Blender里搭出一套约400平方米的专业主厨住宅和测试厨房!它不只会写,还能看着自己的成果来回修改。
同样的机制,也延伸到了PPT、PDF、Word、Excel,以及金融、法律等专业任务。
过去,Flash、Mini、Air这类名字,意味着更快更便宜,但也意味着明显的能力缩水。
现在呢?一个320B的Flash模型,综合智能指数57分打平旗舰,价格只有旗舰的1/40,还自带视觉闭环。
同步的还有:MIT协议开源、API同步开放。
一个更扎心的观察——Ox-Alpha这六天匿名测试,本质上检验了三件事:国产芯片能不能稳定承载一个前沿模型?能不能扛住全球开发者的真实流量?能不能做到经济、好用?
答案,已经在昨晚揭晓了。
前沿能力、开放权重、国产算力、白菜价格,四个关键词同时出现在一款模型上。这场关于“便宜又强大能不能兼得”的争论,或许要换一种问法了。
模型的1/40,不只是价格,更可能是国产AI开始出牌的速度。
你怎么看这款跑在国产芯片上的GLM-5.3-Flash?它会改变你对国产大模型的印象吗?评论区聊聊你的想法!
如果觉得有收获,记得点个赞、点个“在看”,也欢迎分享给身边还在为API账单头疼的朋友。