找工位
空间入驻
小程序

神秘「牛来」大模型横空出世!80%代码通过率,真实身份竟是它?

2026-08-23 16:57:06

最近,大模型圈突然流行起「挂马甲」测试!

一款名叫 Ox Alpha 的匿名模型突然出现在 OpenRouter 上,国内网友戏称它为「牛来」大模型。上线没多久,它就被开发者扔进真实代码仓库一顿猛测,结果直接惊呆了所有人——能力竟逼近当前顶级代码模型?!

更离谱的是,另一款匿名模型 korrine 也在悄悄测试中,网友从 Kimi 猜到 Qwen,猜什么的都有。8月的大模型圈,硬生生成了一场大型猜谜游戏!

💻 「牛来」大模型,到底牛在哪?

Ox Alpha 首次亮相,就靠惊人代码能力出圈。

📊 80%通过率,直接碾压同行

开发者 Ben Davis 从 DeepSWE 中抽取了10项真实软件工程任务进行测试,结果 Ox Alpha 一口气完成了8项,通过率直接拉满到80%!

看看对照组数据有多悬殊:

  • Fable 5 Max:65%
  • GLM-5.3 Max 和 Grok 4.6 xhigh:62%
  • GPT-5.6 Sol Max:52%

DeepSWE 可不是普通的编程题,它需要模型通读整个代码仓库,自己定位问题、改代码、跑测试,还得根据报错循环修复。这比单轮写代码难太多了,堪称编码 Agent 界的「铁人三项」!

虽然10项任务的样本量不算大,但另一组开发者测试也给出了约63%的结果。综合来看,这款匿名模型的「长程编码」实力确实有点东西!

🕵️ 「牛来」到底是谁家的孩子?

全网福尔摩斯上线,证据链逐渐清晰。

🔍 三大铁证,全部指向智谱

目前流传最广的说法是:Ox Alpha 就是智谱尚未发布的 GLM-5.3 Flash!有技术大佬专门写了篇分析博客,摆出三条硬核证据:

🌟 证据一:视频编码器完美吻合
在四段不同帧率、时长、分辨率的视频测试中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致,而 MiMo、Qwen 等模型的结果差异明显。

🌟 证据二:文本 tokenizer 高度匹配
测试了25组提示词,Ox Alpha 和 GLM-5.3 的 token 数量始终保持着固定的75 token 差值,这种规律性很难是巧合。

🌟 证据三:行为特征和操作先例都对得上
Ox Alpha 拒绝处理音频、回答风格、Agent 执行步数都跟 GLM 家族高度相似。更何况,智谱之前就用过 Pony Alpha 匿名测试 GLM-5,完全有「挂马甲」的前科!

开发者 Ben Davis 甚至直接放话:99%确定这就是 GLM-5.x!

不过,截至目前 OpenRouter 和智谱都还没公开回应,身份仍未实锤。

🤔 korrine:疑云更浓的第二张马甲

还没等大家扒完「牛来」,又一个匿名模型悄悄上线了。

💬 Kimi?Qwen?MiMo?全被猜了个遍

Code Arena 上出现的 korrine,名字和 Kimi K3 发布前的代号 kivine 结构相似,不少人第一时间锁定 Kimi。

但爆料者随后又补充:Moonshot 新模型可能对应另一个代号 adamant-ananke,korrine 也可能来自 Qwen 等其他中国团队。评论区更是脑洞大开,还有人怀疑是 MiMo V3。

好家伙,这波「猜谜游戏」难度直接升级!

🧐 大模型厂商为什么都爱「挂马甲」?

匿名测试正在成为发布前的隐藏大招。

🎯 真实体验是唯一的通行证

在 Arena 上藏起厂商和型号,用户看不到品牌光环,只能凭实际输出投票。这样收集到的对战数据,最能反映模型的真实水平!

⚙️ 高强度压力测试的试验场

把匿名模型接入编码 Agent、扔进真实仓库跑数小时任务,上下文稳不稳、工具调用可不可靠、长程任务会不会跑偏,一试便知。这对厂商来说,就是一次免费的公测加压力测试!

🔥 「猜谜」本身就是流量密码

不可否认,「猜是谁家的」现在已经变成了一种高级营销手段。身份越神秘,讨论热度越高,发布周期拉得够长,关注度自然水涨船高。

如果 Ox Alpha 真是一款 Flash 模型,代码能力就已经逼近头部水平,那资源投入更多、能力更完整的正式版,天花板又会在哪里呢?

这个问题,值得所有关注大模型的人好好期待一下!


各位老铁,你猜「牛来」大模型到底是谁家的?评论区等你来破案!

如果你觉得这篇文章有料,记得点个赞 + 转发给你的技术朋友,咱们一起追踪大模型背后的马甲真相!