

最近,大模型圈突然流行起「挂马甲」测试!
一款名叫 Ox Alpha 的匿名模型突然出现在 OpenRouter 上,国内网友戏称它为「牛来」大模型。上线没多久,它就被开发者扔进真实代码仓库一顿猛测,结果直接惊呆了所有人——能力竟逼近当前顶级代码模型?!
更离谱的是,另一款匿名模型 korrine 也在悄悄测试中,网友从 Kimi 猜到 Qwen,猜什么的都有。8月的大模型圈,硬生生成了一场大型猜谜游戏!
Ox Alpha 首次亮相,就靠惊人代码能力出圈。
开发者 Ben Davis 从 DeepSWE 中抽取了10项真实软件工程任务进行测试,结果 Ox Alpha 一口气完成了8项,通过率直接拉满到80%!
看看对照组数据有多悬殊:
DeepSWE 可不是普通的编程题,它需要模型通读整个代码仓库,自己定位问题、改代码、跑测试,还得根据报错循环修复。这比单轮写代码难太多了,堪称编码 Agent 界的「铁人三项」!
虽然10项任务的样本量不算大,但另一组开发者测试也给出了约63%的结果。综合来看,这款匿名模型的「长程编码」实力确实有点东西!
全网福尔摩斯上线,证据链逐渐清晰。
目前流传最广的说法是:Ox Alpha 就是智谱尚未发布的 GLM-5.3 Flash!有技术大佬专门写了篇分析博客,摆出三条硬核证据:
🌟 证据一:视频编码器完美吻合
在四段不同帧率、时长、分辨率的视频测试中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致,而 MiMo、Qwen 等模型的结果差异明显。
🌟 证据二:文本 tokenizer 高度匹配
测试了25组提示词,Ox Alpha 和 GLM-5.3 的 token 数量始终保持着固定的75 token 差值,这种规律性很难是巧合。
🌟 证据三:行为特征和操作先例都对得上
Ox Alpha 拒绝处理音频、回答风格、Agent 执行步数都跟 GLM 家族高度相似。更何况,智谱之前就用过 Pony Alpha 匿名测试 GLM-5,完全有「挂马甲」的前科!
开发者 Ben Davis 甚至直接放话:99%确定这就是 GLM-5.x!
不过,截至目前 OpenRouter 和智谱都还没公开回应,身份仍未实锤。
还没等大家扒完「牛来」,又一个匿名模型悄悄上线了。
Code Arena 上出现的 korrine,名字和 Kimi K3 发布前的代号 kivine 结构相似,不少人第一时间锁定 Kimi。
但爆料者随后又补充:Moonshot 新模型可能对应另一个代号 adamant-ananke,korrine 也可能来自 Qwen 等其他中国团队。评论区更是脑洞大开,还有人怀疑是 MiMo V3。
好家伙,这波「猜谜游戏」难度直接升级!
匿名测试正在成为发布前的隐藏大招。
在 Arena 上藏起厂商和型号,用户看不到品牌光环,只能凭实际输出投票。这样收集到的对战数据,最能反映模型的真实水平!
把匿名模型接入编码 Agent、扔进真实仓库跑数小时任务,上下文稳不稳、工具调用可不可靠、长程任务会不会跑偏,一试便知。这对厂商来说,就是一次免费的公测加压力测试!
不可否认,「猜是谁家的」现在已经变成了一种高级营销手段。身份越神秘,讨论热度越高,发布周期拉得够长,关注度自然水涨船高。
如果 Ox Alpha 真是一款 Flash 模型,代码能力就已经逼近头部水平,那资源投入更多、能力更完整的正式版,天花板又会在哪里呢?
这个问题,值得所有关注大模型的人好好期待一下!
各位老铁,你猜「牛来」大模型到底是谁家的?评论区等你来破案!
如果你觉得这篇文章有料,记得点个赞 + 转发给你的技术朋友,咱们一起追踪大模型背后的马甲真相!