找工位
空间入驻
小程序

马斯克又鸽了!Grok 4.7终于发布,价格只有对手一半?

2026-09-23 05:06:09

等了一个月又一个月,马斯克的Grok 4.7终于来了。

从7月下旬开始吹风,到「再等几周」,再到「十天之内」,最后来一句「模型还得再调校调校」……这波操作,是不是像极了你那个永远在「马上到」的朋友?

但不管怎么说,Grok 4.7 还是正式发布了。SpaceXAI 这次把重点放在了编程和知识工作上,号称是目前最强的编程与知识工作模型。

发布时间一鸽再鸽,但这次诚意拉满了?

🚀 长任务能力,这次真的摆上台面了

按照官方介绍,Grok 4.7 用了一个比上一代更大的全新基础模型,强化学习时间更长,训练任务也更难——其中相当一部分需要数小时才能完成。

这意味着什么?意味着它不再是那个只会聊天的 AI,而是能陪你干长活的「数字同事」。

模型同时加强了长上下文管理结果核查能力,还针对 Grok Bot 的运行环境做了原生训练。简单说,就是让它更擅长处理那些需要反复调用工具、核对结果的复杂流程。

官方公布的成绩单也挺亮眼:

CursorBench 4.0 中,Grok 4.7 xHigh 得分 46.3%,高于上一代的 40.4%;DeepSWE v1.1 从 65.2% 提升到 71.0%;Terminal Bench 4.0 更是从 20.3% 飙升到 38.0%。

电气工程基准 EEBench 从 53.0% 提高到 64.0%,面向长时间办公任务的 AA Briefcase v1.1 也从 1546 分增至 1657 分。

这进步幅度,确实有点东西。

⚠️ 但横向一比,优势没那么绝对

不过别急着吹爆。综合成绩来看,Grok 4.7 并没有全面领先。

CursorBench 4.0Terminal Bench 4.0 上,它低于 Fable 5.1 Max;在 DeepSWE v1.1 上略低于 GPT 5.6 Sol Max

但在 Harvey Legal Agent Benchmark 中取得 19.6%,明显高于官方表格中的几款对比模型。

Artificial Analysis 随后给出 46 分的 Intelligence Index 成绩,称 Grok 4.7 让 SpaceXAI 进入全球前四名 AI 实验室,其 Coding Agent Index 表现也超过 GPT 5.6 Sol。

所以,不是全面碾压,但在特定领域确实能打。

价格,才是这次真正的杀手锏

💡 API 定价不变,速度翻倍

价格成为 Grok 4.7 最直接的竞争筹码。

其 API 定价与上一代相同:每百万输入 token 2 美元,每百万输出 token 6 美元。

SpaceXAI 还提供输出速度翻倍的快速版本,价格也相应翻倍。

用马斯克的话来说,Grok 4.7 是一款集智能、速度和低成本于一体的强大产品。官方则直接宣称,它的速度可达到同类模型的两倍,价格只有一半。

有开发者用四个独立的 Three.js 太空场景做对比测试,Grok 4.7 完成测试约花费 0.20 美元,而 Claude Opus 5 约为 2.05 美元——差了十倍!

对于需要反复调用 API 的开发者来说,这个价格差距,足够让人认真考虑一下了。

🌟 从编程到专业工作,野心不止一点点

编程之外,SpaceXAI 开始争夺专业工作场景。

官方专门强调文档和演示文稿能力,并引用 GDPvalAA Briefcase 等评测,试图证明模型可以承担律师、护士、金融分析师等专业人士的部分工作。

Box 展示的一项保险理赔案例更能说明这个方向。

Grok 4.7Box Agent 中核对一笔价值 200 万美元的索赔、保单与相关记录,发现 8.2 万美元重复发票和 6.4 万美元遗漏的供应商抵扣,还识别出一个可能令计算结果相差 14.3 万美元的免赔额问题。

系统最终生成了一份带引用的审查报告,保险覆盖范围和付款决定仍由理赔人员完成。

这不是取代人类,而是帮人类少加班。

安全能力也被列为此次升级的重要部分。SpaceXAI 表示,Grok 4.7 使用了全新的安全防护体系,在 LatchBio 生物安全基准中取得 62.4%;在面向高风险网络安全任务的 HackerBench v0.3 中,只有 3.3% 的危险双重用途提示通过。

网友实测:口碑两极分化

😂 有人惊艳,有人失望

Grok 4.7 上线后的第一批测试主要集中在网页、3D 场景和可视化编程,但口碑可以说是两极分化。

有开发者展示了 Grok 4.6 与 4.7 制作《帝国时代 II》演示项目的对比,效果确实有提升。

另一位开发者让模型根据平面图搭建 Blender 结构,再导出为交互式 Three.js 网站,呈现了它处理多步骤视觉任务的能力。

还有开发者让 Grok 4.7 xHigh 用 Python 模拟单行道交通灯和随机驶入的车辆,并称其细节是同类测试中最丰富的一次。

但另一边,吐槽声也不少。

有开发者认为 Grok 4.7 在 3D 和前端任务上的表现低于预期,主要问题包括物理效果生硬、提示理解不稳定和 token 消耗过快。

还有人在 Grok Build 中生成 Airbus H145 直升机的 Three.js 模型,认为 4.7 的结果逊于 4.6,并称任务耗时约 45 分钟。

另一项鹈鹕骑自行车的 SVG 网页动画测试中,Grok 4.7 对画面结构和运动关系的处理同样备受诟病。

也有开发者给出了更居中的判断:Grok 4.7 的实际表现高于预期,视觉质量略低于 Astra,但高于 Sol

整体来看,Grok 4.7 在代码评测、专业工作和成本控制方面进步明确,复杂 3D、网页视觉与物理效果却并不稳定。

这只是开始,好戏还在后头

从产品定位看,Grok 4.7 更像是 SpaceXAI 对开发者市场的一次集中加码。它不是一次让所有人闭嘴的跨代更新,更像是把 Grok 推向前沿模型混战区的一次补位。

而且 Grok 4.7 显然只是当前路线上的一站。

按照马斯克公开透露的信息,Grok 4.8 的参数规模约为 2.5 万亿,并采用一套全新的 C++ 训练栈。模型将在基础训练完成后进入强化学习阶段,马斯克称其会带来「明显改进」。

更远的路线图里,Grok 4.9 被马斯克称为可能达到 OpenAI AstraAnthropic Fable 级别的模型,而终极大招 Grok 5,更是被寄托了通往 AGI 的终极希望。

至于模型发布时间嘛,如果能再准时点就更好了。

说到底,AI 圈的竞争从来不是谁一夜之间封神,而是谁能持续用更低成本解决更多真实问题。

你觉得 Grok 4.7 这个价格和性能,能打动你换掉手里的模型吗?评论区聊聊!

如果觉得有收获,别忘了点赞和分享给同样关注 AI 的朋友~