找工位
空间入驻
小程序

英伟达炸裂首秀:实测打脸旧基准,Token成本暴降35倍,Agent时代彻底到来!

2026-08-26 05:04:42

太炸裂了!

就在刚刚,英伟达史上首次公布了下一代旗舰级机柜 Vera Rubin NVL72 的首次片上实测数据。

而且,这次实测直接拉来了 DeepSeek-V4-Pro,跑最真实的「智能体编码」任务!

结果令人吃惊:对比当前的主力机皇 GB300 NVL72,Vera Rubin 的每兆瓦吞吐量最高飙升了 30 倍、Token 成本最高暴降了 35 倍

有人惊呼:「我连骗投资人的 PPT 都不敢这么写!」

还有网友神评:「以前嫌 H200 三万美元一张贵,现在回头一看,H200 居然连丐版都算不上了。」

别急,让我们来仔细盘一盘。

💥 900倍速度飞跃?老黄这次真玩大了

从 H200 到 GB300,真实 Agent 工作负载的吞吐量提升了最高 30 倍,成本大致翻倍。

从 GB300 到 Vera Rubin,吞吐量再次飙升最高 30 倍,整机架价格大致再翻倍。

按照黄仁勋的定律,合着这两年英伟达最大的技术突破不是 GPU 本身,而是让价格贵了 4 倍,却换来了整整 900 倍的速度飞跃!

这次,英伟达向所有人宣布了一个反常识的真相:LLM 时代结束,Agent 时代降临,以前的 AI 跑分基准,全部作废!

🚀 为什么英伟达必须推出 Vera Rubin?

OpenRouter 的最新数据给出了答案:在真实世界里,一个 Agent AI 任务消耗的 Token 数量,是普通聊天对话的 15 倍

比如,如果让一个 Agent 为投资决策去研究一家公司,在这个过程中,智能体和子智能体会不断推理,累积的 Token 成为下一步的输入,长上下文处理,就成为限制智能体 AI 的最关键要素。

智能体交互次数越多,吞吐量越大——智能体数量多了 10 倍,工具调用多了 2 倍,算力和算法的矛盾催生了新的需求。

⚠️ 别拿聊天当智能体,旧基准全废了!

这时候,传统的 AI 基准测试(如固定长度的 8K/1K 序列测试)就彻底无效了。

英伟达官方直接挑明:性能测量必须进化!不能再测单一的推理请求,必须捕捉完整的 Agent 工作流。

为此,他们使用了 SemiAnalysis 旗下的 AgentX 基准测试。

这个测试不再是死板的问答,而是回放真实的、具有上下文增长、工具调用和子智能体生成的「代码编写会话」。

这就是为什么 H200 在新的 Agent 战场上显得力不从心,Vera Rubin 注定要称王。

🛠️ 算力怪物:Vera Rubin × DeepSeek 的硬核实测

为了证明 Vera Rubin NVL72 的实力,英伟达直接使用开源王者——DeepSeek-V4-Pro (1.6T) 进行片上实测。

数据一出,结果惊人——

💡 每兆瓦吞吐量,飙升 30 倍!

在 AgentX 工作负载下,Vera Rubin NVL72 的每兆瓦吞吐量,比 GB300 NVL72 最高提升了整整 30 倍

请注意,这里对比的不是老旧的 H200,而是炙手可热的主力 GB300。

GB300 在同样的 DeepSeek-V4-Pro 测试中,每兆瓦吞吐量已经比 H200 提升了 15 倍。

然而 Vera Rubin 却在 GB300 的肩膀上,又拔高了 30 倍,在整个帕累托曲线上又往前推了一大步!

这意味着什么?

对于受制于电力供应的「AI 工厂」来说,这直接拓展了物理法则边界。

在同样的电力预算下,Vera Rubin 能干 30 倍的智能体活儿。

对于兆瓦级甚至吉瓦级的数据中心来说,这相当于凭空变出了 30 倍的算力资产。

而且,NVIDIA DSX MaxLPS 技术可以在 GPU、机架和工作负载层面进行电源管理,能在相同的兆瓦预算内多配置高达 40% 的 GPU,让 AI 工厂进一步提升了每兆瓦吞吐量!

🔥 Token 成本暴降 35 倍!Agent 行业的「账本」彻底重写

每兆瓦吞吐量,直接影响的就是每个生成 Token 的成本。性能的飙升,带来的最直接后果就是商业模式的核爆。

英伟达宣布,Vera Rubin NVL72 生产每百万 Token 的成本,比 GB300 NVL72 最高降低了 35 倍

当推理成本呈断崖式下跌 35 倍时,24 小时无休的数字员工将成为现实,ToC 端超级应用将迎来大爆发。

老黄这一刀,直接切开了 Agent 应用的时代大门。

🛠️ 极致协同设计:老黄是怎么做到的?

你可能会问:凭什么能提速 30 倍?靠的是单颗芯片的工艺吗?

显然不是。

Vera Rubin NVL72 惊人的性能提升,靠的是「极致协同设计」。

比如分离式服务,分布式 KV 缓存,KV 感知路由,MegaMoE 等等。

另外,NVFP4 量化直接将模型权重压缩到 4 位精度,在不牺牲输出质量的情况下,大幅缩减内存占用,让吞吐量原地起飞。

而第六代 NVLink 与大模型 MoE,提供了比现成以太网快 10 倍、延迟低 3 倍的互联网络,让像 DeepSeek 这种基于 MoE 架构的大模型,可以在 72 个 GPU 之间行云流水地调用不同的「专家」子网络。

这早已不是在卖显卡,老黄卖的是一整套「AI 发电厂」。

⚡ Groq 3 LPX 全面量产:3400 Token/秒,代码 Agent 变天!

这次 Hot Chips 2026 大会上,英伟达还抛出一个震撼消息:Groq 3 LPX 开始全面量产!

💡 一管读一管写,延迟直接归零

Groq 3 LPX,是 Vera Rubin NVL72 数据中心平台的专属扩展,主打就是一个低延迟推理加速。

这项黑科技,是去年 12 月英伟达豪掷 200 亿美元从初创公司 Groq 手中买来的。

AI 智能体会遇到解码延迟的问题,为了终结这一痛点,Groq 3 LPX 巧妙地将庞大的上下文处理与 Token 生成彻底分离。

英伟达的解法是,让 Rubin GPU 处理大规模上下文,把极速生成 Token 的任务交给 Groq 3 LPX。

一个管「读」,一个管「写」,各干各最擅长的。

在一个完整的机架级部署中,多达 256 个 LP30 加速器可以通过超高带宽互连与 GPU 协同作战,构造出企业级规模的推理引擎。

🚀 速度实测:3,400 Token/秒,34倍差距!

由此,Groq 3 LPX 直接达到了破纪录的输出速度。

在 Artificial Analysis 的基准测试中,Groq 3 LPX 在 10 万 Token 超长上下文窗口下运行 Gemma 4 31B,输出速度达到惊人的 3,400 Token/秒

这使得它在延迟极度敏感的工作负载中,响应速度比竞品快了 4 倍

过去几个小时才能完成的多步智能体任务,现在几分钟内就能完成!

Groq 3 LPX 在生成 5000 Token 时,所用时间从 50 秒降至 1.5 秒,34 倍差距

而且在编码任务中,Groq 3 LPX 最大输出速度达到 6981 Token/秒

黄仁勋直言,通过 LPX 推进超高速 Token 生成,在 AI 吞吐量和响应能力上实现了「又一次巨大飞跃」。

Nebius 已经在 Nebius Token Factory 中部署该芯片,让智能体循环的每一步都能获得即时响应的极致体验。

🧠 首款 Agent 专属 CPU 发布,马斯克连夜「打上太空」!

这次官宣中,最具野心的一步棋,就是 Vera CPU 了。

⭐ 为了喂饱智能体,英伟达专门造了一颗CPU

Vera 这颗 CPU,就是专门喂饱智能体的。

它配备了 88 个自研的 Olympus 核心,高带宽的 LPDDR5X 内存,带宽直接干到 1.2TB/s

为什么大模型时代需要全新的 CPU?

Hot Chips 现场,英伟达 Vera CPU 高管直言,「Agentic AI 是史上最复杂的计算任务」。

一次任务,Agent 背后要跑上百步:调用工具、执行 Python 代码、翻上下文、处理海量数据……

这些跑腿调度的活儿,全都压在 CPU 身上硬扛。因此,英伟达必须给 Agent 单独造颗 CPU。

🛰️ 马斯克连夜部署,还要送上太空!

正是看中了这一点,马斯克的 SpaceXAI 连夜宣布,正式规模化部署英伟达 Vera CPU!

早在今年 5 月,英伟达就把第一批 Vera 样片,悄悄送到了 A社、OpenAI、SpaceXAI 先「试水」。

仅仅 3 个月后,SpaceXAI 就迫不及待地将其转入全面部署。

更疯狂的是,SpaceXAI 正在基于 Vera Rubin 平台建设吉瓦级算力工厂,用来驱动 Grok。

不仅如此,这套算力,还要被直接送上太空!

马斯克表示,「两家强强联手,设计了一款优化版的 Vera Rubin NVL72,将在 2028 年大规模部署」。

SpaceXAI 的第一代「Starmind」AI 卫星,就计划采用 Vera Rubin NVL72 机架级系统。

🏭 从一块 GPU,到整座 Agent 工厂

同一天,两大芯片 Vera CPU 和 Groq 3 LPX,全面量产。

这对英伟达来说,意义重大。

大模型时代,英伟达靠 GPU 拿下训练和推理。

Agent 时代,它的版图已经延伸到 CPU、推理加速器、NVLink 等等。

老黄卖的,早已不只是一块 GPU。

他要卖的,是一座可以不断生产 Token 的 AI 工厂。

老黄这一次,是要给整个「Agent 时代」重新铺一遍地基。

——

金句:旧地图找不到新大陆,旧的跑分基准,也测不出 Agent 时代的真实战力。

你怎么看 Vera Rubin 的 30 倍吞吐飞跃?Agent 时代真的到来了吗?评论区聊聊!

如果觉得有收获,别忘了点个「赞」和「在看」,转发给更多关注 AI 前沿的朋友,一起见证这场算力革命!