- 技术 :
- 应用 :
算力巨头重磅新品首测,一度电性能暴增450倍!
就在今天,英伟达首次公布了下一代旗舰级机柜Vera Rubin NVL72 的首次片上实测数据。

值得关注的是,英伟达这次测试跑的却不是大家常用的那种聊天问答的AI大模型,而是跑智能体(agent)。他们直接用的最强开源大模型DeepSeek V4 Pro去跑SemiAnalysis旗下的AgentX的基准测试,里面全是真实世界里Agent写代码留下的会话轨迹。
为什么不跑LLM推理,而是agent呢?
因为OpenRouter的最新数据显示,在真实世界里头,跑一个Agent AI任务消耗的Token数量,是普通聊天对话的15倍!
一个智能体干完活,上下文能从六万token一路堆到接近四十万,Agent 处理长任务时这种长度就是日常,中间还穿插着工具调用和子智能体的请求。
智能体交互次数越多,吞吐量越大。因此,英伟达官方也挑明,性能测量必须进化!不能再测单一的推理请求,必须捕捉完整的Agent工作流。为此,他们使用了AgentX 基准测试。

跑出来成绩也挺吓人,每秒一百六十 token的交互目标下,Vera Rubin NVL72相比上一代 GB300 NVL72,每兆瓦吞吐量最高涨了三十倍,每百万token的成本最高降了三十五倍!
英伟达直接宣布,LLM时代结束,Agent时代降临,以前的AI跑分基准,全部作废!
GB300 这一代相比更老的 H200,在 DeepSeek V4 Pro 上每兆瓦吞吐量已经高了十五倍,每百万 token 成本大约降到十分之一。到了 Vera Rubin,在这个基础上又叠了三十倍。两代连乘,从 H200 到 Vera Rubin,同一度电能干的智能体活儿差不多翻了四百五十倍!
按行业里流传的报价口径,整机柜的标价每一代大致翻一倍,两代下来贵了约四倍。可同一度电产出的token 翻了四百多倍,相应的每百万token的账单就少了几十倍。
虽然机器更贵了,但用它的单位成本反而塌下去一大截。
这两年英伟达最狠的一招,是重新设计整台机柜,再堂而皇之地卖贵一截,但却把每度电的产出推到旧机器够不到的地方。
最新活动更多
扫码关注公众号
发表评论
登录
手机
验证码
手机/邮箱/用户名
密码
立即登录即可访问所有OFweek服务
还不是会员?免费注册
忘记密码其他方式
请输入评论内容...
请输入评论/评论长度6~500个字
暂无评论
暂无评论