订阅
    纠错
    加入自媒体

    算力巨头重磅新品首测,一度电性能暴增450倍!

    就在今天,英伟达首次公布了下一代旗舰级机柜Vera Rubin NVL72 的首次片上实测数据。

    image.png

     值得关注的是,英伟达这次测试跑的却不是大家常用的那种聊天问答的AI大模型,而是跑智能体(agent)。他们直接用的最强开源大模型DeepSeek V4 Pro去跑SemiAnalysis旗下的AgentX的基准测试,里面全是真实世界里Agent写代码留下的会话轨迹。

    为什么不跑LLM推理,而是agent呢?

    因为OpenRouter的最新数据显示,在真实世界里头,跑一个Agent AI任务消耗的Token数量,是普通聊天对话的15倍!

    一个智能体干完活,上下文能从六万token一路堆到接近四十万,Agent 处理长任务时这种长度就是日常,中间还穿插着工具调用和子智能体的请求。

    智能体交互次数越多,吞吐量越大。因此,英伟达官方也挑明,性能测量必须进化!不能再测单一的推理请求,必须捕捉完整的Agent工作流。为此,他们使用了AgentX 基准测试。

    image.png

    跑出来成绩也挺吓人,每秒一百六十 token的交互目标下,Vera Rubin NVL72相比上一代 GB300 NVL72,每兆瓦吞吐量最高涨了三十倍,每百万token的成本最高降了三十五倍!

    英伟达直接宣布,LLM时代结束,Agent时代降临,以前的AI跑分基准,全部作废!

    image.png 

    GB300 这一代相比更老的 H200,在 DeepSeek V4 Pro 上每兆瓦吞吐量已经高了十五倍,每百万 token 成本大约降到十分之一。到了 Vera Rubin,在这个基础上又叠了三十倍。两代连乘,从 H200 到 Vera Rubin,同一度电能干的智能体活儿差不多翻了四百五十倍!

    按行业里流传的报价口径,整机柜的标价每一代大致翻一倍,两代下来贵了约四倍。可同一度电产出的token 翻了四百多倍,相应的每百万token的账单就少了几十倍。

    虽然机器更贵了,但用它的单位成本反而塌下去一大截。

    这两年英伟达最狠的一招,是重新设计整台机柜,再堂而皇之地卖贵一截,但却把每度电的产出推到旧机器够不到的地方。

    声明: 本网站所刊载信息,不代表OFweek观点。刊用本站稿件,务经书面授权。未经授权禁止转载、摘编、复制、翻译及建立镜像,违者将依法追究法律责任。

    发表评论

    0条评论,0人参与

    请输入评论内容...

    请输入评论/评论长度6~500个字

    您提交的评论过于频繁,请输入验证码继续

    暂无评论

    暂无评论

      人工智能 猎头职位 更多
      扫码关注公众号
      OFweek人工智能网
      获取更多精彩内容
      文章纠错
      x
      *文字标题:
      *纠错内容:
      联系邮箱:
      *验 证 码:

      粤公网安备 44030502002758号