快讯资讯
手机优化
系统数码
网络通信人工智能
网站游戏
测评专题

  NVIDIA Blackwell Ultra 在代理       第四届北京人工智能产业    

NVIDIA Blackwell Ultra 在代理式 AI 领域可实现高达

时间:2026-09-12 18:32 来源:未知 人气:

NVIDIA Blackwell 平台已被 Baseten、DeepInfra、Fireworks AI 和 Together AI 等领先推理提供商广泛采用,将每 token 成本降至原来的 1/10。如今,NVIDIA Blackwell Ultra 平台正将这一势头进一步推向代理式 AI 领域。

AI 智能体和编程助手正推动软件编程相关 AI 查询量呈现爆发式增长:据 OpenRouter 发布的推理现状报告显示,此类查询占比去年已从 11% 上升至约 50%。此类应用需要低延迟以维持多步骤工作流中的实时响应能力,同时在跨整个代码库进行推理时需支持长上下文处理。

最新 SemiAnalysis InferenceX 性能数据显示,NVIDIA 的软件优化与新一代 Blackwell Ultra 平台的结合在两方面均实现了突破性进展。NVIDIA GB300 NVL72 系统每兆瓦可提供高达 50 倍的吞吐量,每 token 成本降低至 NVIDIA Hopper 平台的 1/35。

通过跨芯片、系统架构和软件领域的创新,NVIDIA 的极致协同设计加速了从智能体编程到交互式编程助手等各类 AI 工作负载的性能提升,同时实现了大规模部署的成本优化。

GB300 NVL72 为低延迟工作负载提供高达 50 倍的性能提升

Signal65 的一份近期分析表明,采用极致软硬件协同设计的 NVIDIA GB200 NVL72 芯片,相较于 NVIDIA Hopper 平台,其每瓦可处理的 token 数提升超过10倍,每 token 成本降至其 1/10。随着底层技术栈的持续优化,这些显著的性能提升空间仍在不断扩大。

NVIDIA TensorRT-LLM、NVIDIA Dynamo、Mooncake 和 SGLang 团队持续进行的优化,显著提升了 Blackwell NVL72 在所有延迟目标下混合专家模型(MoE)推理的吞吐量。例如,NVIDIA TensorRT-LLM 库的改进使 GB200 在低延迟工作负载上的性能较四个月前提升高达 5 倍。

● 更高性能的 GPU 内核经过针对效率和低延迟进行的优化,充分释放了 Blackwell 架构的强大计算能力,显著提升吞吐量。

●NVIDIA NVLink 对称内存支持 GPU 间直接内存访问,实现更高效的数据通信。

●程序化依赖启动(PDL)通过在前一个内核完成前启动下一个内核的准备阶段,最小化空闲时间。

基于这些软件进步,搭载 Blackwell Ultra GPU 的 GB300 NVL72 将每兆瓦吞吐量提升至 Hopper 平台的 50 倍。

这种性能提升转化为经济效益上的优势,与 Hopper 平台相比,NVIDIA GB300 在整个延迟范围内都可降低成本。最显著的降幅出现在低延迟场景,即智能体应用运行的领域:每百万 token 的成本是 Hopper 平台的 1/35。

NVIDIA GB300 NVL72 及协同设计的软件栈(包括 NVIDIA Dynamo 和 TensorRT-LLM)相比 NVIDIA Hopper 平台,实现了每 token 成本降低至 1/35。

对于智能体编程和交互式助手这类工作负载,在多步骤工作流中每毫秒的延迟都会累积放大。这种持续的软件优化与新一代硬件的结合,使 AI 平台能够将实时交互体验扩展至更多用户。

本文标签:

更多文章

相关文章

网站导航 | 快讯 | 资讯 | 手机 | 优化 | 系统 | 数码 | 网络通信 | 人工智能

  • 游戏

    合作伙伴:

  • 友情链接(欢迎业界知名网站交换链接)申请友情

    

    声明:本站资源皆来自网络,如有侵权问题,请联系管理员处理!

    Copyright ©2020-2028快知站 版权所有 All rights reserved.

    闽ICP备20010713号-1 闽公网安备 35020602001684号