快讯资讯
手机优化
系统数码
网络通信人工智能
网站游戏
测评专题
智车

  Token效率新标尺下,中科       曙光Nehalem新品将瞄准行    

Token效率新标尺下,中科曙光scaleFabric以“算存传

时间:2026-09-18 22:01 来源:未知 人气:

当模型参数大到单卡放不下时,真正决定效率的,已经不只是某一块加速卡的峰值算力,而是数据在算力、网络和存储之间搬得有多快、等得有多久

近期,中科曙光发布了Token加速技术体系,该体系以scaleFabric原生无损RDMA为核心网络传输底座,构建算--传三级紧耦合的Token加速超级通道。其中,支持GPU直通网络的IBGDA技术实现在国内的首次规模化落地。

中科曙光高速网络互联产品部总工程师万伟在媒体沟通会上表示,此次发布的scaleFabric Token加速技术体系,以原生无损RDMA为底座,构建算--传三级紧耦合的Token加速超级通道,并推动支持GPU直通网络的IBGDA技术进入国内首次规模化落地阶段。

算存传三级紧耦合:scaleFabricToken加速超级通道

现在的大模型基本都基于Transformer架构,按Token进行处理。因此,Token是当前AI Factory最重要的产出,也是衡量AI效能和经济效益的重要指标。万伟强调,算力、网络和存储三者之间的数据流转效率,是整个AI Factory的关键。

实际上,scaleFabric的核心思路,是以原生无损RDMA为底座,构建算--传三级紧耦合的Token加速超级通道,让Token在训练、推理、存储全流程高速流转。

在计算环节,scaleFabric原生支持GPUDirect RDMA,也就是GDR。这是一项基础能力,相当于让网卡直接读写GPU显存,绕过传统路径中由CPU内存中转的一次数据拷贝。传统通信路径中,数据需要从GPU显存拷贝到CPU内存,再由CPU通过网卡发出,接收端则是相反过程。GDR允许网卡直接读取或写入GPU显存,完全绕过主机CPU和系统内存,极大降低了通信延迟并减少了CPU开销。

GDR并没有解决全部问题。万伟解释,即使采用GDR,虽然数据面绕过了CPU内存,但通信任务的下发和相关元数据处理仍然需要CPU参与。RDMA通信可以分为控制面和数据面,传统GDR主要优化了数据面。IBGDA则进一步把通信控制和数据处理都放到GPU上完成,使GPU Kernel能够直接驱动网卡。

具体来说,IBGDA允许GPU内核直接驱动和控制InfiniBand网卡,使GPU可以不依赖

更多文章

相关文章

网站导航 | 快讯 | 资讯 | 手机 | 优化 | 系统 | 数码 | 网络通信 | 人工智能

  • 游戏 | 测评 | 专题 | 智车

    合作伙伴:

  • 友情链接(欢迎业界知名网站交换链接)申请友情

    

    声明:本站资源皆来自网络,如有侵权问题,请联系管理员处理!

    Copyright ©2020-2028快知站 版权所有 All rights reserved.

    闽ICP备20010713号-1 闽公网安备 35020602001684号