快讯资讯
手机优化
系统数码
网络通信人工智能
网站游戏
测评专题

  从万卡到十万卡,国产算       不买服务器,也能上线    

从万卡到十万卡,国产算力基础设施迈入“系统

时间:2026-09-10 23:14 来源:未知 人气:

2026710日,光合组织2026智能计算应用大会在郑州举办。会上,中科曙光宣布中国首个全国产十万卡AI超集群——曙光8000(登峰)正式落成,并同步接入国家超算互联网。这标志着国产AI基础设施建设正式从万卡级迈入十万卡级部署阶段。

从万卡到十万卡,绝不仅仅是数字后面加一个零。中科曙光高级副总裁李斌直言:从万卡到十万卡,存在诸多的挑战,不是简单的乘以10。最大的难点在于,能否跑出应有的性能和效率,任何一个环节的短板都会导致性能折损。这正是十万卡集群建设最核心的命题——系统级创新。

十万卡的三道坎:功耗、稳定性与网络

中科曙光高端计算总工程师卜景德在采访中系统梳理了从万卡到十万卡面临的核心挑战。他指出,从万卡到十万卡,必须迈过功耗、稳定性与网络这三道坎。

第一道坎是功耗。万卡集群的功耗在几个兆瓦到十兆瓦级别,多数数据中心可以轻易处理;但十万卡集群的功耗呈数量级跃升,瞬间负载从几百千瓦飙升到几兆瓦,对电力系统和散热系统提出了完全不同的要求。我们知道,郑州夏天温度比较高,这一具体场景,让散热问题变得尤为迫切。曙光8000采用相变浸没液冷技术,配合高压直流供电,PUE可低至1.04

第二道坎是系统稳定性。卜景德表示,十万卡集群包含约30亿个部件,任何一个小的波动都会影响整个系统。为此,中科曙光针对核心部件全面强化冗余设计,在供电余量、故障恢复等方面进行了大量工程打磨。

第三道坎是网络。研究显示,在大规模分布式训练中,网络通信耗时占比已达30%50%。而网络的扩展并非线性,最坏情况下复杂度会呈平方级增长。中科曙光高速网络互联产品部总工程师万伟表示,AI计算对数据吞吐的能力要比传统的高精计算翻很多。

曙光8000采用了全栈自研的400G无损网络scaleFabric——这是国内首款基于原生RDMA架构的高端网络产品,从底层的112G SerDes IP、交换芯片、网卡,到上层的交换机硬件和管理软件,全部实现自主研发。该产品端到端通信时延低至0.9微秒,单子网可支持超11万卡集群部署。

超智融合:打破两条平行线

长期以来,科学计算(超算)与人工智能计算(智算)被视为两条平行线。前者追求双精度(FP64)的极致准确,服务于气象、物理仿真;后者侧重低精度(

本文标签:

更多文章

相关文章

网站导航 | 快讯 | 资讯 | 手机 | 优化 | 系统 | 数码 | 网络通信 | 人工智能

  • 游戏

    合作伙伴:

  • 友情链接(欢迎业界知名网站交换链接)申请友情

    

    声明:本站资源皆来自网络,如有侵权问题,请联系管理员处理!

    Copyright ©2020-2028快知站 版权所有 All rights reserved.

    闽ICP备20010713号-1 闽公网安备 35020602001684号