近两年,AI圈最火的关键词,非大模型、算力、Scaling Law莫属。不过,随着模型参数跨过万亿门槛,一个尴尬的问题出现了:单个GPU的算力增长,已经追不上模型规模的膨胀速度。
目前主流的技术是靠堆数量。既然一个GPU的算力不够,那就上一万个。但是,如何将一万个GPU高速连接在一起,让他们干起活来更快,这就是超节点。
当然,超节点并不是简单的服务器堆砌,而是通过高速互联技术,把几十甚至上百个GPU连接成一个逻辑上的超级GPU。在这个超级单元里,任意两个芯片都能像访问本地内存一样交换数据,延迟低到纳秒级,带宽高到TB级。
因此,高速互联技术,就是超节点的“中枢神经”。没有它,超节点就是一堆昂贵芯片的物理集合,而不是化学反应后的算力核弹。
为什么非建超节点不可?
要回答这个问题,得先理解大模型是怎么训练的。
在AI训练的早期,模型较小,数据并行是主流,节点间通信量尚可接受。然而,面对如今的巨型模型,单纯的数据并行已失效,必须采用“数据+模型+流水线”的混合并行策略。这意味着现在的万亿参数模型,没法塞进一张卡里,得切成很多块,分给几百张卡并行计算。这就涉及两种并行模式:
一是张量并行:把一层网络切成几块,分给不同GPU算。这要求GPU之间每算一步就要同步一次,通信极其频繁。
二是专家并行:MoE模型里,不同“专家”在不同GPU上,发来的请求需要快速转发。同样要求低延迟、高带宽。
无论哪一种模式,都会遇到如下问题:
梯度同步频繁:每一次迭代,成千上万张卡都需要交换海量梯度数据。
显存墙限制:单卡显存无法容纳超大模型,必须将模型切片分布在多卡上,推理和训练时需频繁跨卡读取权重。
容错率降低:节点越多,故障概率越大,传统以太网的重传机制会导致训练频繁中断。
如果GPU之间还是用传统的以太网(RoCE)通信,那光是等数据同步的时间,就能占到训练总时长的30%-70%。你买的算力,一半都在“等快递”。
而超节点的价值,就是把“快递”升级为“私家车道”。用专门的互联协议(如NVLink、UB),让芯片之间的通信快如本地内存访问,彻底消灭“等数据”的无效时间。
互联技术在超节点中扮演的角色
如果把超节点比作一个多核处理器,那互联技术就是片上的总线。它需要干三件事:


闽公网安备 35020602001684号