如今的数据中心行业与十年之前颇有不同,这主要是受过去几年间诸多现实因素的影响:AI技术的大规模扩散、摩尔定律有所放缓,以及令人头痛的可持续性问题等。
Uptime Institute预计,随着运营商对于供电、冷却、管理、高密度与监管压力等问题的关注和规划,整个数据中心行业将在2024年内迎来又一波重大变化。
虽然未能在Uptime的清单中位列头名,但考虑到人人都关注AI问题,所以我们就由此入手。在过去12个月中,各大主要云服务商和超大规模基础设施运营商纷纷部署起体量可观的GPU集群。Uptime预计,英伟达单在2023年一年就售出了60万张H100(我们推测可能接近71万张)。而截至2024年底,这家芯片制造巨头的GPU出货量有望进一步增长至150万至200万张。
不必担心,AI基础设施的建设并不像大家想象中那么麻烦。
但也必须承认,面对如此规模的部署以及市场对于生成式AI支持技术似乎永无止境的需求,数据中心行业正在、也必须做好应对需求暴增,特别是支持大规模GPU及其他加速器部署所带来的散热与功耗问题。
虽然HPC专业人士对越来越高的加速器性能和供电密度并不陌生,但与典型的双插槽系统相比,新设施明显把这两项指标推向了新的水平。
英伟达的H100和即将发布的H200在额定功率方面均超过700瓦,而这还仅仅是单片的功耗。一个AI集群通常安装有四到八张GPU,这就让热设计功率直接攀升到千瓦级别。
但Uptime估计,AI基础设施浪潮对于大多数运营商其实影响有限。这主要是因为芯片产能仍无法满足需求,而能够掌握巨量部署资源的企业也相对较少。
无论如何,大规模部署此类系统的数据中心必然面临供电与热管理方面的双重挑战。好在有几种方法能够解决这些具体问题,而最简单的办法之一就是将系统分散到更大的占地面积当中,这也是对设施环境变动最小的解决方案。
举例来说,假设现有基础设施能够容纳每机架25千瓦的供电与相应发热负载,那么运营商可能会尝试把DGX节点分散在两倍的机架当中。这当然会导致机柜中出现大量留空区域,但对于某些特定工作负载来说,只要空间成本不是太高,那这反而是最简单、实施难度最低的选项。
可正如我们之前从Digital Realty公司首席技术官Chris Sharp的分享中所知,尽管分散系统的确解决了发热量和电力传输的问题,但却不太适合那些基于专用互连结构的训练类工作负载。比如说NVLink的覆盖范围有限,所以最好能配合密度更大的部署方案。
直接液冷显露优势
第二种选择是将设施升级为液体冷却,特别是直接液冷(DLC)设计。Uptime分析师们预测,面对芯片发热量、系统密度以及可持续性等方面的巨大压力,运营商们将在2024年内更广泛地部署直接液冷方案,用短期安装便利性换取更强的硬件性能表现。