随着超大参数规模大语言模型,尤其是MoE模型的流行,“超节点”已经成为训练与推理部署的更理想单元。超节点通过高速互联、冷却、供电的整体设计,能够发挥以往多台服务器叠加所无法企及的效率。存储在AI业务中扮演着至关重要的角色,Solidigm的高性能、大容量存储产品选型与超节点典型用户画像紧密关联。
适应本土偏好的超节点
Shanghai Cube是由立讯智算主导架构设计、研发与交付的高密度AI超节点系统,可在单机柜中提供128卡,已通过上海经信委与上海市通信学会认证,具备国内领先、国际一流的技术水准。
Shanghai Cube采用47U标准19英寸机架,实现模块化、盲插式、高密化部署,交付效率较传统节点式提升50%,PUE可低至1.15。整柜划分为2个20U超节点群组,每个群组含8台AI计算节点(GPU计算模块)、1台Power Shelf(供电模块)、4台1U Scale-Up交换机组成。三种模块均支持热插拔,故障模块可不停机直接拔出更换。
AI计算节点为2U高度,支持双路海光或英特尔第四代/第五代至强可扩展处理器,以及8块OAM2.0加速卡。计算节点通过机柜54V直流汇流排供电,采用风液混合冷却方式,CPU、GPU均为冷板覆盖,6个N+1冗余6056风扇驱动的内部风道为内存、SSD、网络提供散热。
每个AI计算节点后窗提供24个OSFP-XD高速网络接口,通过Scale-Up交换机,每群组8个计算节点内支持32/64卡的Scale-Up互联。整柜16个计算节点可支持128卡,大规模集群可扩展至万卡规模。
AI计算节点支持16×NVMe PCIe Gen5+2×SATA/NVMe PCIe Gen4,或8×NVMe PCIe Gen5+4×SATA/NVMe PCIe Gen4的配置,均为2.5英寸U.2接口规格。在大容量配置下,单柜可以部署256块QLC SSD。
Shanghai Cube的存储配置设计充分体现了灵活、务实、尊重传统的原则。保留对SATA接口的支持主要是为了满足部分用户使用SATA RAID1做系统盘的偏好。2.5英寸U.2盘也更符合国内用户的部署习惯,且可以提供相对E1.S、E3.S更大的单盘容量。单节点多达16块PCIe Gen5 SSD的支持能力让总带宽、总容量有更高的上限。以满配Solidigm D5-P5336 122.88TB为例,Shanghai Cube单柜裸容量可高达31.5PB。
相较于1U液冷节点只能配置少量E1.S SSD,Shanghai Cube采用2U风液混合节点带来了更宽裕的SSD部署条件,使得单柜的SSD数量和容量有显著的优势。这一特点也为以机柜为单位部署分布式存储系统构建了良好的基础,可降低整个集群对独立全闪存储节点的依赖。
按需适配AI业务
Shanghai Cube在单柜内即可提供智算、高速互联、直流供电、高性能存储等完备要素,兼顾了先进性与通用性,使其尤其适合科研机构、高校、银行等企业部署,目标用户单集群部署规模大多在千卡之内。每个2U计算单元的存储层可以灵活选择8块数据盘或16块数据盘,可以选择高性能TLC SSD或大容量QLC SSD,或者混合搭配、分层存储。实际的存储配置可根据主要业务场景的IO特征进行选择。
训练场景:
在模型训练中,存储系统最为重要的两大任务是训练数据摄取和Checkpoint保存/恢复。
训练数据:训练数据具有数据集规模大、随机读频繁的特点,必须存储在高性能存储池中。及时获取训练数据有利于提升GPU利用率、缩短训练周期。硬盘阵列难以提供较高的随机读取性能,因此训练数据通常会被存储在全闪阵列当中。QLC SSD具有容量大、读取性能高(接近TLC SSD)的特点,基于QLC SSD的全闪阵列非常适合用于训练数据的存储。
Checkpoint:训练是长时间、高并发、高负荷的操作,因故障、维护导致的中断在所难免,需要通过Checkpoint来保存训练状态,并用于断点恢复。随着模型规模的增大,应用的GPU集群规模也越来越大,故障率也相应地水涨船高,Checkpoint的容量越来越大、间隔越来越短。Checkpoint生成会导致GPU闲置,尽可能快的完成Checkpoint写入至关重要。Checkpoint的写入和恢复分别对应顺序写和顺序读,属于对常见存储介质均友好的IO特征。Checkpoint可通过异步写入方式减少GPU时间占用,从而放宽对存储性能的要求。对于已有大规模存储集群的用户,典型的如大型CSP、互联网企业,硬盘集群的性能也能满足需要,有利于充分利用已有资源。但对于缺乏基础设施积累的用户,包括AI Lab、Neocloud,Checkpoint更适合放置在全闪阵列当中。QLC SSD同样适合承载Checkpoint的写入和恢复这类完全的顺序操作,而且提供更大的有效容量,可以保存尽量多的Checkpoint——Checkpoint并非临时数据,它也是重要的分析对象或者重训里程碑。
推理场景:
在推理业务中,存储的价值主要体现在RAG和KV Cache两大任务。
RAG:RAG(Retrieval-Augmented Generation,检索增强生成)就是给大语言模型外挂了知识库,充分利用企业已有的知识,能有效提高回答质量、减少大语言模型常常出现的幻觉问题。私有化部署大语言模型的用户通常都会应用RAG。RAG基于向量数据库,在向量数据库中进行相似性搜索。相较于传统数据库,高维向量化的数据体积更大,通常是数倍甚至十倍以上。相似性搜索还需索引,随着数据量和维度增加,索引容量会变得庞大,难以放置在内存当中。目前常用的DiskANN等技术将向量数据库索引卸载到SSD当中。不论是向量数据库的访问,还是索引卸载,都需要大容量、高随机读的SSD。
KV Cache卸载:随着业界对于降低推理成本的热情高涨,将KV Cache从昂贵的HBM卸载到SSD受到高度重视。只要KV Cache能够复用,就可以减少GPU的重复计算,高性能存储的价值由此也被推升到了与GPU同等重要的位置。KV Cache卸载是顺序写、随机和顺序读混合的IO特征,理论上TLC SSD和QLC SSD都可以满足。两类SSD的选择取决于对保存周期(容量)和用户规模(写入量)的预判。对于公有云服务,或者时髦地称之为Token工厂,需要服务的用户数量庞大,缓存驱逐频繁,建议为KV Cache卸载配置TLC SSD,甚至是DWPD≥3的SSD。对于私有化部署,用户数量较少,重视长上下文,则建议选择大容量QLC SSD,以较低的成本投入,尽可能保证KV Cache大容量、长周期的保存。
结语:
立讯智算在研发及用户合作过程中发现,Checkpoint和KV Cache均呈现顺序写、低频读的特征,尤其适合使用QLC SSD——这是来自技术方面的底气。同时,立讯智算耕耘服务器领域20余年,与Solidigm(及其前身)有十年以上的合作历史,对于Solidigm SSD的性能、品质、售后均很有信心。
在对QLC SSD优势和AI业务特点有充分认识、对Solidigm产品极具信心的共同作用下,Shanghai Cube的标准配置推荐完全采用Solidigm D5-P5336作为数据盘,并通过分布式存储将各计算节点的存储资源组织起来。
对于非互联网用户,Shanghai Cube提供的单柜128卡、风液混合、多盘位U.2存储等特点充分体现了先进性与通用性的有机结合。算、电、网、液的模块化和整机柜交付模式提升了交付效率,存储配置的灵活性和完整性使Shanghai Cube可以直接承载典型AI业务而无需企业额外进行存储节点的选型和部署。
关于 Solidigm
Solidigm是企业数据存储领域的领导者。凭借数十年的产品领导力和技术创新力,Solidigm正与客户携手推动业务转型,共同迈向以数据为中心的未来。Solidigm在打造创新产品和助力客户成功等领域处于长期领先地位,借助从核心数据中心到边缘的强大端到端产品,为AI等前沿领域的发展提供有力支持。Solidigm是 SK海力士的独立子公司,总部位于美国加州兰乔科尔多瓦,业务遍及全球。如欲了解有关 Solidigm 的更多信息,请访问[https://solidigm.com],或关注微信公众号[SolidigmChina]。
*文中涉及的其他名称及商标属于各自所有者资产