TECHNICAL SOLUTION

B300-800G 算力集群组网示例

NVIDIA 服务器集群,采用 Leaf-Spine 两层架构与 NVLink/NVSwitch 高速互联,构建高带宽、低延迟、高可靠的企业级算力集群。

OVERVIEW

面向规模训练与推理的集群设计

以上架安装、全网互联、无瓶颈通信、规范布线,含管理网、业务计算网、存储网三网严格隔离。

32 台 B300

每台 8 颗 GPU、2×CX8 200G 网卡,构成主计算节点。

4 + 4 全网状

4 台 Leaf 与 4 台 Spine 全互联,MLAG 双机冗余。

NVLink 5 代

4 台 NVSwitch 全互联,GPU 间通信无瓶颈。

三网隔离

计算、存储、管理网络独立 VLAN 与安全策略。

B300 算力集群机柜

CLUSTER PERFORMANCE

集群总计算能力指标

指标基于 NVIDIA B300 标准规格计算,最终验收以 NCCL 实测带宽与稳定性压测结果为准。

指标项规格参数备注
GPU 数量256 颗32 台 × 8 颗/台
FP8 Tensor Core 计算能力5,120 TFLOPS(约 5.1 PFLOPS)单 GPU 约 20 TFLOPS FP8
FP16/BF16 Tensor Core2,560 TFLOPS(约 2.6 PFLOPS)单 GPU 约 10 TFLOPS
FP64 Tensor Core20,480 TFLOPS(约 20.5 PFLOPS)单 GPU 约 80 TFLOPS
GPU 显存总量36,864 GB256 × 144 GB HBM3e
显存聚合带宽约 857 TB/sHBM3e 标准带宽
NVLink 互联总带宽1,800 GB/s(双向)NVLink 第 5 代
NVSwitch 聚合交换容量≥ 460 TB/s4 台 NVSwitch 全互联

HARDWARE

硬件配置清单

从计算节点到线缆与机柜,数量、用途全部可追溯。

设备名称型号 / 规格数量用途说明
B300 算力服务器NVIDIA B300(8 GPU)32 台主计算节点
NVSwitch 交换机NVIDIA NVSwitch 128 口4 台NVLink 高速互联交换
Spine 交换机800G/400G 数据中心交换机4 台Spine 层跨机柜转发
Leaf 交换机200G 数据交换机 48 口4 台Leaf 层服务器接入
管理交换机1G/10G 管理交换机 48 口2 台BMC / 管理网络接入
NVLink 线缆NVLink 第 5 代高速铜缆256 根服务器 ↔ NVSwitch 互联
业务光纤200G QSFP56 光模块 + 光纤64 对CX8 → Leaf 互联
上行光纤800G QSFP-DD 光模块 + 光纤16 对Leaf → Spine 互联
标准机柜42U 标准机柜5 面设备安装

ARCHITECTURE

网络拓扑架构设计

计算、存储、管理三网分离,每一层都有明确的冗余与切换机制。

Leaf-Spine 数据网络

4 台 Leaf + 4 台 Spine 全网状互联。32 台服务器双 200G 端口平均接入,每台 Leaf 承载 16 个服务器端口。

  • 每台 Leaf 4 个 800G/400G 上联
  • MLAG 双机接入,单链路自动切换
  • 任一 Leaf/Spine 故障业务零中断

NVLink / NVSwitch 互联

4 台 NVSwitch 构建 GPU 高速互联平面,每台服务器 8 颗 GPU 经 NVLink 第 5 代全互联。

  • 单 GPU 双向 1,800 GB/s
  • NVSwitch 聚合容量 ≥460 TB/s
  • 训练通信不占用业务网络

三网隔离设计

业务计算网络承载训练与推理流量,存储网络独立承载数据访问,管理网络用于 BMC 与设备管理。

  • 独立网段与 VLAN 规划
  • 访问控制与端口安全验证
  • 风暴抑制与异常流量防护

机柜与布线交付

5 面 42U 机柜:4 面计算柜 + 1 面网络核心柜,IP 地址、VLAN 端口、线缆标签全部建立台账。

  • 标准机柜布局与理线工艺
  • 全量线缆两端标签规范
  • 线缆台账与物理连接 100% 一致

NEXT STEP

方案细节可以在项目现场逐项核验

NCCL 实测、稳定性压测、光模块与布线验收,都有明确标准。