Leaf-Spine 数据网络
4 台 Leaf + 4 台 Spine 全网状互联。32 台服务器双 200G 端口平均接入,每台 Leaf 承载 16 个服务器端口。
- 每台 Leaf 4 个 800G/400G 上联
- MLAG 双机接入,单链路自动切换
- 任一 Leaf/Spine 故障业务零中断
OVERVIEW
以上架安装、全网互联、无瓶颈通信、规范布线,含管理网、业务计算网、存储网三网严格隔离。
每台 8 颗 GPU、2×CX8 200G 网卡,构成主计算节点。
4 台 Leaf 与 4 台 Spine 全互联,MLAG 双机冗余。
4 台 NVSwitch 全互联,GPU 间通信无瓶颈。
计算、存储、管理网络独立 VLAN 与安全策略。
CLUSTER PERFORMANCE
指标基于 NVIDIA B300 标准规格计算,最终验收以 NCCL 实测带宽与稳定性压测结果为准。
| 指标项 | 规格参数 | 备注 |
|---|---|---|
| GPU 数量 | 256 颗 | 32 台 × 8 颗/台 |
| FP8 Tensor Core 计算能力 | 5,120 TFLOPS(约 5.1 PFLOPS) | 单 GPU 约 20 TFLOPS FP8 |
| FP16/BF16 Tensor Core | 2,560 TFLOPS(约 2.6 PFLOPS) | 单 GPU 约 10 TFLOPS |
| FP64 Tensor Core | 20,480 TFLOPS(约 20.5 PFLOPS) | 单 GPU 约 80 TFLOPS |
| GPU 显存总量 | 36,864 GB | 256 × 144 GB HBM3e |
| 显存聚合带宽 | 约 857 TB/s | HBM3e 标准带宽 |
| NVLink 互联总带宽 | 1,800 GB/s(双向) | NVLink 第 5 代 |
| NVSwitch 聚合交换容量 | ≥ 460 TB/s | 4 台 NVSwitch 全互联 |
HARDWARE
从计算节点到线缆与机柜,数量、用途全部可追溯。
| 设备名称 | 型号 / 规格 | 数量 | 用途说明 |
|---|---|---|---|
| B300 算力服务器 | NVIDIA B300(8 GPU) | 32 台 | 主计算节点 |
| NVSwitch 交换机 | NVIDIA NVSwitch 128 口 | 4 台 | NVLink 高速互联交换 |
| Spine 交换机 | 800G/400G 数据中心交换机 | 4 台 | Spine 层跨机柜转发 |
| Leaf 交换机 | 200G 数据交换机 48 口 | 4 台 | Leaf 层服务器接入 |
| 管理交换机 | 1G/10G 管理交换机 48 口 | 2 台 | BMC / 管理网络接入 |
| NVLink 线缆 | NVLink 第 5 代高速铜缆 | 256 根 | 服务器 ↔ NVSwitch 互联 |
| 业务光纤 | 200G QSFP56 光模块 + 光纤 | 64 对 | CX8 → Leaf 互联 |
| 上行光纤 | 800G QSFP-DD 光模块 + 光纤 | 16 对 | Leaf → Spine 互联 |
| 标准机柜 | 42U 标准机柜 | 5 面 | 设备安装 |
ARCHITECTURE
计算、存储、管理三网分离,每一层都有明确的冗余与切换机制。
4 台 Leaf + 4 台 Spine 全网状互联。32 台服务器双 200G 端口平均接入,每台 Leaf 承载 16 个服务器端口。
4 台 NVSwitch 构建 GPU 高速互联平面,每台服务器 8 颗 GPU 经 NVLink 第 5 代全互联。
业务计算网络承载训练与推理流量,存储网络独立承载数据访问,管理网络用于 BMC 与设备管理。
5 面 42U 机柜:4 面计算柜 + 1 面网络核心柜,IP 地址、VLAN 端口、线缆标签全部建立台账。