算力网建设顾问
算力集群整体架构规划、可行性论证、技术路线选型、投资回报分析、建设周期与里程碑设定、机房环境评估与改造建议。
SERVICE MODULES
每一项服务都可在《服务内容明细与验收标准》中找到对应交付物与合格标准。
算力集群整体架构规划、可行性论证、技术路线选型、投资回报分析、建设周期与里程碑设定、机房环境评估与改造建议。
AI 服务器与算力网主网硬件选型、参数确认与兼容性验证、供应商评估、技术规范书编制、到货验收、SN 序列号核验与渠道溯源。
GPU 算力基准、显存带宽、NVLink/NVSwitch 互联、CPU 与内存、存储 I/O、网络带宽与延迟、整机稳定性压测,输出性能基线与对比分析报告。
算力调度管理平台、Kubernetes/Slurm 等集群资源管理、GPU 虚拟化与隔离、任务排队与调度策略、权限配额、监控告警与运营报表。
Leaf-Spine 架构设计、三网隔离、IP/VLAN 规划、交换机配置与调测、InfiniBand/RoCE 部署、安全策略、网络压测、故障演练与 MLAG 切换测试。
业务场景算力需求分析、资源池分级、弹性伸缩、利用率优化、多租户分配、算力成本核算与计费模型、未来扩容路线图。
LLaMA、GPT 系列、ChatGLM 等大模型部署适配,多模态模型适配,张量/流水线/数据并行策略,量化蒸馏剪枝,推理服务化与版本管理。
技术文档编制交付、运维人员培训、7×24 技术支持、定期巡检与性能优化、故障应急响应、技术升级与架构演进咨询。
PERFORMANCE COMMITMENT
建设调试完成的算力集群,以可实测、可复测的指标作为交付底线。
集群总计算能力不低于设计标称值,FP16/BF16 单 GPU 不低于 10 TFLOPS。
GPU 间互联总带宽不低于 1,800 GB/s 双向,NVSwitch 全互联无瓶颈。
AllReduce 实测带宽不低于理论聚合互联带宽的 90%,无性能衰减。
GPU 平均利用率 ≥95%,无掉卡、无链路降级、无 ECC 错误激增。
业务网络零丢包,RDMA 带宽延迟达到设计指标,MLAG 切换零中断。
月度巡检、季度性能与安全报告、故障分级响应、定期优化建议。
DELIVERABLES