Workflow
服务器供应链
icon
搜索文档
阿里的磐久超节点和供应链
傅里叶的猫· 2025-09-27 10:14
阿里磐久超节点技术架构 - 采用双64 GPU超节点设计 每个计算节点配置4颗自研GPU 上下各16个计算节点 总计128个GPU [4][6] - 64个GPU为一组scale up单元 华为CM384包含384颗昇腾910C 英伟达NVL72包含72颗GPU [6][7] 互联技术对比 - 英伟达NVL72采用Cable Tray互联方式 Compute tray与Switch Tray通过线缆连接 使用NVLink私有协议 [8] - 华为CM384通过多机柜组成超节点 昇腾服务器与交换机采用线缆互联 [10] - 阿里采用无背板正交互联技术 计算节点横向放置 Switch节点纵向放置 直接插接无PCB中介 降低信号损耗 [12][14] 电光互联方案 - 英伟达NVL72的scale up使用铜连接 避免光互联带来的成本与功耗上升 [15] - 华为CM384采用全光互联 NPU与光模块比例达1:14 整系统需6912个400G光模块 导致高功耗与高成本 [15] - 阿里超节点在64 GPU组内scale up采用电互联(PCB/铜缆) ALink Switch间使用光互联 具体光模块数量未披露 [18][19] 系统性能参数 - 华为CM384系统算力达300 PFLOPS(BF16密集) 超越英伟达NVL72的180 PFLOPS 但系统功耗达559,378W 是英伟达145,000W的3.9倍 [21] - 华为HBM带宽1,229 TB/s 是英伟达576 TB/s的2.1倍 但能效比劣于英伟达(1.87 W/TFLOP vs 0.81 W/TFLOP) [21] - 阿里超节点功耗超300kW 介于英伟达与华为之间 未公布算力参数 [22] 生态与兼容性 - 阿里超节点宣称支持多厂商GPU/ASIC 但需兼容ALink私有协议 实际推广存在难度 [23] - 阿里自研GPU可兼容CUDA生态 构成当前阶段竞争优势 [24] 硬件互联架构 - 英伟达GB200与Grace CPU通过NVLink-C2C直连 [26] - 华为GPU/CPU均连接至UB Switch [25] - 阿里采用独立计算节点设计 GPU与CPU通过PCIe互联 连接线隐藏在机箱背部 [28][30] 服务器供应链分析 AI服务器集成 - 浪潮占据33%-35%市场份额 华勤占23% 某企业并列第三占18% [34] - 通用服务器领域浪潮占30% 中兴通讯占27% 华勤占18% 新华三占15% [34] - 中兴通讯目标夺取浪潮市场份额第一地位 [34] 液冷解决方案 - 高澜占30%份额 英维克占30%-40% 申菱环境占20%-30% [35] - 科华数据新进入液冷白名单 预计2026年业务扩张将稀释头部企业份额 [35] 光模块供应 - 华工科技为阿里云核心供应商 份额超25%-30% [35] - 光迅科技在400G光模块市占率30%-40% 800G模块已批量供货 采用JDM合作模式 [35] - 中际旭创与航锦科技等企业分食剩余份额 [35] PCB板技术升级 - 超节点主板层数达24-30层 超低损耗材料占比超60% 单卡价值量从900元升至1900元 [36] - 沪电股份为主力供应商 AI服务器PCB收入占比达35% 高端板毛利率超35% [36] - 沪电股份与深南电路合计占50%-60%份额 其余由国内主流PCB厂商分担 [36] 服务器电源供应 - 中恒电气与欧陆通为核心供应商 覆盖主要供应量 提供浸没式液冷集中供电电源 [37] - 科华数据新进入阿里UPS白名单 有望成为第三大供应商 此前已在腾讯占据较大份额 [37]