1. 当AI基础设施遇上DPU:NVIDIA BlueField-3与DDN存储的化学反应
在数据中心运维的第十个年头,我亲眼见证了AI工作负载对存储系统的"暴力碾压"。传统架构下,NVMe SSD阵列前端的x86控制器经常被TensorFlow/PyTorch的数据流水线逼到90%以上的CPU占用率——直到我们测试了这套BlueField-3 DPU与DDN Infinia的组合方案。这种将数据处理任务从CPU卸载到DPU的架构变革,让我们的ResNet-50训练作业吞吐量提升了37%,而主机CPU负载下降了惊人的62%。
这个方案的核心在于BlueField-3 DPU的三大能力突破:
- 数据路径重构 :通过GPUDirect Storage (GDS)建立GPU显存与存储设备的DMA通道,绕过主机内存拷贝
- 协议卸载引擎 :将NVMe-oF/TCP协议栈处理任务从24核Xeon转移到DPU的专用加速器
- 硬件级隔离 :每个AI租户的存储流量在DPU内部通过Arm Cortex-A78核与Mellanox ConnectX-7网卡实现物理隔离
实测数据:在8节点DGX A100集群中,DPU卸载使4K随机读的IOPS从58万提升至210万,同时主机CPU利用率从71%降至9%
2. 存储性能加速的底层逻辑
2.1 从软件定义到DPU定义的架构跃迁
传统软件定义存储(SDS)的瓶颈在于其"伪卸载"设计——即便采用SPDK用户态驱动,RDMA流量仍需经过主机CPU调度。DDN Infinia的突破性在于将整个数据平面下沉到DPU:
-
控制/数据平面分离 :
- 控制平面:仍运行在x86主机上的Kubernetes编排器
- 数据平面


1720

被折叠的 条评论
为什么被折叠?



