基于模型相似度策略的GPU集群深度学习调度优化
1. 不同GPU架构的性能
在GPU集群中,通常包含多种异构的GPU架构,它们在进行计算时表现出不同的性能。影响深度学习(DL)模型训练时间的因素主要有以下三个:
1. 批量大小 :设置范围从32到512。
2. GPU架构 :训练在不同的GPU架构上进行。
3. 训练方法 :采用跨多个GPU的分布式训练。
以下是实验中使用的机器硬件规格表:
| CPU架构 | GPU架构 | GPU系列 | CPU核心数/CPU | GPU数量 | GPU内存 (GiB) | 机器内存 (GiB) | 存储 (GB) | 额外存储 (GB) | 机器网络 (Gbps) |
| — | — | — | — | — | — | — | — | — | — |
| AMD EPYC 7452 | Nvidia A100 | Ampere | 2 | 32 | 2 | 40 | 128 | 1920 (SSD) | 960 (SSD) | 25 |
| AMD EPYC 7352 | Nvidia A40 | Ampere | 2 | 24 | 2 | 48 | 256 | 1920 (SSD) | – | 25 |
| Intel Xeon Silver 4110 | Nvidia RTX2080Ti | Turing | 2 | 8 | 4 | 11 | 128 | 479 (HDD) | – | 10 |
| Intel Xeon E5 - 2650 v4 | Nvi
超级会员免费看
订阅专栏 解锁全文

428

被折叠的 条评论
为什么被折叠?



