目录
场景 2:模型并行(Tensor/ Pipeline Parallelism)
场景 3:显存扩展(Memory Pooling / NVMe offload)
在多芯片协同场景(如大模型训练、分布式推理)下,瓶颈通常从“芯片访问自身 DRAM 的带宽”转移到“芯片间互联带宽”,但两者都可能成为瓶颈,具体取决于系统架构和工作负载。
下面我们深入分析:
🔍 一、两种带宽的角色对比
| 带宽类型 | 作用 | 典型值(2024–2025) |
|---|---|---|
| 1. 芯片 ↔ 自身 DRAM 带宽 (Off-Chip Memory Bandwidth) |
加载模型权重、激活值、KV Cache 等 | - HBM3e: 1.2–1.8 TB/s per chip - |

订阅专栏 解锁全文

2590

被折叠的 条评论
为什么被折叠?



