AI专题:为什么 GB200 NVL72 推理性能相较于 HGX H100 提高 30 倍?

【微知】关于GB200 NVL72服务器的一些信息?(36CPU72GPU;LPDDR5X 17T;HBM3e 13.5T;5代NVlink 1.8TB; 720P算力FP8;120Kw) 本文仅根据官网介绍分析,存在纰漏仅供参考。 阅读详情

今天分享的是AI专题系列深度研究报告:《AI专题:为什么 GB200 NVL72 推理性能相较于 HGX H100 提高 30 倍?》。

(报告出品方:广发证券

核心观点

GB200 NVL72 系统推理性能大幅提升。英伟达在 2024 GTC 大会发布的 GB200 NVL72系统展现出较强的推理性能;参考公司官网,GPT-MOE-1.8T 模型推理,NVL72的单卡每秒吞吐量可以达到 HGX H100 的 30 倍,我们在此前发布报告《A1 的梨变时刻系列报告 3:为什么 H20 的推理性价比高》中搭建了用于理论推算算力系统推理能力的框架,在本报告中我们将基于本框架进一步分析为何 NVL72 系统的推理能力有如此显著的提升。更高速、支持互联 GPU 数量更多的第五代 NvLink 可以大幅缩减超大模型推理的跨服务器通信时间。NVL72中 72 张 B200 GPU 通过第五代 NvLink互联,双向带宽可达 1800GBIS,对于万亿参数量模型,其参数所需显存空间可达 1000GB 以上(FP8 精度),叠加推理过程中 KVCache 所需显存空间,会超出单台8卡AI 服务器显存容量;因此万亿参数量模型的推理通常要在多台服务器组成的算力系统中进行。多卡1多服务器的算力系统中进行推理会涉及各类并行方式,如张量并行、流水线并行、专家并行、数据并行等;其中张量并行、专家并行会带来较多的卡间通信需求:对于传统的英伟达 DGX 服务器集群,服务器间 GPU 通过 InfiniBand 网络互联,带宽明显低于 NVLink 网络带宽,使得服务器间通信耗时较长、明显影响推理效率,基于NvLink全互联的NVL72 在执行万亿参数量模型推理时卡间通信时间大幅缩减,提高了算力利用率。

Blackwell GPU 引入新的数据精度 FP6/FP4,可提供更快的算力速度。Balckwell GPU 配置的第二代[ransformer 引擎将新的微张量缩放支持和先进的动态范国管理算法与 TensorRT-LLM和NeMo Megatron 框架结合,使 Blackwel 具备在 FP4 精度的 AI推理能力;在全新FP4 精度下,Blackwell GPU 的 Tensor Core 算力是其本身 FP8 精度的算力的2倍,A1性能达到 Hopper的5倍。同时,使用4位精度相较于8位精度,GPU从 HBM 读取模型参数、KV Cache 的速率大幅提升,提高了 Decode 阶段的速率。

其他关键升级点在于显存带宽1容量提升、更适合 MOE 并行的架构升級等。单颗 B200 GPU 配有8颗 HBM3E显存,显存容量达到 192GB,显存带宽达到8TBIS;升级后的显存配置一方面加速 Decode 阶段显存读取效率:另一方面可以支持系统进行更大 Batch Size 的推理,提高算力利用率。Blackwell GPU 引入的第二代Transformer 引擎可以加速混合专家模型的推理,通过使用 MOE 模式有效降低了计算阶段的浮点运算次数,缩短 Preí 阶段的计算时间。

GB200 NVL72 的推理性能优势主要体现在万亿参教量及以上模型。根据我们的推算,在给定万亿参教模型推理场景中,NVL72 系统的推理性能可以达到 DGX H100 系统的 29.5 倍:NVL72 的 NvLink 全互联设计及Blackwel 新架构使得其在万亿参数量及以上级別的 MOE 大模型推理中性能优势显著;但是在运行千亿参数量模型推理时,如 GPT-175B 推理,NVL72系统推理性能仅为 DGX H100 服务器的 7.5倍,且与 DGX B200 股务器的推理性能较为接近。

GB200 NVL72 系统推理性能大幅提升

在2024GTC大会,英伟达发布了全新Blackwell架构GPU和GB200NVL72等新产品其中,基于第五代NvLink实现72张GPU全互联的NVL72系统展现出较强的推理性能:参考发布会内容和公司官网,在GPT-MOE-1.8T模型推理中,NVL72的单卡每秒吞吐量可以达到HGX H100的30倍,推理性能提升明显。我们在此前发布报告《AI的裂变时刻系列报告3:为什么H20的推理性价比高》中搭建了一个用于理论推算算力系统推理能力的框架,在本报告中我们将基于本框架进一步分析为何NVL72系统的推理能力有如此显著的提升。

NvLink大幅缩减推理过程跨服务器通信时间

前沿大语言模型参数量达到万亿级别,带来跨服务器推理需求。根据NVIDIA官网,新一代GPT MOE模型参数量达到1.8万亿级别,是前一代GPT-3模型参数量的10倍以上。以FP8精度为例,仅GPTMOE模型参数所占用显存容量达到1800GB,超出了单台NVIDIADGXH200/DGXB200的显存容量,且考虑到在大语言模型推理过程中KVCache会占据一定容量显存,因此对于万亿参数量模型的推理,跨服务器的并行推理势在必行。

主要的推理并行方式对服务器间通信带宽带来了较高要求。目前主要的推理并行方式有张量并行、流水线并行、专家并行等;其中张量并行推理过程中,道常transformer层内存在All reduce和Al gather通信需求;流水线并行推理过程中,分布在不同服务器的tansformer层间有通信需求;专家并行中专家被分配到不同的GPU上,推理时需要用到all2all通信来互相交换token,单卡推理场景中不需要考虑通信的时间需求;对单台服务器内(8卡GPU内)的推理场景,由于NvLink互联的GPU间通信带宽较高,因此通信时间对整体推理过程效率的影响有限。但是在跨服务器推理场景中,服务器之间的网卡使用InfiniBand网络互联,带宽相较于NvLink网络明显较低,因此跨服务器通信环节容易成为影响推理系统效率的关键因素。

报告来源/公众号:【海选智库】
本文仅供参考,不代表我们的任何建议。海选智库整理分享的资料仅推荐阅读,如需使用请参阅报告原文。

Grace Blackwell NVLink 72 Grace Blackwell NVLink 72 是英伟达推出的一款高性能计算平台,其核心组件为 NVIDIA GB200 Grace Blackwell Superchip。该系统通过第五代 NVLink 技术实现了多个 GPU 和 CPU 的高效互联,具体来说,它连接了 36 个 Grace CPU 和 72 个 Blackwell GPU,每个节点包含一个 Grace CPU 和两个 Blackwell GPU。 阅读详情

相关推荐

【深度解析】GB200 NVL72:液冷机柜级服务器的性能怪兽与架构奥秘

本文深度解析了NVIDIA GB200 NVL72液冷机柜级服务器的革命性架构与极致性能。它集成了72颗Blackwell GPU和36颗Grace CPU,通过第五代NVLink实现高达1.8TB/s的GPU间互联带宽,并配备30.5TB海量内存,专为万亿参数大模型训练设计。其全液冷散热方案是驾驭120千瓦功耗、实现超高密度算力集成的关键,代表了AI基础设施向机柜级集成与高速互联的演进方向。

ik678901的博客 360

一文拆解 NVIDIA GB200 NVL72

NVIDIA的GB200 NVL72将超级计算机的AI算力压缩进单个机柜,搭载72颗Blackwell GPU和36颗Grace CPU,峰值算力超1.4 exaFLOPS(FP4)。其核心是GB200超级芯片模块,通过NVLink-C2C(900 GB/s)实现CPU与GPU内存统一寻址,提供近1TB共享内存,解决大模型内存瓶颈。Blackwell GPU采用双芯粒设计,通过10 TB/s的NV-HBI互联,支持FP4低精度计算,性能较前代提升3072颗GPU通过NVLink 5和NVSwitch全互

qq_3775566111的博客 1100

进一步解读英伟达 Blackwell 架构、NVlink及GB200 超级芯片

为数据中心提供前所未有的计算能力。在NVL72系统中,NVLink Switch实惊人的130TB/s的GPU带宽,极大增强大型模型的并行处理能力,使得多服务器集群可以随着计算量的增加而扩展GPU通信,支持的GPU数量是单8个GPU系统的9。作为NVIDIA数据中心解决方案的关键构建模块,NVLink和NVLink Switch整合英伟达AI Enterprise软件套件和NVIDIA NGC™目录中的硬件、网络、软件、库及优化的AI模型和应用程序,为用户提供全面的AI计算解决方案。

LANHYGPU的博客 6352

NVIDIA 最新 GPU 解读:GB200NVL72、SuperPod-576GPU

一、背景之前我们具体介绍过 NVIDIA 的 GPU,包括详细的架构、算力、NVLink 和 NVSwitch 互联方式等。借着 NVIDIA 在发布最新、最强大的 Blackwell 系列 GPU B200GB200 的契机,简单补充一下相关的参数信息,以及互联方式等。

机器学习社区 1万+

一文读懂:到底什么是 NVIDIA GB300 NVL72 系统?

这个系统将72个NVIDIA Blackwell Ultra GPU和36个基于Arm的NVIDIA Grace CPU整合到一个平台上,并针对测试时间扩展推理进行了优化,配备了升级版Blackwell芯片,其推理性能提升了1.5,HBM内存容量增加了1.5,网络连接能力翻,带来全新 AI 推理性能。目前推出的这个系统是由戴尔科技集团和领先的 AI 云服务提供商 CoreWeave 联手打造的,它采用了最新的 NVIDIA 技术,专为处理最复杂、最庞大的企业级 AI 任务而设计。

了不起的云计算 4468

AI专题:从架构到互联,深度解析GB200 NVL72如何实现推理性能的飞跃

本文深度解析GB200 NVL72如何通过Blackwell架构和第五代NVLink技术实现推理性能的飞跃。GB200 NVL72凭借FP4精度、HBM3E显存和第二代Transformer引擎,显著提升AI模型推理效率,尤其在处理万亿参数MOE模型时,性能提升高达30NVLink全互联设计进一步优化通信效率,消除显存墙,为大规模AI推理任务提供革命性解决方案。

weixin_33720078的博客 426

Nvidia B100/B200/GB200 关键技术解读

B200 GPU的晶体管数量是现有H100的两多,但B200封装了2080亿个晶体管(而H100/H200上为800亿个)。这意味着B200芯片封装密度比H100进一步提高,对管理散热和功耗也提出了更高的要求。引入一种新的计算精度,位宽比FP8进一步降低,B200峰值算力达18P。位宽介于FP4和FP8之间。B200有两个Die,高速连接通道NV-HBI达到10TB/s。两个Die是一个统一的Cuda GPU。NV-HBI会占用一定的芯片面积。

Ai17316391579的博客 1万+

Nvidia B100/B200/GB200解读

第五代NV-Link芯片,双向带宽达1.8TB/s = 18(links) * 50GB/s (bandwidth each direction) * 2,是Hopper GPU使用的第四代NV-Link的2。包含18个1U compute tray(共72个B200)、9个Switch Tray(共18个Switch )。与H100相比,superpod的训练性能提升4推理性能提高30,能效提高25。第四代NVSwitch芯片,7.2TB/s的全双工带宽,是上一代的两

HPC_factory的博客 4836

别再只盯着算力了!聊聊GB200 NVL72里那个让推理30的‘隐形功臣’——第五代NVLink

本文深入探讨了第五代NVLink技术在GB200 NVL72系统中的关键作用,揭示其如何通过1800GB/s的全互联带宽显著提升万亿参数模型的推理性能。作为让推理速度提升30的‘隐形功臣’,NVLink 5.0通过拓扑结构优化、协议层改进和与Blackwell架构的深度协同,有效解决了大模型推理中的通信瓶颈问题,重新定义了AI推理性能边界。

weixin_26965807的博客 384

深夜炸场!英伟达发布全球最强 AI 芯片,性能暴涨 30

整理 |冬梅、Tina、小褚来源于InfoQ文末送书福利北京时间凌晨 4:00,大洋彼岸的美国加利福尼亚州圣何塞的圣何塞会议中心,被称为英伟达技术盛宴的 GTC 2024 大会正如火如荼地进行着。作为英伟达 2024 的开年大戏,身着标志性皮夹克的万亿富豪黄教主站在舞台中央,平静地甩出继 H100、A100 后的又一系列“核弹”级超级芯片。今年的 GTC 之所以万众瞩目,是因为过去一年英伟达...

程序IT圈 1005

重磅!英伟达官宣全球最强AI芯片:性能提升 30 ,并将重新设计整个底层软件堆栈

北京时间凌晨 4:00,大洋彼岸的美国加利福尼亚州圣何塞的圣何塞会议中心,被称为英伟达技术盛宴的 GTC 2024 大会正如火如荼地进行着。作为英伟达 2024 的开年大戏,身着标志性皮夹克的万亿富豪黄教主站在舞台中央,平静地甩出继 H100、A100 后的又一系列“核弹”级超级芯片。今年的 GTC 之所以万众瞩目,是因为过去一年英伟达在 AI 领域的财务业绩方面取得了巨大成功。

IT界那些事儿 1005

重磅!英伟达2024年GTC人工智能大会看点,黄仁勋发布最炸裂的B200 GPU,讲述人工智能奇迹

2024年GTC人工智能大会,和过去一样,黄仁勋,这位穿黑色皮夹克的男人用两个小时讲述了人工智能的奇迹,发布最炸裂的B200 GPU,以及让人工智能唱歌跳舞的下一代硬件和软件技术。

Jiezhisuan的博客 1757

重磅!英伟达官宣全球最强AI芯片:性能提升 30 ,并将重新设计整个底层软件堆栈...

InfoQ2024-03-19 06:51北京听全文整理 |冬梅、Tina、小褚北京时间凌晨 4:00,大洋彼岸的美国加利福尼亚州圣何塞的圣何塞会议中心,被称为英伟达技术盛宴的 GTC 2024 大会正如火如荼地进行着。作为英伟达 2024 的开年大戏,身着标志性皮夹克的万亿富豪黄教主站在舞台中央,平静地甩出继 H100、A100 后的又一系列“核弹”级超级芯片。今年的 GTC 之所以万众...

人机与认知实验室 649

NVIDIA智算中心“产品”上市,AI工业革命的iPhone时刻

智算中心迈进“智能机”时代。

云科技时代 1580

重磅!英伟达官宣全球超强AI芯片:性能提升 30 ,并将重新设计整个底层软件堆栈...

架构师大咖 架构师大咖,打造有价值的架构师交流平台。分享架构师干货、教程、课程、资讯。架构师大咖,每日推送。公众号该公众号已被封禁近日,大洋彼岸的美国加利福尼亚州圣何塞的圣何塞会议中心,被称为英伟达技术盛宴的 GTC 2024 大会正如火如荼地进行着。作为英伟达 2024 的开年大戏,身着标志性皮夹克的万亿富豪黄教主...

<sdffdsfsdfdfs>sfsfsfsdfsdffds</sdfsDS>Fsd 372

速看:黄仁勋 GTC 2025 演讲 —— Agentic AI 崛起,物理 AI 重塑世界

在2025年英伟达GTC大会上,黄仁勋围绕“Agentic AI与物理AI的未来”发表演讲。提出AI历经生成式、Agentic、物理AI三阶段,现正过渡,未来聚焦物理AI。硬件上,RTX 5090性能强,Blackwell Ultra等平台先进,GB300芯片出色。推理算力需求因Agentic AI大增,Dynamo系统优化性能。物理AI与机器人领域有新成果,软件生态丰富,与多方开展合作。虽演讲时股价下跌,市场存忧,但长期看,英伟达借架构迭代推动AI普惠,致力于重塑计算行业格局。

LANHYGPU的博客 2596
上一篇: 人形机器人MEMS IMU或为人形机器人实现两足运动平衡的最佳方案
下一篇: AI专题报告:AI人才粮仓白皮书
人形机器人报告
博客等级 码龄2年 290粉丝 26原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值