GPU运维
GPU运维 & AI运维面试常见问题清单
1. GPU和CPU的区别?为什么AI训练一般用GPU?
答案:
CPU设计上适合串行任务,拥有少量高性能核心,能快速处理复杂逻辑。GPU则包含数千个并行核心,专注于大规模并行浮点运算。AI训练中大量矩阵乘法和张量运算非常适合并行处理,因此GPU能大幅提升训练速度和效率。GPU还配备高带宽显存,减少数据传输瓶颈。
2. CUDA是什么?cuDNN的作用?
答案:
CUDA(Compute Unified Device Architecture)是NVIDIA开发的GPU并行计算平台和API,允许开发者用C/C++语言编写代码直接调用GPU执行计算任务。cuDNN是CUDA的深度学习加速库,提供高度优化的神经网络算子实现(卷积、池化、激活等),极大提升深度学习框架在NVIDIA GPU上的性能。
3. GPU显存和主机内存的区别?显存不足时怎么办?
答案:
GPU显存是显卡上的高速专用内存,用于存储模型参数、中间计算结果和数据;主机内存是CPU可访问的内存。GPU显存容量通常较小,访问速度极快。显存不足时可以:
调整模型大小或batch size;
使用显存优化技巧如梯度检查点;
采用混合精度训练减少显存占用;
将部分数据放到主机内存分批加载;
增加GPU数量进行分布式训练。
4. 什么是NVIDIA Multi-Instance GPU(MIG)?它的优势是什么?
答案:
MIG是NVIDIA A100及以上型号支持的技术,允许将一块物理GPU划分为多个小的独立GPU实例,每个实例有独立的计算核心、显存和缓存。优势包括资源隔离、多租户支持、提升硬件利用率、降低延迟,特别适合云计算和政企多用户共享GPU资源的场景。
5. 介绍一下Tensor Core是什么?它怎么加速深度学习?
答案:
Tensor Core是NVIDIA Volta及后续架构的专用硬件单元,用于高效执行混合精度矩阵乘加运算。它通过FP16和FP32混合精度计算,显著提升深度学习中卷积和矩阵乘法的吞吐量,减少训练时间,同时保证模型精度。
6. 如何安装NVIDIA GPU驱动和CUDA环境?
答案:
安装流程大致是:
确认操作系统版本和GPU型号;
卸载旧驱动;
从NVIDIA官网下载安装对应驱动;
安装CUDA Toolkit,确保版本兼容;
配置环境变量(PATH, LD_LIBRARY_PATH);
安装cuDNN,拷贝到CUDA目录;
重启系统;
通过nvidia-smi和nvcc -V确认安装成功。
7. 如何排查GPU驱动安装失败的常见问题?
答案:
驱动版本与内核版本不兼容,需确认匹配;
之前驱动卸载不干净,可能有残留;
Secure Boot开启导致驱动模块无法加载;
系统缺少依赖包或编译工具;
安装过程权限不足;
排查时先查看dmesg日志,确认驱动模块是否加载,重装时建议先彻底清理旧驱动。
8. 什么是 NVIDIA Docker?如何用 Docker 容器运行带 GPU 的程序?
答案:
NVIDIA Docker 是 NVIDIA 提供的容器运行时插件(现在整合为 NVIDIA Container Toolkit),它允许容器访问主机的 GPU 资源。
在使用 Docker 部署 AI 应用时,我们只需安装 nvidia-docker2,并在运行容器时添加:
docker run --gpus all nvidia/cuda:11.8-base nvid


3761

被折叠的 条评论
为什么被折叠?



