面向角色:AI 平台运维工程师 / GPU 集群运维 / MLOps 工程师 / LLMOps 基础设施工程师
适用场景:企业内部 AI 平台建设、GPU 集群管理、大模型训练/推理基础设施运维
第一部分:技能体系全景图

图 1:AI 平台运维工程师十大技能体系全景图
1.1. 十大技能域权重分布
| 技能域 |
权重 |
入门要求 |
精通要求 |
日常占比 |
| Linux 系统与性能调优 |
★★★★★ |
必须 |
核心 |
40% |
| 容器与 Kubernetes 编排 |
★★★★★ |
必须 |
核心 |
35% |
| GPU 基础设施与算力管理 |
★★★★★ |
必须 |
核心 |
30% |
| AI 框架运行环境管理 |
★★★★☆ |
必须 |
重要 |
25% |
| MLOps / LLMOps 平台 |
★★★★☆ |
必须 |
重要 |
25% |
| 分布式存储与高速网络 |
★★★★☆ |
了解 |
重要 |
20% |
| 监控可观测性与告警 |
★★★★☆ |
必须 |
核心 |
25% |
| IaC 与自动化 |
★★★☆☆ |
必须 |
重要 |
20% |
| 安全与合规 |
★★★☆☆ |
了解 |
一般 |
10% |
| 成本优化 FinOps |
★★★☆☆ |
了解 |
重要 |
15% |
第二部分:分阶段学习计划

图 2:AI 平台运维工程师 6 个月学习路线图
总体路线

第一月:基础设施地基(Week 1-4)
目标:建立扎实的 Linux + 网络 + Python 基础,能够独立排查系统级问题
| 周次 |
主题 |
关键技能 |
实践任务 |
| W1 |
Linux 核心 |
进程管理、内存管理、文件系统、systemd |
搭建故障排查实验环境 |
| W2 |
网络基础 |
TCP/IP、DNS、HTTP/2、TLS、抓包分析 |
使用 tcpdump/Wireshark 分析 AI 训练流量 |
| W3 |
Shell + Python |
Bash 脚本、Python 运维自动化、Go 入门 |
编写 GPU 资源监控脚本 |
| W4 |
Git + CI 基础 |
Git 工作流、Docker 基础、Jenkins/GitLab CI |
搭建个人 CI 流水线 |
第二月:容器编排与基础监控(Week 5-8)
目标:掌握 Docker/K8s 核心,能够在 K8s 上部署和管理 AI 工作负载
| 周次 |
主题 |
关键技能 |
实践任务 |
| W5 |
Docker 深入 |
多阶段构建、Dockerfile 优化、镜像安全 |
构建优化的 PyTorch 镜像 |
| W6 |
K8s 核心 |
Pod/Deployment/Service/Ingress/ConfigMap |
部署 JupyterHub 到 K8s |
| W7 |
K8s 调度 |
Scheduler、亲和性、GPU 调度、ResourceQuota |
配置 GPU 工作负载调度策略 |
| W8 |
监控入门 |
Prometheus + Grafana + AlertManager |
搭建 K8s 集群全栈监控 |
第三月:GPU 与 AI 框架纵深(Week 9-12)
目标:深入 GPU 硬件和 AI 框架运行环境,能独立运维 GPU 集群
| 周次 |
主题 |
关键技能 |
实践任务 |
| W9 |
GPU 硬件 |
NVIDIA 架构、CUDA 工具链、NVML API |
使用 nvidia-smi/dcgmi 深入诊断 GPU |
| W10 |
GPU Operator |
NVIDIA GPU Operator、MIG 配置、GPU 共享 |
部署 GPU Operator 并配置 MIG |
| W11 |
多卡训练 |
NCCL、分布式训练拓扑、PyTorch DDP |
手配 4 卡分布式训练环境 |
| W12 |
推理引擎 |
vLLM、TensorRT-LLM、量化技术 |
搭建 vLLM 推理服务 |
第四月:MLOps 平台建设(Week 13-16)
目标:掌握 MLOps/LLMOps 全链路,能搭建企业级 AI 平台
| 周次 |
主题 |
关键技能 |
实践任务 |
| W13 |
实验管理 |
MLflow、W&B、TensorBoard |
搭建 MLflow 实验追踪平台 |
| W14 |
流水线编排 |
Kubeflow Pipelines、Argo Workflows |
构建端到端 ML Pipeline |
| W15 |
模型服务 |
KServe/Triton/BentoML、自动扩缩 |
部署弹性推理服务 |
| W16 |
数据与特征 |
Feast、向量数据库、数据版本管理 |
搭建特征平台 + Milvus |
第五月:存储网络与高级监控(Week 17-20)
目标:掌握 AI 场景专用存储和网络技术,建立高级可观测性
| 周次 |
主题 |
关键技能 |
实践任务 |
| W17 |
分布式存储 |
CephFS/Lustre/ JuiceFS、CSI Driver |
部署 JuiceFS 作为 AI 训练存储 |
| W18 |
高速网络 |
RDMA/RoCE/InfiniBand、Multus CNI |
配置 RDMA 网络用于 NCCL |
| W19 |
高级监控 |
DCGM Exporter、eBPF、分布式追踪 |
搭建 GPU 全维度监控体系 |
| W20 |
日志与追踪 |
Loki/ELK、OpenTelemetry、GPU Trace |
实现训练任务全链路追踪 |
第六月:综合实战与纵深(Week 21-24)
目标:实战企业级 AI 平台运维,建立安全与成本管理体系
| 周次 |
主题 |
关键技能 |
实践任务 |
| W21 |
安全合规 |
RBAC、网络策略、镜像扫描、审计 |
实施 K8s + AI 平台安全加固 |
| W22 |
FinOps |
GPU 成本分析、Spot 实例、资源优化 |
搭建 GPU 成本可视化看板 |
| W23 |
故障演练 |
混沌工程、GPU 故障注入、灾难恢复 |
模拟 GPU 节点宕机自愈 |
| W24 |
综合项目 |
全栈 AI 平台搭建与运维 |
从零搭建可运营的 AI 平台 |
第三部分:推荐学习材料
3.1 核心书籍
| 领域 |
书名 |
作者 |
推荐理由 |
| Linux |
《鸟哥的 Linux 私房菜:基础学习篇》 |
鸟哥 |
最经典的 Linux 入门,运维工程师必读 |
| Linux |
《Linux 性能优化》 |
Brendan Gregg |
系统性能分析的圣经,必读 |
| K8s |
《Kubernetes in Action》 |
Marko Luksa |
K8s 最佳入门书,深入原理 |
| K8s |
《Programming Kubernetes》 |
Michael Hausenblas |
K8s 深入扩展开发 |
| GPU |
《CUDA C++ Programming Guide》 |
NVIDIA 官方 |
CUDA 编程权威参考 |
| GPU |
《Professional CUDA C Programming》 |
John Cheng |
CUDA 高级编程 |
| ML |
《动手学深度学习》 |
李沐 |
最好的深度学习入门,有代码 |
| MLOps |
《Designing Machine Learning Systems》 |
Chip Huyen |
MLOps 系统设计经典 |
| 网络 |
《TCP/IP 详解(卷一)》 |
Stevens |
网络协议基石 |
| SRE |
《SRE: Google 运维解密》 |
Google |
SRE 方法论与实践 |
3.2 在线课程
| 课程 |
平台 |
链接/搜索关键词 |
时长 |
| Linux 性能调优 |
B 站/YouTube |
Brendan Gregg Linux Performance |
10h |
| K8s 从入门到精通 |
B 站 |
Kubernetes 入门实战 尚硅谷 |
20h |
| Certified Kubernetes Administrator |
Udemy/Killer.sh |
CKA 认证课程 Mumshad |
30h |
| deeplearning.ai GPU 专项 |
Coursera |
NVIDIA DLI |
15h |
| PyTorch 深度学习 |
B 站 |
李沐 动手学深度学习 |
40h |
| MLOps 专项课程 |
Coursera |
MLOps Specialization deeplearning.ai |
20h |
| CUDA 编程入门 |
NVIDIA DLI |
Fundamentals of Accelerated Computing |
8h |
| Terraform 入门到精通 |
B 站 |
Terraform 实战 |
10h |
3.3 官方文档必读列表
| 文档 |
链接 |
核心程度 |
| Kubernetes 官方文档 |
kubernetes.io/docs |
★★★★★ |
| NVIDIA GPU Operator 文档 |
docs.nvidia.com/datacenter/cloud-native/gpu-operator |
★★★★★ |
| NVIDIA DCGM 文档 |
docs.nvidia.com/datacenter/dcgm |
★★★★★ |
| NCCL 文档 |
docs.nvidia.com/deeplearning/nccl |
★★★★☆ |
| CUDA Toolkit 文档 |
docs.nvidia.com/cuda |
★★★★☆ |
| vLLM 文档 |
docs.vllm.ai |
★★★★☆ |
| Prometheus 文档 |
prometheus.io/docs |
★★★★☆ |
| Kubeflow 文档 |
kubeflow.org/docs |
★★★★☆ |
| Docker 官方文档 |
docs.docker.com |
★★★☆☆ |
| Helm 文档 |
helm.sh/docs |
★★★☆☆ |
| Terraform 文档 |
developer.hashicorp.com/terraform |
★★★☆☆ |
3.4 开源项目(动手实践)