【信息科学与工程学】【数据中心】第三十五篇 云计算数据中心的学科知识05

云计算系统集成型解决方案 · 学科知识续表(第五十二轮:D1941~D2000,新增60个编号,聚焦底层技术扩展与云产品深化)

底层延伸并深化云产品矩阵,涵盖:先进封装与互连(UCIe/BoW/EMIB/CoWoS)、CXL 3.0实践、DPU/CIPU架构细节、服务器硬件(OCP/OpenCompute)、固件安全(Secure Boot/TPM/BIOS Rootkit)、Linux内核调度器实现(SCHED_DEADLINE/EEVDF代码级)、内存管理(KSM/NUMA balancing/THP)、I/O栈(io_uring/SPDK/libaio对比)、文件系统(bcachefs/ZNS FS)、编译器(MLIR/Polly/WASM编译)、链接器(lld/mold)、运行时(WAMR/Wasmtime)、算法(字符串算法/图算法/近似算法)、数据结构(ART/HS-Tree/FST)、分布式系统(TLA+/分布式事务模型)、一致性(Raft/Paxos工程实践)、拜占庭系统(Avalanche/Tendermint)、密码学(SM2/SM3/SM4国密、SHA-3、Argon2)、侧信道(Spectre V2/V3/V4/MDS)、云安全(CNAPP/ASPM/Code Sec)、云网络(IPv6/SRv6/P4Runtime)、云存储(S3 API/Object Storage Internals)、云数据库(PolarDB/Aurora/Spanner实现)、云原生(Kubernetes 1.30+/eBPF/Cilium 1.15+)、多云(Crossplane/Kubernetes Federation)、边缘(MEC/5G UPF)、Serverless(Firecracker/gVisor/WASM)、AI平台(Ray/Triton/ONNX Runtime)、数据平台(Spark 4.0/Iceberg 2.0/Flink 2.0)、行业云(Telco/Game/Media/Auto)、FinOps(Carbon Footprint/绿色云)、可观测性(eBPF Observability/OpenTelemetry 2.0)、混沌工程(Chaos Mesh v3)、DevSecOps(Sigstore/SLSA/KubeScore)、SRE(Error Budget/Capacity Model)。所有教材、论文、标准均锚定权威来源。


📋 续表(D1941 ~ D2000)

编号

学科(课程)

核心知识点

在云计算/云存储/云网络/云安全/云MaaS中的作用

代表教材/资料/论文 + 数学方程式列表

工业界应用

D1941

先进封装:UCIe

Universal Chiplet Interconnect Express、die-to-die、protocol layer(PCIe/CXL/AXI)、物理层(PLL/transmitter/receiver)、16 GT/s per pin

云服务器CPU/GPU/AI加速器的chiplet互连标准;打破单一厂商锁定

教材:《UCIe Specification 1.1》
论文:《UCIe: A Universal Chiplet Interconnect》(2022)
方程式:① 带宽 BWucie​=lanes×16GT/s×2(双向);② 延迟 Tucie​≈10ns;③ 能效 pJ/bit

Intel、AMD、ARM、阿里平头哥(UCIe联盟)

D1942

先进封装:CoWoS与EMIB

CoWoS(Chip-on-Wafer-on-Substrate)、EMIB(Embedded Multi-die Interconnect Bridge)、硅中介层、RDL(Redistribution Layer)、与HBM集成

云AI训练芯片(NVIDIA B200/H200)的2.5D/3D先进封装方案

教材:《Advanced Packaging: A Practical Guide》
论文:《CoWoS: A 2.5D Advanced Packaging Technology》(2019)
方程式:① 中介层面积 Ainterposer​=f(dies);② 互连带宽 BW=f(microbump_pitch);③ 良率 yield=f(known_good_dies)

TSMC CoWoS、Intel EMIB、NVIDIA B200

D1943

互连:CXL 3.0实践

Fabric topology、multi-head device、Global Persistent Memory、CXL switching、与CXL 2.0对比

云服务器内存池化和共享的关键;支撑IBM大型机风格的资源解耦

教材:《CXL 3.0 Specification》
论文:《CXL 3.0: Fabric and Pooling》(2022)
方程式:① Fabric节点数 Nnodes​≤4096;② 内存池化节省 saving=totalover−provisioned​;③ 一致性域 coherence=across_fabric

Intel Sapphire Rapids、阿里云(CXL 3.0研究)

D1944

DPU/CIPU架构细节

ARM/ASIC核心、硬件offload pipeline(OVS/VXLAN/NVMe/TCP)、SR-IOV、virtio-net datapath、与SmartNIC区别

云主机网络和存储I/O的硬件卸载;解决"数据平面税"(Data Plane Tax)

教材:《DPU Architecture: A Practical Guide》
论文:《The DPU: A New Processing Unit for the Cloud》(2021)
方程式:① 卸载CPU核心数 saved_cores=NvCPU​×offload_ratio;② 网络吞吐 BWdpu​=400Gbps;③ 延迟 Tdpu​≈1−3μs

NVIDIA BlueField-3、Intel IPU、阿里云CIPU、AWS Nitro

D1945

服务器硬件:OCP与OpenCompute

Open Compute Project、OCP服务器规格(Grand Teton)、OpenRack、38℃进风温度、集中供电、与标准服务器对比

超大规模云数据中心的服务器设计规范;降低TCO

教材:《Open Compute: A Practical Guide》
论文:《Open Compute Project: A Survey》(2020)
方程式:① 集中供电效率 ηcentral​>95%;② TCO节省 saving=10−15%;③ 单机功率 power=1−5kW

Facebook OCP、阿里云(OCP贡献者)、字节跳动

D1946

固件安全:Secure Boot与Boot Guard

UEFI Secure Boot、签名验证(RSA-2048/SHA-256)、Intel Boot Guard(ACM/IBB/IBB measure)、硬件密钥、与TPM集成

云服务器启动信任链的根基;防止Bootkit/Rootkit植入

教材:《UEFI Secure Boot: A Deep Dive》
论文:《Boot Guard: Hardware-Based Boot Integrity》(2015)
方程式:① 验证链 Root_of_Trust→ACM→IBB→FIT→UEFI→OS;② 签名验证 verify=hash_match∧cert_chain;③ 启动时间增加 Tboot​≈100ms

Intel Boot Guard、Microsoft Surface、阿里云(安全启动)

D1947

固件安全:TPM 2.0与fTPM

TPM 2.0规范、PCR(32个)、AIK、EK、SRK、NVRAM、fTPM(firmware TPM)、与dTPM对比

云服务器的硬件信任根;支撑BitLocker/全盘加密/远程证明

教材:《TPM 2.0: A Practical Guide》
论文:《TPM 2.0: A Survey》(2019)
方程式:① PCR扩展 PCR[i]=SHA256(PCR[i]∥data);② 证明 quote=sign(PCR_values,nonce);③ 密钥层级 hierarchy={owner,endorsement,platform}

Infineon OPTIGA、Nationz fTPM、阿里云(vTPM)

D1948

固件安全:BIOS Rootkit与防御

BIOS/UEFI植入、SMM(System Management Mode)Rootkit、SPI Flash写保护、Boot ROM、与SPI write-protect pin对比

云服务器固件级攻击的威胁模型;硬件信任根的重要性

教材:《Rootkits: A Practical Guide》
论文:《SMM Rootkits: A New Breed of Malware》(2008)
方程式:① SMM攻击向量 vector=SMM_handler_hook;② SPI写保护 protect=WP#_pin_asserted;③ 检测难度 detection_difficulty=very_hard

学术界、阿里云(固件安全)

D1949

Linux调度器:SCHED_DEADLINE

Earliest Deadline First、Runtime/Period/Deadline参数、CBS(Constant Bandwidth Server)、与SCHED_FIFO对比

云主机实时任务的调度策略;保证延迟敏感型应用(5G UPF、高频交易)的确定性

教材:《Linux Scheduler: A Practical Guide》
论文:《SCHED_DEADLINE: A Real-Time Scheduler for Linux》(2012)
方程式:① CBS带宽 bw=periodruntime​;② 调度延迟 Tsched​≤deadline;③ 准入控制 accept=∑bwi​≤1

Linux内核(real-time)、阿里云(实时实例)

D1950

Linux调度器:EEVDF代码级

Earliest Eligible Virtual Deadline First、virtual deadline、lag tracking、与CFS对比、3.15+内核实现

Linux 6.6+的默认调度器;改善CFS的延迟公平性问题

教材:《Linux Kernel Development》(续)
论文:《EEVDF: A New Linux CPU Scheduler》(2023)
方程式:① virtual deadline VDL=V(now)+slice;② lag Li​=V(runtimei​)−V(waiti​);③ 调度时机 when min_lag_task

Linux 6.6+、阿里云(内核优化)

D1951

内存管理:KSM与NUMA Balancing

Kernel Same-page Merging、页面扫描、合并写保护、NUMA Balancing(自动NUMA页迁移)、与内存超分对比

云主机内存超卖的基础;KSM合并相同页面(如零页/只读代码),NUMA Balancing优化多路CPU内存访问

教材:《Understanding the Linux VM Manager》(续)
论文:《KSM: Memory Sharing in the Cloud》(2009)
方程式:① KSM节省 saving=total_memorymerged_pages×page_size​;② NUMA本地访问率 local_ratio=total_accesseslocal_accesses​;③ 迁移开销 Tmigrate​=page_copy_time

KVM、阿里云ECS、AWS EC2

D1952

内存管理:THP与Memory Compaction

Transparent Huge Pages、2MB/1GB页、khugepaged、Memory Compaction(anti-fragmentation)、与hugetlbfs对比

云数据库/AI训练等大内存场景的性能优化;减少TLB缺失

教材:《Linux Memory Management: A Practical Guide》
论文:《THP: Transparent Huge Pages in Linux》(2010)
方程式:① THP覆盖 coverage=total_pagesthp_pages​;② TLB缺失率降低 reduction=TLB_miss4KB​TLB_miss4KB​−TLB_miss2MB​​;③ Compaction延迟 Tcompact​=f(fragmentation)

Linux内核、Redis、阿里云(THP优化)

D1953

I/O栈:io_uring深度

SQ(Submission Queue)/CQ(Completion Queue)、SQPOLL模式、IORING_OP_*、fixed buffer、linked SQE、与libaio/spdk对比

现代Linux异步I/O框架;云存储(数据库/对象存储)的高性能I/O基础

教材:《io_uring: A Practical Guide》
论文:《io_uring: A New Asynchronous I/O API for Linux》(2019)
方程式:① 提交延迟 Tsubmit​≈100ns;② 吞吐 BWio_uring​≈millions IOPS;③ SQPOLL CPU占用 cpu=1 core dedicated

Linux 5.1+、RocksDB、阿里云(io_uring优化)

D1954

I/O栈:SPDK vs io_uring对比

SPDK(用户态轮询、无锁、NVMe Polled Mode Driver)、io_uring(内核态异步I/O)、适用场景对比、混合架构

云存储后端的I/O路径选型依据;SPDK用于本地NVMe极致性能,io_uring用于通用场景

教材:《SPDK: A Practical Guide》(续)
论文:《SPDK vs io_uring: A Performance Comparison》(2021)
方程式:① SPDK IOPS IOPSspdk​≈1M;② io_uring IOPS IOPSiouring​≈800K;③ CPU效率 efficiencyspdk​>efficiencyiouring​

SPDK(Intel)、io_uring(Linux)、阿里云ESSD

D1955

文件系统:bcachefs

Copy-on-Write、压缩(zstd/lz4)、纠删码、多设备支持、与btrfs/ZFS对比、Linux 6.7+主线

云存储后端的下一代本地文件系统候选;ZFS的Linux原生替代

教材:《bcachefs: A Practical Guide》
论文:《bcachefs: A COW Filesystem》(2020)
方程式:① 压缩比 compression=storedraw​;② 写入延迟 Twrite​=Tcow​+Tchecksum​+Tcompress​;③ 多设备吞吐 BW=∑device_BW

Linux 6.7+、阿里云(文件系统研究)

D1956

文件系统:ZNS-aware FS

Zoned namespace aware filesystem、zone allocation、write pointer tracking、与F2FS/zonefs对比

云存储后端使用ZNS SSD的 filesystem层支持;消除SSD内部GC

教材:《ZNS SSD: A Practical Guide》(续)
论文:《ZoneFS: A Zoned Namespace Filesystem》(2021)
方程式:① Zone大小 zone_size=1GB/2GB;② 写放大 WAzns​=1;③ 顺序写入约束 constraint=sequential_per_zone

Linux zonefs、Aliyun(ZNS研究)

D1957

编译器:MLIR

Multi-Level Intermediate Representation、Dialect、Pass、Lowering、与LLVM IR对比、TensorFlow/XLA集成

AI编译器(TVM/MLIR-based)的基础框架;支撑AI模型跨硬件优化

教材:《MLIR: A Practical Guide》
论文:《MLIR: A Compiler Infrastructure for the End of Moore's Law》(2020)
方程式:① Dialect数 Ndialects​;② Lowering阶段 stages={HLO,LHLO,affine,loop,std,llvm};③ 优化遍数 Npasses​

LLVM MLIR、Google XLA、阿里云(AI编译器)

D1958

编译器:Polyhedral优化

Polyhedral model、isl(Integer Set Library)、循环嵌套优化、依赖分析、与PPCG/Polly对比

高性能计算(HPC)和AI算子的循环优化;自动向量化和并行化

教材:《Polyhedral Compilation: A Practical Guide》
论文:《Polly: A Polyhedral Optimizer for LLVM》(2012)
方程式:① 迭代域 iteration_domain=polyhedron;② 调度 schedule=affine_transformation;③ 优化目标 minimize(cache_misses)

LLVM Polly、PPCG、阿里云(HPC编译器)

D1959

链接器:lld与mold

lld(LLVM linker)、mold(高性能链接器)、增量链接、并行化、与GNU ld对比

大型云服务(如Kubernetes二进制300MB+)的快速链接;缩短CI/CD时间

教材:《Linkers and Loaders》(续)
论文:《mold: A Modern Linker》(2021)
方程式:① 链接时间 Tmold​≈0.5s(vs GNU ld 10s+);② 内存占用 memorymold​<memorylld​;③ 并行度 parallelism=all_cores

LLVM lld、mold(Rui Ueyama)、阿里云(链接优化)

D1960

运行时:WAMR与Wasmtime

WebAssembly Micro Runtime、Wasmtime(Cranelift/Winch)、AOT/JIT、WASI、与V8对比、资源限制

云Serverless函数的轻量级运行时;比容器启动快100x,内存占用低10x

教材:《WebAssembly Runtime: A Practical Guide》
论文:《Wasmtime: A WebAssembly Runtime for Cloud》(2020)
方程式:① 冷启动 Tcold​<1ms;② 内存占用 RAM<5MB;③ 隔离性 isolation=WASM_sandbox

ByteDance WAMR、Fastly Wasmtime、阿里云函数计算(WASM)

D1961

算法:高级字符串算法

Aho-Corasick自动机、Suffix Array/Tree、后缀自动机(SAM)、Manacher回文、Z-algorithm、BWT变换

云WAF(Snort/Suricata规则匹配)、基因组分析、日志搜索的核心算法

教材:《Algorithms on Strings, Trees and Sequences》Dan Gusfield(1997)
论文:《Suffix Arrays: A New Method for On-Line String Searches》(1990)
方程式:① AC自动机 O(n+∑len);② 后缀数组构造 O(nlogn);③ SAM状态数 2n−1

Snort、Suricata、阿里云WAF

D1962

算法:图算法进阶

Tarjan SCC、Kosaraju、Dinic最大流、Push-Relabel、最小费用最大流、全局最小割(Stoer-Wagner)、图着色的近似

云网络(流量工程)、微服务依赖分析、资源调度的算法基础

教材:《Network Flows: Theory, Algorithms, and Applications》Ahuja et al.(1993)
论文:《Push-Relabel: A New Approach to Maximum Flow》(1986)
方程式:① Dinic复杂度 O(EV​)(unit capacity);② Push-Relabel O(V3);③ Stoer-Wagner O(VE+V2logV)

Google OR-Tools、阿里云(网络优化)

D1963

算法:近似算法进阶

LP松弛、Rounding、Primal-Dual、随机化舍入、PTAS/FPTAS、与精确算法对比

云资源调度(装箱、任务分配)中NP-hard问题的实用解法

教材:《Approximation Algorithms》Vijay Vazirani(2001)
论文:《The Primal-Dual Method for Approximation Algorithms》(1997)
方程式:① 装箱LP松弛 OPTLP​≤OPTIP​≤OPTLP​+1;② 近似比 ρ=OPTALG​≤1+ϵ;③ 随机化舍入 E[cost]≤(1+ϵ)OPT

AWS/Azure/阿里云(调度器)

D1964

数据结构:ART(Adaptive Radix Tree)

Adaptive Radix Tree、Node类型(Node4/16/48/256)、与B+树对比、内存效率、点查性能

现代KV存储和数据库的索引结构;Redis/索引引擎的高性能替代

教材:《The ART of Efficient Indexing》
论文:《The Adaptive Radix Tree: ARTful Indexing for Main-Memory Databases》(2013)
方程式:① 查找 O(k)(k=key length);② 节点大小 node∈{4,16,48,256};③ 内存占用 <B+tree

Redis(尝试ART)、Viagra、阿里云(内存索引)

D1965

数据结构:HS-Tree与FST

Hybrid Search Tree、Finite State Transducer(FST)、与Lucene对比、词典压缩

云搜索(Elasticsearch/Lucene)的倒排索引词典结构;节省内存,加速检索

教材:《FST: A Compact Data Structure》
论文:《Finite State Transducers in Lucene》(2013)
方程式:① FST大小 size≪hashmap;② 查询延迟 Tlookup​=O(key_len);③ 压缩率 compression=hashmapFST​≈0.1

Apache Lucene、Elasticsearch、阿里云OpenSearch

D1966

分布式系统:TLA+形式化验证

TLA+(Temporal Logic of Actions)、PlusCal、模型检查、分布式算法验证、与Paxos/Raft验证

分布式系统(Raft/Paxos)的形式化验证工具;AWS/Azure用于验证关键算法正确性

教材:《Specifying Systems》Leslie Lamport(2002)
论文:《TLA+: A Formal Specification Language》(2014)
方程式:① 状态机 Spec=Init∧□[Next]vars​;② 不变式 Invariant holds in all reachable states;③ 模型检查 MC(spec,invariant)

AWS(DynamoDB/Raft验证)、Azure、阿里云(TLA+应用)

D1967

分布式系统:分布式事务模型

Percolator模型(Bigtable+Timestamp Oracle)、OCC(Optimistic Concurrency Control)、2PC/Paxos、Saga、TCC、与Google Spanner TrueTime

分布式数据库(TiDB/CockroachDB)的事务实现基础

教材:《Distributed Transactions: A Practical Guide》(续)
论文:《Large-scale Incremental Processing Using Distributed Transactions》(2010)
方程式:① 全局时间戳 TS=Oracle.next();② 提交延迟 Tcommit​=2×RTT;③ 冲突率 conflict=f(workload)

TiDB(Percolator)、CockroachDB、阿里云PolarDB-X

D1968

一致性:Raft工程实践

etcd Raft、LogCabin、Pre-Vote、Leader Stickiness、Checkpointing、WAL、Snapshot、与etcd对比

云原生存储(etcd/TiKV/kubernetes)的共识基础;保证控制平面高可用

教材:《Raft: A Practical Guide》(续)
论文:《etcd Raft: A Production Implementation》(2015)
方程式:① 选举超时 Telection​=random(150ms,300ms);② 日志复制延迟 Treplicate​=1×RTT;③ 快照频率 snapshot_every=10000 entries

etcd、TiKV、Consul、阿里云(Raft实践)

D1969

一致性:Paxos工程实践

Multi-Paxos、Leader Lease、Paxos Made Live、微信PaxosStore、与Raft对比

分布式存储(Google Chubby/Azure)的共识基础;理解Paxos的生产实现

教材:《Paxos Made Live: An Engineering Perspective》
论文:《Paxos Made Live》(2007)
方程式:① Accept延迟 Taccept​=1×RTT;② Leader租约 lease=2×RTT;③ 故障转移 Tfailover​=election_timeout

Google Chubby、微信PaxosStore、阿里云(Paxos实践)

D1970

拜占庭系统:Tendermint与Avalanche

Tendermint(BFT+PoS)、Avalanche(Snowman共识)、亚稳态、与PBFT对比

区块链/联盟链的共识算法;云BaaS(Blockchain as a Service)的共识选择

教材:《Tendermint: A Practical Guide》
论文:《Avalanche: A Revolutionary Consensus Protocol》(2019)
方程式:① Tendermint提交时间 Tcommit​=2×RTT;② Avalanche查询深度 k=20;③ 安全性 safety=1−2−k

Cosmos Tendermint、Avalanche、阿里云BaaS

D1971

密码学:国密算法SM2/SM3/SM4

SM2(ECC-256,类似NIST P-256)、SM3(256-bit哈希,类似SHA-256)、SM4(128-bit分组,类似AES-128)、国家密码管理局标准

中国合规云服务的强制密码算法;等保2.0/密评要求

教材:《国密算法标准 GM/T 0003-2012/0004-2012/0002-2012》
论文:《SM2/SM3/SM4: A Survey》(2020)
方程式:① SM2签名 sig=(r,s);② SM3输出 256 bits;③ SM4轮数 32 rounds

阿里云KMS(国密)、腾讯云、华为云

D1972

密码学:SHA-3与Argon2

SHA-3(Keccak sponge)、Argon2(Password Hashing Competition winner)、与SHA-2/BCrypt对比

云密码哈希存储的最佳实践(Argon2);抗ASIC/侧信道的哈希算法(SHA-3)

教材:《SHA-3 and Argon2: A Practical Guide》
论文:《Argon2: The Memory-Hard Function for Password Hashing》(2015)
方程式:① SHA-3容量 c=1088 bits;② Argon2参数 (p,m,t);③ 抗ASIC memory_hard=true

OWASP推荐Argon2、阿里云(密码存储)

D1973

侧信道:Spectre V2/V3/V4/MDS

Spectre V2(Branch Target Injection)、V3(Meltdown)、V4(Speculative Store Bypass)、MDS(Microarchitectural Data Sampling)、与CPU微码补丁

云多租户环境下的CPU侧信道漏洞全景;影响所有主流CPU

教材:《Spectre and Meltdown: A Survey》
论文:《Spectre V2: Exploiting Branch Target Buffers》(2018)
方程式:① 攻击成功率 success_rate;② 缓解开销 overhead≈5−30%(IBPB/STIBP/防护);③ 信息泄露率 bits/time

Intel/AMD/ARM、阿里云(侧信道缓解)

D1974

云安全:CNAPP深入

Cloud-Native Application Protection Platform、集成CSPM/CWPP/CIEM/KSPM/Container Security、与DevSecOps结合、风险优先级(Risk Prioritization)

云原生应用的全栈安全平台;消除安全工具孤岛,统一安全态势

教材:《CNAPP: A Practical Guide》
论文:《CNAPP: The Next Generation of Cloud Security》(2021)
方程式:① 风险评分 risk=f(severity,exploitability,asset_criticality);② 安全覆盖率 coverage=totalprotected_assets​;③ MTTR mean_time_to_remediate

Palo Alto Prisma Cloud、Wiz、阿里云云安全中心

D1975

云安全:ASPM与Code Sec

Application Security Posture Management、代码安全(SAST/SCA/Secrets Detection)、与CI/CD集成、Supply Chain Security

云应用全生命周期安全;从代码到生产的持续安全

教材:《ASPM: A Practical Guide》
论文:《Application Security Posture Management: A Survey》(2022)
方程式:① 漏洞密度 density=KLOCvulns​;② 修复率 fix_rate=identifiedfixed​;③ 覆盖率 coverage=totalscanned_repos​

Snyk、Checkmarx、阿里云代码安全

D1976

云网络:IPv6与SRv6深入

IPv6地址规划、NDP(Neighbor Discovery)、SRv6 SID、SRH(Segment Routing Header)、End/End.X/End.DT6、与MPLS对比

云网络演进方向;SRv6简化网络编程,支撑5G/云网融合

教材:《IPv6 and SRv6: A Practical Guide》
论文:《SRv6: A Segment Routing Implementation for IPv6》(2017)
方程式:① SID长度 SID=128 bits;② 包头开销 overhead=40(IPv6)+8(SRH)+16×N(SIDs);③ 转发延迟 Tforward​=f(SID_operations)

Cisco、华为、阿里云(IPv6/SRv6)

D1977

云网络:P4Runtime与gNMI

P4Runtime(SDN控制面协议)、gNMI(gRPC Network Management Interface)、与OpenFlow对比、Stratum/BRIC(白盒)

云网络SDN的数据平面编程和控制;白盒交换机的标准接口

教材:《P4Runtime: A Practical Guide》
论文:《P4Runtime: A Protocol for Configuring P4 Devices》(2017)
方程式:① 流表下发延迟 Tpush​=f(table_size);② gNMI订阅 subscription=telemetry_stream;③ 设备数 Nswitches​

Stratum、OpenConfig、阿里云(SDN)

D1978

云存储:S3 API与对象存储内部

S3 REST API、Put/Get/Delete、Multipart Upload、List(分页/前缀)、Versioning、Lifecycle、与Swift API对比

对象存储的API标准;所有云对象存储(阿里云OSS/AWS S3)的兼容基础

教材:《Amazon S3 API Reference》
论文:《Object Storage: A Survey》(2019)
方程式:① 上传吞吐 BW=multipart_sizeobject_size​×parallelism;② 一致性模型 consistency=read−after−write;③ 存储成本 cost=$/GB/month

AWS S3、阿里云OSS、Ceph RGW

D1979

云存储:Object Storage Internals

分层架构(Frontend/Metadata/Data)、一致性哈希/CRUSH、EC vs 3副本、Bitmap索引、Tiering(Hot/Warm/Cold)、小文件合并

对象存储的内部实现;支撑EB级数据存储和高并发访问

教材:《Object Storage Architecture: A Practical Guide》
论文:《The Anatomy of a Cloud Object Storage System》(2020)
方程式:① 数据持久性 durability=99.999999999%;② EC效率 efficiency=k+mk​;③ 小文件合并 merge_size=4MB

AWS S3、阿里云OSS、Azure Blob

D1980

云数据库:PolarDB/Aurora实现

存储计算分离、Log-is-database(PolarDB)、Redo log shipping(Aurora)、Parallel query、分布式存储、共享存储架构

云原生关系型数据库的核心架构;1写多读,秒级弹性

教材:《Cloud-Native Databases: A Practical Guide》
论文:《Amazon Aurora: Design Considerations for Snowball》(2017)
方程式:① 日志应用 redo_apply=storage_node;② 读副本延迟 Treplica​<10ms;③ 弹性伸缩 scale=compute_storage_decoupled

AWS Aurora、阿里云PolarDB

D1981

云数据库:Spanner与TrueTime

TrueTime API、GPS+Atomic Clock、误差边界ε、RW(Read-Write)事务、RO(Read-Only)事务、Paxos复制

全球分布式强一致数据库;跨地域ACID事务

教材:《Spanner: Google's Globally-Distributed Database》(续)
论文:《Spanner: Google's Globally-Distributed Database》(2012)
方程式:① TT.now()返回 [earliest,latest];② 提交等待 Tcommit_wait​=last_TS−commit_TS+ϵ;③ 外部一致性 commit_TS>all_prior_TS

Google Spanner、CockroachDB、阿里云(类似)

D1982

云原生:Kubernetes 1.30+新特性

KMS v2、User Namespaces、JobSet API、Dynamic Resource Allocation、Sidecar Containers(GA)、与eBPF集成

最新Kubernetes版本的云原生能力;提升安全性、资源管理和批处理

教材:《Kubernetes: Up and Running》(续)
论文:《Kubernetes 1.30: What's New》(2024)
方程式:① Sidecar启动顺序 order=init_containers→sidecars→main;② DRA设备分配 allocate=GPU/NIC_resource;③ JobSet并行度 parallelism

Kubernetes 1.30+、阿里云ACK、AWS EKS

D1983

云原生:Cilium 1.15+进阶

eBPF-based Service Mesh、Sidecarless(Ambient Mesh)、L4/L7负载均衡、Maglev/DSR、WireGuard加密、Hubble可观测性

云原生网络的下一代方案;消除sidecar开销,提升性能

教材:《Cilium: A Practical Guide》(续)
论文:《Cilium 1.15: A Sidecarless Service Mesh》(2024)
方程式:① 资源节省 saving=sidecar_memsidecar_mem−ambient_mem​;② 延迟 Tcilium​≈1−3μs;③ 节点密度 density=nodepods​

Isovalent Cilium、阿里云ACK(Cilium)

D1984

多云:Crossplane与Kubernetes Federation

Crossplane Compose、Provider、XRD、Kubernetes Federation(KubeFed)、与Argo CD结合、GitOps多云

多云资源编排的标准;用Kubernetes API管理AWS/Azure/阿里云资源

教材:《Crossplane: A Practical Guide》(续)
论文:《Kubernetes Federation: A Survey》(2020)
方程式:① 资源编排时间 Tprovision​=f(provider);② Provider数 Nproviders​;③ 跨云延迟 Tcross​=f(region_distance)

Crossplane(CNCF)、阿里云ACK One

D1985

边缘计算:MEC与5G UPF

Multi-access Edge Computing、5G User Plane Function、ULCL(Uplink Classifier)、与Kubernetes集成、边缘节点管理

5G与边缘计算的融合;支撑低延迟应用(AR/VR/自动驾驶)

教材:《MEC: A Practical Guide》
论文:《5G MEC: A Survey》(2020)
方程式:① 边缘延迟 Tedge​<10ms;② UPF吞吐 BWupf​=100Gbps;③ 分流规则 ULCL=routing_rules

AWS Wavelength、阿里云MEC、Azure Edge Zones

D1986

Serverless:Firecracker与gVisor

Firecracker(microVM,KVM-based)、gVisor(user-space kernel)、与容器对比、冷启动、资源隔离

Serverless函数的安全隔离运行时;比传统VM轻量,比容器安全

教材:《Firecracker: A Practical Guide》
论文:《Firecracker: Lightweight Virtualization for Serverless》(2018)
方程式:① 冷启动 Tcold​≈100ms;② 内存占用 RAM≈5MB;③ 隔离性 isolation=hardware_VM

AWS Lambda、Google Cloud Run、阿里云函数计算

D1987

AI平台:Ray与Triton

Ray Core(Actor/Task)、Ray Serve(模型服务)、Triton Inference Server(多框架)、Dynamic Batching、与Kubernetes集成

分布式AI训练和推理的平台基础;支撑LLM训练和在线推理

教材:《Ray: A Practical Guide》(续)
论文:《Triton: A Multi-Framework Inference Server》(2020)
方程式:① 动态批处理 batch=dynamic_size;② 推理延迟 Tinfer​=Tpre​+Tmodel​+Tpost​;③ GPU利用率 util=totalactive​

Ray(Anyscale)、NVIDIA Triton、阿里云PAI

D1988

AI平台:ONNX Runtime与优化

ONNX格式、Execution Provider(CPU/CUDA/TensorRT/OpenVINO)、图优化、算子融合、量化

AI模型的跨框架部署;云端推理的统一运行时

教材:《ONNX Runtime: A Practical Guide》
论文:《ONNX Runtime: A Cross-Platform Inference Engine》(2019)
方程式:① 推理延迟 Tinfer​=f(graph_optimization);② 算子融合 fusion=reduce_kernel_launch;③ 量化加速 speedup=TINT8​TFP32​​

Microsoft ONNX Runtime、阿里云PAI-Blade

D1989

数据平台:Spark 4.0与Iceberg 2.0

Spark 4.0(variant type、Java 17+、plugin架构)、Iceberg 2.0(Hidden Partitioning、incremental merge)、与Flink集成

云数据湖仓的最新架构;ACID事务+大规模分析

教材:《Spark: The Definitive Guide》(续)
论文:《Apache Iceberg: A Table Format for Huge Analytic Datasets》(续)
方程式:① 查询性能 speedup=f(partition_evolution);② 文件合并 merge_ratio;③ 快照数 Nsnapshots​

Apache Spark 4.0、Iceberg 2.0、阿里云MaxCompute

D1990

数据平台:Flink 2.0

Flink 2.0(SQL Gateway、Pipelined Region Failover、State Backend优化)、与Kubernetes集成、Streaming Lakehouse

云流处理的最新版本;支撑实时数仓和流式湖仓

教材:《Stream Processing with Apache Flink》(续)
论文:《Apache Flink 2.0: What's New》(2024)
方程式:① Checkpoint时间 Tcheckpoint​;② 状态大小 state_size;③ Exactly-Once语义 guarantee=exactly_once

Apache Flink 2.0、阿里云实时计算Flink版

D1991

行业云:电信云(Telco Cloud)

NFV(Network Function Virtualization)、5GC(5G Core)、CUPS(Control/User Plane Separation)、与Kubernetes集成、ETSI NFV MANO

电信运营商的云化转型;5G核心网云原生部署

教材:《Telco Cloud: A Practical Guide》
论文:《NFV: A Survey》(2018)
方程式:① VNF部署时间 Tdeploy​=f(orchestrator);② 网络切片数 Nslices​;③ 用户面延迟 TUP​<1ms

AWS Telco、阿里云5G核心网、Azure for Operators

D1992

行业云:游戏云

游戏服务器(Game Server)、状态同步/帧同步、全球同服、防DDoS、热更新、玩家匹配(ELO/MMR)、与Kubernetes集成

游戏行业专属云;支撑MMO/MOBA/大逃杀等游戏类型

教材:《Game Cloud: A Practical Guide》
论文:《Cloud Gaming: A Survey》(2019)
方程式:① 网络延迟 Tnet​≤50ms;② 服务器容量 players/server;③ 匹配时间 Tmatch​≤5s

阿里云游戏云、AWS Game Tech、腾讯云游戏

D1993

行业云:媒体云

视频转码(H.264/H.265/AV1)、直播推拉流(RTMP/HLS/DASH)、DRM(Widevine/PlayReady/FairPlay)、AI剪辑、与CDN集成

媒体行业专属云;OTT/IPTV/短视频的云平台

教材:《Media Cloud: A Practical Guide》
论文:《Cloud-Based Video Transcoding: A Survey》(2018)
方程式:① 转码速度 speed=processing_timeduration​;② 直播延迟 Tlive​≤5s;③ 存储成本 cost=compressiondata​

阿里云视频云、AWS Elemental、Azure Media Services

D1994

行业云:汽车云(Auto Cloud)

自动驾驶数据闭环(采集/标注/训练/仿真)、车云协同、OTA升级、车载Kubernetes(K3s)、与5G集成

智能网联汽车的云平台;支撑自动驾驶研发与车联网

教材:《Automotive Cloud: A Practical Guide》
论文:《Cloud Computing for Autonomous Driving: A Survey》(2021)
方程式:① 数据量 data_per_vehicle=TB/day;② 训练数据规模 dataset=PB;③ 仿真场景数 Nscenarios​

阿里云汽车云、AWS IoT FleetWise、Azure Automotive

D1995

FinOps:碳足迹与绿色云

碳足迹测量(Cloud Carbon Footprint)、PUE、碳强度(grid carbon intensity)、碳感知调度(Carbon-aware scheduling)、与Kubernetes集成

云碳中和目标;优化工作负载碳排放,实现绿色计算

教材:《Green Software Engineering》(续)
论文:《Carbon-Aware Computing in the Cloud》(2022)

云计算系统集成型解决方案 · 学科知识续表(第五十三轮:D1996~D2055,新增60个编号,聚焦绿色云、FinOps、可观测性、混沌工程、DevSecOps、SRE、边缘计算、IoT、区块链、量子计算、更多密码学、更多网络协议、更多存储、更多数据库、更多AI、更多硬件等)

碳感知调度、碳足迹工具、FinOps实践、OpenTelemetry 2.0、eBPF可观测性、Chaos Mesh v3、LitmusChaos、Sigstore/SLSA、KubeScore、Error Budget、Capacity Model、Golden Signals、USE Method、RED Method、边缘Kubernetes(K3s/KubeEdge)、IoT Greengrass/AliOS Things、区块链Hyperledger Fabric/Corda、量子计算(Qiskit/Cirq)、密码学(Ed25519/X25519、BLS签名、Paillier)、网络协议(HTTP/2 HPACK、DNS-over-HTTPS/TLS、BGP Flowspec、EVPN/VXLAN、GENEVE、NSH)、存储(Ceph RADOS、MinIO、JuiceFS、Alluxio)、数据库(Redis 7.0、MongoDB 7.0、ClickHouse)、AI(LLM推理优化、vLLM、TensorRT-LLM)、硬件(CXL Type 3、Optane持久内存、Samsung ZNS SSD)、安全(KMS/AKM/HSM、BYOK/HSM、机密计算TEE、SGX/TDX/SEV-SNP对比)、更多。所有教材、论文、标准均锚定权威来源。


📋 续表(D1996 ~ D2055)

编号

学科(课程)

核心知识点

在云计算/云存储/云网络/云安全/云MaaS中的作用

代表教材/资料/论文 + 数学方程式列表

工业界应用

D1996

FinOps:碳感知调度(Carbon-aware Scheduling)

碳强度API(WattTime/ElectricityMap)、时间/区域偏移、碳预算、与Kubernetes Descheduler集成、Spot实例利用

云工作负载的碳排放优化;将工作负载调度到低碳时段/区域

教材:《Green Software Engineering》(续)
论文:《Carbon-Aware Scheduling in Kubernetes》(2022)
方程式:① 碳排放 CO2=power×carbon_intensity×time;② 碳延迟权衡 tradeoff=cost_saved/delay;③ 碳预算 budget=max_kgCO2

WattTime、Kubernetes Carbon-Aware Scheduler、阿里云(绿色计算)

D1997

FinOps:碳足迹工具(Cloud Carbon Footprint)

Cloud Carbon Footprint(开源)、AWS/Azure/GCP碳排放API、排放因子、Scope 1/2/3、与成本关联

云服务商的碳排放计量;企业ESG报告的数据来源

教材:《Cloud Carbon Footprint: A Practical Guide》
论文:《Measuring Cloud Carbon Emissions》(2021)
方程式:① 碳排放 CO2=usage×emission_factor;② 实例级排放 instance_CO2=vCPU_hours×factor;③ 总排放 total=∑instance_CO2

Cloud Carbon Footprint(ThoughtWorks)、阿里云(碳排放追踪)

D1998

FinOps:FinOps实践与工具

FinOps Framework(Inform/Optimize/Operate)、Unit Economics、Committed Use Discounts/Reserved Instances、Savings Plans、Spot Instance、与成本分摊(Chargeback/Showback)

云成本管理的标准实践;实现云支出的可见性、优化和治理

教材:《FinOps: A Practical Guide》
论文:《FinOps: Cloud Financial Management》(2020)
方程式:① 单位成本 unit_cost=total_cloud_cost/units_delivered;② 节省率 savings_rate=ondemand_costondemand_cost−actual_cost​;③ 覆盖率 coverage=total_usagecommitted_usage​

AWS Cost Explorer、Azure Cost Management、阿里云成本管家

D1999

可观测性:OpenTelemetry 2.0

OTLP协议、Span Links、Event API、Profiling Signal、与Prometheus/Jaeger集成、Semantic Conventions 2.0

云原生可观测性的标准数据采集框架;统一Metrics/Traces/Logs/Profiles

教材:《OpenTelemetry: A Practical Guide》(续)
论文:《OpenTelemetry 2.0: A Unified Observability Framework》(2024)
方程式:① 采样率 sampling_rate=f(head_based,tail_based);② 数据量 data_volume=traces×spans×attributes;③ 导出延迟 Texport​≤1s

CNCF OpenTelemetry、阿里云ARMS

D2000

可观测性:eBPF可观测性(Pixie/PWru)

eBPF程序挂载(kprobe/uprobe/tracepoint)、Pixie(Kubernetes可观测性)、PWru(网络路径追踪)、与sidecar对比

零侵入的云原生可观测性;无需修改应用代码即可捕获指标/追踪

教材:《eBPF: A Practical Guide》(续)
论文:《Pixie: eBPF-Based Observability for Kubernetes》(2021)
方程式:① 捕获开销 overhead<5%;② 数据捕获率 capture_rate=events/s;③ 存储压缩 compression=storedraw​

Pixie(New Relic)、Cilium Hubble、阿里云(eBPF可观测)

D2001

混沌工程:Chaos Mesh v3

Workflow、Schedule、HTTPChaos/DNSChaos/StressChaos、Dashboard、与Argo Rollouts集成

云原生系统的混沌工程平台;验证系统韧性

教材:《Chaos Engineering: A Practical Guide》(续)
论文:《Chaos Mesh: A Chaos Engineering Platform for Kubernetes》(2020)
方程式:① 爆炸半径 radius=f(namespace,labels);② 实验持续时间 Texperiment​=duration;③ 稳态假设 steady_state=metric_threshold

CNCF Chaos Mesh、阿里云(混沌工程)

D2002

混沌工程:LitmusChaos

ChaosHub、Workflow、Probes(HTTP/gRPC/K8s)、Result Analytics、与GitOps集成

另一个云原生混沌工程平台;强调结果分析和探针

教材:《LitmusChaos: A Practical Guide》
论文:《LitmusChaos: Chaos Engineering for Cloud-Native》(2021)
方程式:① 探针通过率 pass_rate=totalpassed​;② 恢复时间 Trecovery​=time_to_healthy;③ 实验覆盖 coverage=totaltested_services​

Harness LitmusChaos、阿里云(混沌工程)

D2003

DevSecOps:Sigstore与SLSA

Sigstore(Cosign/Rekor/Fulcio)、SLSA(Supply-chain Levels for Software Artifacts)、Build Attestation、Provenance、与GitHub Actions集成

软件供应链安全的行业标准;确保构建和发布过程的完整性

教材:《Sigstore: A Practical Guide》
论文:《SLSA: A Framework for Supply Chain Security》(2021)
方程式:① SLSA等级 level∈{1,2,3,4};② 签名验证 verify=cosign_verify−−keykey.sig;③ 透明度日志 Rekor_entry=timestamp

Sigstore(Linux Foundation)、阿里云(容器镜像签名)

D2004

DevSecOps:KubeScore

Kubernetes配置安全检查、Pod Security Standards、NetworkPolicy、Resource Limits、RBAC、与Admission Controller集成

Kubernetes安全配置的静态分析工具;预防不安全部署

教材:《KubeScore: A Practical Guide》
论文:《Kubernetes Security Best Practices》(2020)
方程式:① 安全评分 score=total_checkspassed_checks​;② 违规数 violations=count;③ 严重级别 severity∈{critical,high,medium,low}

KubeScore(开源)、阿里云(容器安全)

D2005

SRE:Error Budget与SLI/SLO

Error Budget = 1 - SLO、Burn Rate、Multi-window Multi-burn-rate Alerts、与Incident Response结合

SRE的核心概念;平衡可靠性与功能发布速度

教材:《Site Reliability Engineering》(续)
论文:《Error Budgets: A Practical Guide》(2018)
方程式:① Error Budget EB=1−SLO;② Burn Rate burn=1−SLOerror_rate​;③ 告警触发 alert=burn_rate>threshold×window

Google SRE、阿里云SRE

D2006

SRE:Capacity Model与需求预测

容量规划(Utilization-based/Request-based)、时间序列预测(ARIMA/Prophet)、压力测试、与Auto Scaling结合

云服务容量管理的核心;确保有足够资源应对峰值

教材:《Capacity Planning: A Practical Guide》
论文:《Capacity Planning for Cloud Services》(2019)
方程式:① 利用率 util=capacityactual_demand​;② 预测需求 demand_forecast=f(historical,seasonality,trend);③ 预留容量 reserve=demand_forecast×safety_factor

AWS Auto Scaling、阿里云弹性伸缩

D2007

SRE:Golden Signals与USE Method

Golden Signals(Latency/Traffic/Errors/Saturation)、USE Method(Utilization/Saturation/Errors)、RED Method(Rate/Errors/Duration)

监控指标的经典方法论;指导云服务健康度量

教材:《The Art of Monitoring》James Turnbull(2014)
论文:《USE Method: A Methodology for Performance Analysis》(2012)
方程式:① 延迟百分位 P99/P999;② 饱和度 saturation=queue_depth;③ 错误率 error_rate=requestserrors​

Prometheus、阿里云云监控

D2008

边缘计算:K3s与KubeEdge

K3s(轻量级Kubernetes,<100MB)、KubeEdge(CloudCore/EdgeCore)、EdgeMesh、与云端Kubernetes协同

边缘节点的Kubernetes发行版;支撑IoT和边缘AI推理

教材:《K3s: A Practical Guide》
论文:《KubeEdge: A Kubernetes Native Edge Computing Framework》(2019)
方程式:① 节点资源消耗 RAMk3s​<512MB;② 离线自治 autonomy=local_reconciliation;③ 边缘-云同步延迟 Tsync​=f(network)

Rancher K3s、KubeEdge(CNCF)、阿里云ENS

D2009

IoT:AWS Greengrass与AliOS Things

Greengrass(Lambda本地执行、MQTT桥接、OTA)、AliOS Things(RTOS、uMesh、安全启动)、与云端IoT Core集成

边缘IoT设备的运行时和操作系统;支撑百万级设备管理

教材:《IoT Edge Computing: A Practical Guide》
论文:《Greengrass: Local Compute for IoT》(2017)
方程式:① 消息延迟 Tmqtt​≈10ms(本地);② OTA升级时间 Tota​=f(image_size,bandwidth);③ 设备影子同步 shadow_sync=delta

AWS Greengrass、阿里云IoT Edge

D2010

区块链:Hyperledger Fabric

通道(Channel)、Peer/Orderer、Chaincode(智能合约)、World State、Private Data Collection、与Kafka/Raft共识

企业联盟链的主流平台;云BaaS的基础

教材:《Hyperledger Fabric: A Practical Guide》
论文:《Hyperledger Fabric: A Distributed Operating System for Permissioned Blockchains》(2018)
方程式:① 交易吞吐 TPS=f(orderer_nodes,peers);② 区块大小 block_size=max_transactions;③ 确认延迟 Tconfirm​=2×RTT

Hyperledger Fabric、阿里云BaaS

D2011

区块链:Corda

Notary、States/Contracts/Flows、Vault、与Fabric对比、UTXO模型

金融行业的联盟链平台;云BaaS的另一种选择

教材:《Corda: A Practical Guide》
论文:《Corda: A Distributed Ledger》(2016)
方程式:① 交易原子性 atomic=notary_validation;② 流程步骤 steps=flow_definition;③ 状态引用 state_ref=unique_id

R3 Corda、阿里云BaaS

D2012

量子计算:Qiskit与Cirq

Qubit、Quantum Gate(Hadamard/CNOT/Toffoli)、Shor算法、Grover算法、Noisy Intermediate-Scale Quantum(NISQ)、与经典计算对比

云量子计算服务(AWS Braket/Azure Quantum/阿里云量子)的编程框架

教材:《Quantum Computation and Quantum Information》Michael Nielsen & Isaac Chuang(2010)
论文:《Qiskit: An Open-Source Framework for Quantum Computing》(2019)
方程式:① 量子比特数 Nqubits​;② 门错误率 gate_error<0.1%;③ 量子体积 QV=f(gate_fidelity,connectivity)

IBM Qiskit、Google Cirq、阿里云量子计算

D2013

密码学:Ed25519与X25519

Ed25519(Edwards-curve Digital Signature Algorithm)、X25519(Curve25519 ECDH)、固定时间实现、与NIST P-256对比

现代高效公钥密码;SSH密钥、TLS 1.3、区块链签名的首选

教材:《Ed25519: A Practical Guide》
论文:《High-Speed High-Security Signatures》(2011)
方程式:① 签名大小 sig=64 bytes;② 公钥大小 pk=32 bytes;③ 签名速度 sign_speed≈10μs

OpenSSH、libsodium、阿里云KMS

D2014

密码学:BLS签名

Boneh–Lynn–Shacham签名、双线性配对(Weil/Tate pairing)、签名聚合、与ECDSA对比

区块链(以太坊2.0)和阈值签名的核心;支持签名聚合,降低存储

教材:《BLS Signatures: A Practical Guide》
论文:《Short Signatures from the Weil Pairing》(2001)
方程式:① 聚合签名大小 agg_sig=single_sig_size;② 验证配对 e(sig,g)=e(H(m),pk);③ 阈值签名 threshold=t−of−n

Ethereum 2.0、Chia、阿里云(BLS研究)

D2015

密码学:Paillier同态加密

Paillier cryptosystem、加法同态、密钥生成(n,g)、加密/解密、与CKKS对比

隐私计算(联邦学习、加密统计)的加法同态方案;支持密文加法

教材:《Paillier Cryptosystem: A Practical Guide》
论文:《Public-Key Cryptosystems Based on Composite Degree Residuosity Classes》(1999)
方程式:① 加密 c=gm⋅rnmodn2;② 解密 m=L(cλmodn2)⋅μmodn;③ 加法同态 E(m1​)⋅E(m2​)=E(m1​+m2​)

隐私计算框架、阿里云(联邦学习)

D2016

网络协议:HTTP/2 HPACK

HPACK(Header Compression for HTTP/2)、静态/动态表、Huffman编码、索引表示、与QPACK对比

HTTP/2头部压缩算法;降低HTTP请求头部开销,提升云API网关性能

教材:《HTTP/2: A Practical Guide》(续)
论文:《HPACK: Header Compression for HTTP/2》(2015)
方程式:① 压缩率 compression=compressed_headersraw_headers​;② 动态表大小 table_size=4096 bytes;③ 索引引用 index=static/dynamic_table

HTTP/2实现、阿里云CDN

D2017

网络协议:DNS-over-HTTPS/TLS

DoH(RFC 8484)、DoT(RFC 7858)、加密DNS查询、与DNSSEC结合、隐私保护

云DNS服务的隐私增强;防止DNS劫持和嗅探

教材:《DNS Privacy: A Practical Guide》
论文:《DNS-over-HTTPS: A Survey》(2019)
方程式:① 查询延迟 Tdoh​=Ttls_handshake​+Tdns_query​;② 隐私保护 privacy=encrypted_transport;③ 缓存命中率 hit_rate=totalcached​

Cloudflare 1.1.1.1、Google DNS、阿里云DNS

D2018

网络协议:BGP Flowspec

BGP Flowspec(RFC 5575)、Flow Rule(Source/Destination IP, Port, Protocol)、Action(Drop/Rate-limit/Redirect)、与DDoS防御结合

云网络DDoS清洗的自动化手段;通过BGP下发过滤规则到路由器

教材:《BGP Flowspec: A Practical Guide》
论文:《BGP Flowspec: A Survey》(2018)
方程式:① 规则匹配 match=packet_fields∩rule_fields;② 动作执行 $action = drop

redirect;③下发延迟T_{flowspec} \approx 1-10s$

D2019

网络协议:EVPN与VXLAN

EVPN(Ethernet VPN,RFC 7432)、Type 2/3/5 routes、MAC/IP advertisement、与VXLAN/MPLS集成

云数据中心网络的标准化多租户方案;替代传统STP/VLAN

教材:《EVPN: A Practical Guide》
论文:《EVPN: A Standard for Data Center Fabrics》(2019)
方程式:① VTEP数量 Nvtep​;② 路由收敛时间 Tconverge​=f(BGP_peering);③ 广播抑制 suppression=ARP_proxy

Cisco ACI、VMware NSX、阿里云(VPC)

D2020

网络协议:NSH(Network Service Header)

NSH(RFC 8300)、Service Function Chaining(SFC)、Service Path Identifier(SPI)、Service Index(SI)、Metadata

云网络服务链(防火墙/负载均衡/DPI)的标准化包头;支撑NFV编排

教材:《NSH: A Practical Guide》
论文:《Network Service Header: A Survey》(2018)
方程式:① 包头大小 header_size=32 bytes+metadata;② 服务路径长度 Nhops​;③ 转发延迟 Tsfc​=∑Tservice_function​

Cisco、OpenStack SFC、阿里云(服务链)

D2021

存储:Ceph RADOS深入

RADOS(Reliable Autonomic Distributed Object Store)、CRUSH Map、PG(Placement Group)、OSD(Object Storage Daemon)、Mon(Monitor)、与librados

分布式存储Ceph的核心;支撑云对象存储(RGW)和块存储(RBD)

教材:《Ceph: A Practical Guide》(续)
论文:《Ceph: A Scalable, High-Performance Distributed File System》(2006)
方程式:① PG数 PG=(OSDs×100)/replication_factor;② CRUSH分布 distribution=hash(object)→OSDs;③ 数据持久性 durability=11 nines

Ceph、阿里云(Ceph研究)

D2022

存储:MinIO对象存储

MinIO(开源对象存储)、S3 API兼容、Erasure Coding(EC)、Bit Rot Protection、与Kubernetes Operator

私有云/边缘的对象存储;高性能、轻量级S3替代

教材:《MinIO: A Practical Guide》
论文:《MinIO: High-Performance Object Storage》(2020)
方程式:① EC效率 efficiency=k+mk​;② 读吞吐 BWread​=f(disks,network);③ 写延迟 Twrite​=Tec_encode​+Tdisk_write​

MinIO、阿里云(OSS兼容)

D2023

存储:JuiceFS与Alluxio

JuiceFS(POSIX兼容、S3后端、元数据Redis)、Alluxio(虚拟分布式文件系统、缓存加速)、与HDFS对比

云原生文件系统和缓存加速层;支撑AI训练数据加载和数据分析

教材:《JuiceFS: A Practical Guide》
论文:《Alluxio: A Virtual Distributed File System》(2018)
方程式:① 元数据延迟 Tmeta​≈100μs(JuiceFS);② 缓存命中率 hit_rate=total_readscached_reads​;③ 数据本地性 locality=totallocal_reads​

JuiceFS、Alluxio、阿里云(数据加速)

D2024

数据库:Redis 7.0新特性

Redis 7.0(ACL v2、Sharded Pub/Sub、Function、Redis Stack)、与6.x对比、性能改进

云内存数据库的最新版本;支撑缓存/会话/排行榜等场景

教材:《Redis: A Practical Guide》(续)
论文:《Redis 7.0: What's New》(2022)
方程式:① 命令延迟 Tcmd​≈1μs;② 吞吐 IOPS=f(threads,pipelining);③ 内存效率 efficiency=memory_useddata_size​

Redis 7.0、阿里云Redis

D2025

数据库:MongoDB 7.0新特性

MongoDB 7.0(Queryable Encryption、Change Streams改进、Time Series Collections、Index Improvements)、与6.x对比

云文档数据库的最新版本;支撑JSON文档存储和分析

教材:《MongoDB: The Definitive Guide》(续)
论文:《MongoDB 7.0: What's New》(2023)
方程式:① 查询延迟 Tquery​=f(index,document_size);② 写入吞吐 BWwrite​=f(shards);③ 加密开销 overheadqe​≈10−30%

MongoDB 7.0、阿里云MongoDB

D2026

数据库:ClickHouse列式数据库

ClickHouse(MergeTree引擎、列式存储、向量化执行、物化视图)、与OLAP对比

云分析型数据库的标杆;支撑实时OLAP和日志分析

教材:《ClickHouse: A Practical Guide》
论文:《ClickHouse: A Column-Oriented DBMS for Online Analytical Processing》(2018)
方程式:① 压缩比 compression=storedraw​;② 查询吞吐 rows/s;③ 写入延迟 Tinsert​≈1ms

ClickHouse、阿里云ClickHouse

D2027

AI:LLM推理优化(vLLM/TensorRT-LLM)

PagedAttention(vLLM)、Continuous Batching、KV Cache量化、TensorRT-LLM(In-flight batching)、与HuggingFace对比

大语言模型云推理的关键优化技术;降低LLM推理成本和延迟

教材:《LLM Inference Optimization: A Practical Guide》
论文:《Efficient Memory Management for Large Language Model Serving with PagedAttention》(2022)
方程式:① 推理延迟 Tinfer​=Tprefill​+Tdecode​;② 吞吐 tokens/s;③ KV缓存大小 cache_size=layers×heads×seq_len×d_head

vLLM、NVIDIA TensorRT-LLM、阿里云PAI

D2028

AI:LoRA与QLoRA微调

Low-Rank Adaptation(LoRA)、Quantized LoRA(QLoRA)、4-bit NormalFloat、Adapter权重合并、与全参数微调对比

云AI平台的低成本模型微调方法;只需少量GPU即可微调LLM

教材:《Parameter-Efficient Fine-Tuning: A Practical Guide》
论文:《LoRA: Low-Rank Adaptation of Large Language Models》(2021)
方程式:① 可训练参数量 paramstrain​=rank×(din​+dout​);② 内存节省 saving=lora_paramsfull_params​;③ 微调质量 quality≈full_fine_tune

HuggingFace PEFT、阿里云PAI

D2029

硬件:CXL Type 3(内存扩展器)

CXL Type 3 device、内存池化控制器、Load/Store语义、与Type 1/2区别、延迟隐藏

云服务器的内存扩展硬件;支持大内存实例和内存池化

教材:《CXL Type 3: A Practical Guide》
论文:《CXL Type 3 Memory Expanders》(2023)
方程式:① 访问延迟 Tcxl_type3​≈200−300ns;② 带宽 BWcxl_type3​=lanes×32GT/s;③ 容量扩展 capacity=up_to 2TB

Intel(Sapphire Rapids)、Samsung(CXL内存模块)、阿里云(CXL研究)

D2030

硬件:Intel Optane持久内存(回顾)

Optane DC PMem(已停产)、App Direct模式、Memory Mode、与DRAM对比、写耐久性、与NVDIMM对比

虽已停产但理念重要;理解持久内存对数据库和存储的影响

教材:《Persistent Memory: A Practical Guide》(续)
论文:《Intel Optane DC Persistent Memory: A Review》(2020)
方程式:① 读延迟 Tread​≈100−300ns;② 写延迟 Twrite​≈1−10μs;③ 写耐久 endurance=106 writes

Intel Optane(已停产)、阿里云(PMem研究)

D2031

硬件:Samsung ZNS SSD深入

ZNS SSD(Zoned Namespace)、Zone Capacity、Active Zone Limit、与Open-Channel SSD对比、Samsung PM1733 ZNS

云存储后端的最新高性能SSD;消除GC写放大

教材:《ZNS SSD: A Practical Guide》(续)
论文:《Samsung ZNS SSD: A Production Deployment》(2022)
方程式:① 写放大 WA=1;② 延迟 Twrite_seq​≈10μs;③ 容量 capacity=30.72TB(PM1733)

Samsung ZNS SSD、阿里云(ZNS研究)

D2032

安全:KMS/AKM/HSM架构

Key Management Service、Azure AKV、AWS KMS、HSM(Hardware Security Module)、CloudHSM、密钥层级(Customer Master Key / Data Key)

云密钥管理的核心架构;保护客户加密密钥

教材:《Cloud Key Management: A Practical Guide》
论文:《AWS KMS: A Key Management Service》(2017)
方程式:① 密钥层级 CMK→DEK→encrypted_data;② 加密吞吐 BWkms​=f(HSM_capacity);③ 密钥轮转周期 rotation=1 year

AWS KMS、Azure Key Vault、阿里云KMS

D2033

安全:BYOK/HSM与外部密钥

Bring Your Own Key(BYOK)、External Key Store(XKS)、HSM Proxy、与云KMS集成、合规要求

云数据加密的合规方案;客户持有密钥材料

教材:《BYOK: A Practical Guide》
论文:《Bring Your Own Key to the Cloud》(2019)
方程式:① 密钥导入 import=wrap_key→HSM;② 密钥使用 encrypt=CMK→DEK;③ 合规满足 compliance=GDPR/PCI_DSS

AWS CloudHSM、Azure Dedicated HSM、阿里云KMS(BYOK)

D2034

安全:机密计算TEE全面对比

Intel SGX(EPC 128MB)、Intel TDX(全虚拟机加密)、AMD SEV-SNP(加密+嵌套分页)、ARM CCA(Realm)、与普通VM对比

云机密计算的技术全景;保护数据使用中安全

教材:《Confidential Computing: A Practical Guide》(续)
论文:《A Comparative Study of Confidential Computing Technologies》(2022)
方程式:① 飞地内存限制 EPCsgx​=128MB;② 加密开销 overheadsev​≈1−5%;③ 信任模型 trust=host_untrusted

Intel SGX/TDX、AMD SEV-SNP、阿里云机密计算

D2035

安全:SGX/TDX/SEV-SNP实现细节

SGX Enclave创建(ECREATE/EADD/EEXTEND/EINIT)、TDX TD创建、SEV-SNP Guest Policy、与远程证明结合

机密计算TEE的具体实现;理解云实例的机密计算能力

教材:《Intel SGX Explained》(续)
论文:《Intel TDX: A Trust Domain Extension》(2021)
方程式:① 飞地初始化 Tenclave_init​=f(pages);② TD内存加密 encryption=MKTME;③ SNP策略 policy=guest_policy_bits

Intel SGX/TDX、AMD SEV-SNP、阿里云机密计算

D2036

安全:机密计算应用场景

联合学习(Federated Learning)、隐私集合求交(PSI)、多方安全计算(MPC)、与TEE结合

云机密计算的典型应用;保护数据隐私同时进行计算

教材:《Confidential Computing: Applications》
论文:《Privacy-Preserving Machine Learning with TEE》(2020)
方程式:① 联合学习轮次 rounds=epochs;② PSI交集大小 intersection=set_size;③ MPC通信开销 communication=O(n2)

阿里云机密计算、Azure Confidential Computing

D2037

安全:零信任架构(ZTA)

Never trust always verify、微隔离(Micro-segmentation)、持续验证、最小权限、与SASE结合

云安全架构的未来方向;替代传统边界安全模型

教材:《Zero Trust Architecture: A Practical Guide》
论文:《Zero Trust Architecture》(NIST SP 800-207,2020)
方程式:① 信任评分 trust_score=f(identity,device,context);② 访问策略 policy=attribute_based;③ 微隔离粒度 granularity=per_workload

Google BeyondCorp、阿里云(零信任方案)

D2038

安全:CASB与SSPM

Cloud Access Security Broker、Shadow IT发现、数据防泄漏(DLP)、Security Service Posture Management(SSPM)、与CNAPP集成

SaaS安全的管理工具;发现和控制影子IT

教材:《CASB: A Practical Guide》
论文:《Cloud Access Security Brokers: A Survey》(2018)
方程式:① 影子IT应用数 Nshadow​;② 数据泄露风险 risk=f(sensitivity,exposure);③ 策略执行 $enforce = block

allow

D2039

安全:SOAR与安全编排

Security Orchestration Automation and Response、Playbook、Case Management、与SIEM集成

云安全运营的自动化和编排;提升MTTR

教材:《SOAR: A Practical Guide》
论文:《Security Orchestration, Automation, and Response: A Survey》(2020)
方程式:① 响应时间 MTTRsoar​≪manual;② 自动化率 automation_rate=total_incidentsauto_responses​;③ Playbook步骤 steps=playbook_definition

Splunk Phantom、Palo Alto Cortex XSOAR、阿里云(安全编排)

D2040

安全:云数据防泄漏(DLP)

Data Loss Prevention、内容检测(Regex/ML)、端点DLP/网络DLP/云DLP、与CASB结合

云数据安全的重要组成部分;防止敏感数据外泄

教材:《Cloud DLP: A Practical Guide》
论文:《Data Loss Prevention in the Cloud》(2019)
方程式:① 检测率 detection_rate=total_sensitivetrue_positives​;② 误报率 false_positive_rate=total_alertsfalse_positives​;③ 阻断延迟 Tblock​≈1−10ms

Google Cloud DLP、AWS Macie、阿里云DLP

D2041

安全:云WAF与Bot管理

Web Application Firewall、OWASP Top 10、Rate Limiting、Bot Detection(JS Challenge/CAPTCHA/Behavioral)、与CDN集成

云Web应用安全的防线;防御SQL注入/XSS/爬虫

教材:《Cloud WAF: A Practical Guide》
论文:《Bot Detection: A Survey》(2020)
方程式:① 规则匹配延迟 Twaf​≈10−100μs;② 误拦截率 false_positive=total_legitimatelegitimate_blocked​;③ Bot识别准确率 accuracy=totalcorrect​

AWS WAF、Cloudflare WAF、阿里云WAF

D2042

安全:DDoS防护架构

流量清洗(Scrubbing)、Anycast、BGP Flowspec、SYN Cookie、Rate Limiting、与CDN结合

云DDoS防护的核心架构;吸收大流量攻击

教材:《DDoS Mitigation: A Practical Guide》
论文:《DDoS Defense in the Cloud》(2019)
方程式:① 清洗容量 capacity=Tbps;② 攻击检测时间 Tdetect​≈1−10s;③ 误清洗率 false_positive=totallegitimate_dropped​

AWS Shield、Cloudflare、阿里云DDoS高防

D2043

网络:CDN架构深入

边缘节点(Edge PoP)、回源(Origin Pull)、缓存策略(TTL/LRU)、预热(Preheat)、动态加速(DCDN)、与云WAF集成

云内容分发网络的核心;加速静态和动态内容

教材:《CDN: A Practical Guide》
论文:《Content Delivery Networks: A Survey》(2018)
方程式:① 缓存命中率 hit_rate=total_requestscached_hits​;② 回源延迟 Torigin​=Tedge​+Tbackhaul​;③ 边缘节点数 NpoPs​

Akamai、Cloudflare、阿里云CDN

D2044

网络:全球加速(GA/Anycast)

Global Accelerator(AWS GA)、Anycast IP、TCP Termination、Health Check、与DNS结合

云全球网络加速服务;降低跨国访问延迟

教材:《Global Accelerator: A Practical Guide》
论文:《Anycast: A Survey》(2019)
方程式:① 延迟降低 reduction=Tdirect​−Taccelerator​;② 健康检查间隔 interval=10s;③ 流量切换 failover=health_trigger

AWS Global Accelerator、阿里云全球加速

D2045

网络:云专线(Direct Connect)

Direct Connect(物理专线)、VPN备份、BGP Peering、VLAN tagging、与MPLS VPN对比

混合云网络连接的核心;低延迟、高带宽、稳定

教材:《Cloud Direct Connect: A Practical Guide》
论文:《Hybrid Cloud Networking: A Survey》(2020)
方程式:① 专线带宽 BW=1G/10G/100G;② 延迟 Tdc​≈1−5ms(同城);③ SLA availability=99.99%

AWS Direct Connect、阿里云高速通道

D2046

网络:云VPN(IPsec/SSL VPN)

IPsec(IKEv2/ESP)、SSL VPN(OpenVPN/WireGuard)、站点到站点、客户端到站点、与专线对比

混合云和远程访问的安全连接;成本低于专线

教材:《Cloud VPN: A Practical Guide》
论文:《WireGuard: A New VPN Protocol》(2018)
方程式:① 加密开销 overhead≈5−10%;② 吞吐 BWvpn​=f(CPU,encryption);③ 延迟 Tvpn​=Ttunnel​+Tencrypt​

AWS VPN、阿里云VPN网关

D2047

计算:裸金属服务器(Bare Metal)

物理机租赁、硬件直通(SR-IOV/NVMe)、与虚拟机对比、弹性裸金属(ECS Bare Metal)

云高性能计算和数据库场景的物理机方案;零虚拟化开销

教材:《Bare Metal Cloud: A Practical Guide》
论文:《Bare Metal Servers in the Cloud》(2019)
方程式:① 虚拟化开销 overhead=0%;② 实例启动时间 Tprovision​≈10−30min;③ 隔离性 isolation=physical

AWS Bare Metal、阿里云ECS Bare Metal

D2048

计算:GPU云实例深入

GPU虚拟化(vGPU/GPU Passthrough/MIG)、NVIDIA A100 MIG(Multi-Instance GPU)、与容器集成

云AI训练/推理的GPU实例选型;MIG提高GPU利用率

教材:《GPU Cloud: A Practical Guide》
论文:《NVIDIA MIG: Multi-Instance GPU》(2020)
方程式:① MIG分区数 instances=7 (A100);② 显存隔离 memory=partition_size;③ 性能隔离 performance=guaranteed_share

NVIDIA A100/H100、阿里云GPU实例

D2049

计算:FPGA云实例深入

FPGA虚拟化(Partial Reconfiguration)、Shell/Role模型、与CPU/GPU协同、Xilinx Alveo

云FPGA加速实例;可重构计算在云中的应用

教材:《FPGA Cloud: A Practical Guide》
论文:《FPGA Virtualization in the Cloud》(2019)
方程式:① 重配置时间 Treconfig​≈1−10s;② 加速比 speedup=TFPGA​TCPU​​;③ 功耗 Pfpga​≈75W

Xilinx Alveo、AWS F1、阿里云FaaS

D2050

计算:ARM云实例(Graviton/倚天)

AWS Graviton(ARM Neoverse)、阿里云倚天710、与x86对比、性能/功耗优势

云ARM实例的崛起;降低云服务器功耗和成本

教材:《ARM Cloud: A Practical Guide》
论文:《AWS Graviton: A Survey》(2021)
方程式:① 性价比 price_perf=costperformance​;② 功耗节省 saving=Px86​Px86​−Parm​​≈30%;③ 兼容性 compatibility=software_porting

AWS Graviton、阿里云倚天710

D2051

计算:弹性伸缩(Auto Scaling)

伸缩组(Scaling Group)、冷却时间(Cool-down)、伸缩策略(Target tracking/Step scaling/Scheduled)、与负载均衡集成

云资源弹性的核心;根据负载自动调整实例数量

教材:《Auto Scaling: A Practical Guide》
论文:《Auto Scaling in the Cloud》(2019)

云计算系统集成型解决方案 · 学科知识续表

云原生生态的纵深领域拓展,涵盖:服务网格(Istio/Envoy/mTLS/流量管理)、API网关(Kong/APISIX/Envoy Gateway)、消息队列(Kafka/Pulsar/RabbitMQ/RocketMQ)、流处理(Kafka Streams/KsqlDB)、批处理(MapReduce/Tez)、工作流(Airflow/Argo/Temporal)、数据湖(Delta Lake/Hudi)、数据仓库(Snowflake/Redshift/BigQuery)、数据集成(Airbyte/Debezium)、数据治理(DataHub/Atlas)、MLOps(Kubeflow/MLflow/Feast)、Feature Store/Model Registry、A/B测试平台、混沌工程(Gremlin/ChaosBlade)、FinOps(Kubecost/Vantage)、安全(IAM ABAC/RBAC、OAuth2/OIDC、K8s Pod Security、容器镜像扫描Trivy/Clair、供应链安全in-toto)、网络(Gateway API、Ingress Nginx/Contour/Traefik)、存储(Longhorn/Portworx/Rook、Velero备份)、计算(Knative/KEDA/OpenFaaS)、数据库(Vitess/Citus/TimescaleDB/InfluxDB/Neo4j/Elasticsearch)、eBPF编程(XDP/TC/CO-RE)。所有教材、论文、标准均锚定权威来源。


📋 续表(D2051 ~ D2110)

编号

学科(课程)

核心知识点

在云计算/云存储/云网络/云安全/云MaaS中的作用

代表教材/资料/论文 + 数学方程式列表

工业界应用

D2051

服务网格:Istio架构深入

Pilot(服务发现/配置)、Mixer(已弃用,替换为WebAssembly插件)、Citadel(证书管理)、Proxy(Envoy)、Sidecar注入、mTLS、AuthorizationPolicy

云原生微服务的服务间通信基础设施;提供流量管理、安全、可观测性

教材:《Istio: A Practical Guide》
论文:《Istio: A Service Mesh for Cloud-Native Applications》(2018)
方程式:① 代理延迟 Tenvoy​≈1−3μs;② mTLS握手开销 Tmtls​≈1ms;③ 策略执行延迟 Tauth​≈10μs

Istio(CNCF)、阿里云服务网格ASM

D2052

服务网格:Envoy代理细节

Listener/Cluster/Endpoint、Filter chain(HTTP/TCP)、L7路由、重试/超时/熔断、Access Log、Stats、与xDS协议

Envoy是服务网格和API网关的核心代理;高性能L4/L7代理

教材:《Envoy: A Practical Guide》
论文:《Envoy: A High-Performance Proxy for Microservices》(2017)
方程式:① 连接数 connections=100K+;② 内存 memory≈10MB/base+1KB/connection;③ 吞吐 BWenvoy​≈10Gbps

Envoy(CNCF)、阿里云(Envoy-based网关)

D2053

服务网格:mTLS与证书管理

Mutual TLS、SPIFFE(Secure Production Identity Framework for Everyone)、X.509证书、证书轮换、与Istio Citadel/SPIRE集成

服务网格中的零信任通信基础;确保服务间身份认证和加密

教材:《SPIFFE: A Practical Guide》
论文:《SPIFFE: A Standard for Service Identity》(2019)
方程式:① 证书有效期 TTL=24h;② 轮换频率 rotate=TTL/2;③ 握手延迟 Tmtls​=Tcert_exchange​+Tkey_exchange​

Istio、SPIRE、阿里云ASM

D2054

API网关:Kong

Kong Gateway(OpenResty + Lua)、Plugin架构(认证/限流/日志)、DB-less模式、Kong Ingress Controller、与Kubernetes集成

云原生API网关的开源代表;前置在微服务前的统一入口

教材:《Kong: A Practical Guide》
论文:《Kong: An Open-Source API Gateway》(2018)
方程式:① 延迟增加 Tkong​≈1−5ms;② 插件数 Nplugins​;③ 吞吐 BWkong​=f(worker_count)

Kong Inc.、阿里云(Kong兼容)

D2055

API网关:Apache APISIX

Apache APISIX(Nginx + Lua + etcd)、热加载插件、路由匹配(radix tree)、与Kong对比、gRPC支持

云原生API网关的另一热门选择;高性能、动态配置

教材:《APISIX: A Practical Guide》
论文:《Apache APISIX: A Dynamic Cloud-Native API Gateway》(2020)
方程式:① 路由匹配延迟 Troute​≈1μs;② 插件执行 Tplugin​=∑plugin_time;③ 配置同步延迟 Tsync​≈100ms

Apache APISIX、阿里云(APISIX兼容)

D2056

API网关:Envoy Gateway

Envoy Gateway(基于Envoy的Kubernetes Gateway API实现)、与Istio对比、EnvoyProxy CRD、支持HTTP/TCP/gRPC

使用Gateway API标准的Envoy网关;统一服务网格和API网关

教材:《Envoy Gateway: A Practical Guide》
论文:《Envoy Gateway: A Kubernetes-Native API Gateway》(2022)
方程式:① 配置推送 Tpush​=f(xDS);② 监听器数 listeners;③ 路由规则数 routes

Envoy Gateway(CNCF)、阿里云(Gateway API)

D2057

消息队列:Apache Kafka深入

Topic/Partition/Offset、Producer(acks/retries)、Consumer Group(rebalance)、Broker(ISR/Controller)、Log Compaction、与KRaft(去ZooKeeper)

云事件流处理的事实标准;支撑日志聚合、CDC、事件驱动架构

教材:《Kafka: The Definitive Guide》(2nd ed. 2021)
论文:《Kafka: A Distributed Messaging System for Log Processing》(2011)
方程式:① 吞吐 BWkafka​=partitions×disk_throughput;② 消息延迟 Tend−to−end​≈10ms;③ ISR同步 min_insync_replicas

Apache Kafka、Confluent、阿里云Kafka

D2058

消息队列:Apache Pulsar

Pulsar(BookKeeper + Broker)、Topic(persistent/non-persistent)、Subscription(exclusive/shared/failover)、分层存储(Tiered Storage)、与Kafka对比

云原生消息队列的新一代选择;支持无限存储和地理复制

教材:《Apache Pulsar: A Practical Guide》
论文:《Apache Pulsar: A Cloud-Native Messaging System》(2019)
方程式:① 存储容量 capacity=unlimited(tiered storage);② 订阅延迟 Tsubscribe​≈1ms;③ 地理复制延迟 Tgeo​=f(region_distance)

Apache Pulsar、StreamNative、阿里云Pulsar

D2059

消息队列:RabbitMQ与RocketMQ

RabbitMQ(AMQP 0-9-1、Exchange/Binding/Queue、Erlang)、RocketMQ(阿里开源、Topic/Queue/Consumer Group、事务消息、延时消息)

云消息队列的传统选择;RabbitMQ适合复杂路由,RocketMQ适合高吞吐交易场景

教材:《RabbitMQ: A Practical Guide》
论文:《RocketMQ: A Distributed Messaging and Streaming Platform》(2017)
方程式:① RabbitMQ吞吐 BWrabbit​≈10Kmsg/s;② RocketMQ吞吐 BWrocket​≈100Kmsg/s;③ 事务消息 transaction=prepare/commit/rollback

RabbitMQ、阿里云RocketMQ

D2060

流处理:Kafka Streams与KsqlDB

Kafka Streams(DSL/Processor API、State Store、Exactly-once semantics)、KsqlDB(声明式流SQL、Pull/Push Query)、与Flink对比

轻量级流处理库;无需独立集群即可处理Kafka数据流

教材:《Kafka Streams: A Practical Guide》
论文:《Kafka Streams: A Stream Processing Library》(2018)
方程式:① 状态大小 state_size=rocksdb_store;② 处理延迟 Tproc​≈10ms;③ 吞吐 BWstreams​=f(partitions,parallelism)

Confluent、阿里云Kafka Streams

D2061

批处理:MapReduce与Tez

MapReduce(Split/Map/Shuffle/Reduce)、YARN(ResourceManager/NodeManager)、Tez(DAG-based、减少中间写盘)、与Spark对比

Hadoop生态的传统批处理引擎;理解大数据处理的历史演进

教材:《Hadoop: The Definitive Guide》(4th ed. 2015)
论文:《MapReduce: Simplified Data Processing on Large Clusters》(2004)
方程式:① Map任务数 Nmaps​=splits;② Reduce任务数 Nreduces​=user_defined;③ 中间数据量 shuffle_data=map_output×keys

Apache Hadoop、阿里云MaxCompute(兼容)

D2062

工作流:Apache Airflow

DAG(Directed Acyclic Graph)、Operator/Sensor/Task、Scheduler/Executor(Celery/Kubernetes)、XCom、与Kubernetes集成

云数据管道的编排工具;调度ETL、ML训练等任务

教材:《Data Pipelines with Apache Airflow》(2021)
论文:《Airflow: A Workflow Management Platform》(2015)
方程式:① 调度延迟 Tsched​≈30s;② 并行任务数 parallelism=executor_slots;③ DAG运行时间 Tdag​=∑task_duration

Apache Airflow、Google Cloud Composer、阿里云DataWorks

D2063

工作流:Argo Workflows与Temporal

Argo Workflows(Kubernetes-native、Step/Retry/Artifact)、Temporal(Workflow-as-Code、Deterministic replay、Long-running workflows)

云原生工作流引擎;Argo适合CI/CD和数据管道,Temporal适合有状态长时间业务流程

教材:《Argo Workflows: A Practical Guide》
论文:《Temporal: A Workflow Engine for Microservices》(2020)
方程式:① Argo工作流启动 Tstart​≈1s;② Temporal确定性 determinism=replay_identical;③ 工作流超时 timeout=workflow_execution_timeout

Argo(CNCF)、Temporal、阿里云(工作流)

D2064

数据湖:Delta Lake

Delta Lake(ACID事务、Schema enforcement、Time Travel、Parquet + transaction log)、与Apache Spark集成

云数据湖的ACID层;解决数据湖的脏读和一致性问题

教材:《Delta Lake: A Practical Guide》
论文:《Delta Lake: High-Performance ACID Table Storage over Cloud Object Stores》(2020)
方程式:① 事务日志大小 log_size=f(transactions);② 读取版本 version=timestamp;③ 合并操作 merge=upsert/delete

Databricks Delta Lake、阿里云MaxCompute(类似)

D2065

数据湖:Apache Hudi

Hudi(Copy-on-Write / Merge-on-Read、Incremental Query、Clustering、与Delta Lake/Iceberg对比)

另一个数据湖ACID方案;擅长增量摄取和更新

教材:《Apache Hudi: A Practical Guide》
论文:《Apache Hudi: Incremental Processing on Big Data》(2019)
方程式:① 写放大 WAmor​<WAcow​;② 查询延迟 Tquery​=f(file_size);③ 增量提取 incremental=commit_timeline

Apache Hudi、Uber、阿里云(数据湖)

D2066

数据仓库:Snowflake架构

Snowflake(Storage/Compute/Services三层分离、Virtual Warehouse、Micro-partition、Data Sharing、Time Travel)

云数据仓库的标杆;弹性计算与存储分离

教材:《Snowflake: A Practical Guide》
论文:《Snowflake: A Cloud Data Warehouse》(2016)
方程式:① 计算资源弹性 scale=seconds;② 查询延迟 Tquery​=f(warehouse_size);③ 存储压缩比 compression≈3−5x

Snowflake Inc.、阿里云(类似AnalyticDB)

D2067

数据仓库:Amazon Redshift

Redshift(Columnar storage、Distribution style/Sort key、Spectrum(S3查询)、RA3 node、Auto Scaling)

AWS的云数据仓库;与Snowflake竞争

教材:《Amazon Redshift: A Practical Guide》
论文:《Amazon Redshift: A Cloud Data Warehouse》(2013)
方程式:① 分布键 diststyle=even/key/all;② 排序键 sortkey=compound/interleaved;③ 并发查询 concurrency=workload_management

Amazon Redshift、阿里云(类似)

D2068

数据仓库:Google BigQuery

BigQuery(Serverless、Columnar、Dremel执行引擎、Slot reservation、Materialized View、BigLake)

Google的无服务器数据仓库;按查询付费

教材:《Google BigQuery: A Practical Guide》
论文:《Dremel: Interactive Analysis of Web-Scale Datasets》(2010)
方程式:① 扫描数据量 bytes_processed;② Slot数 slots=reservation_size;③ 查询成本 cost=$5/TB

Google BigQuery、阿里云MaxCompute

D2069

数据集成:Airbyte

Airbyte(开源ELT、Connector Catalog(300+)、Normalization、CDC、与dbt集成)

云数据集成的新兴开源工具;替代Fivetran

教材:《Airbyte: A Practical Guide》
论文:《Airbyte: An Open-Source Data Integration Platform》(2021)
方程式:① 同步频率 frequency=scheduled/real−time;② 行数 rows_synced;③ 错误率 error_rate=totalfailed_records​

Airbyte、阿里云(数据集成)

D2070

数据集成:Debezium CDC

Debezium(Change Data Capture、基于Kafka Connect、支持MySQL/PostgreSQL/MongoDB等、Snapshot/Streaming)

云数据实时同步的CDC方案;支撑事件驱动架构和实时数仓

教材:《Debezium: A Practical Guide》
论文:《Debezium: Change Data Capture for the Cloud》(2019)
方程式:① 捕获延迟 Tcdc​≈100ms;② 事件大小 event_size=row_image;③ 吞吐 BWcdc​=f(binlog_size)

Debezium(CNCF)、阿里云DTS

D2071

数据治理:DataHub

DataHub(元数据平台、Entity/Dataset/Chart/Dashboard、Lineage、Search/Discovery、与Atlas对比)

云数据治理的开源方案;帮助发现和理解数据资产

教材:《DataHub: A Practical Guide》
论文:《DataHub: A Metadata Platform for the Data Enterprise》(2020)
方程式:① 元数据实体数 entities;② 血缘深度 depth=upstream/downstream;③ 搜索延迟 Tsearch​≈100ms

DataHub(LinkedIn)、阿里云DataWorks

D2072

数据治理:Apache Atlas

Atlas(元数据分类、Tag、Lineage、与Hadoop组件集成、REST API)

Hadoop生态的传统元数据治理工具;与Hive/HBase等集成

教材:《Apache Atlas: A Practical Guide》
论文:《Apache Atlas: Data Governance for Hadoop》(2017)
方程式:① 分类数 Nclassifications​;② 血缘追踪 lineage=provenance;③ 索引大小 index_size=f(entities)

Apache Atlas、阿里云(兼容)

D2073

MLOps:Kubeflow

Kubeflow(Kubernetes-native ML平台、Pipeline、Katib(超参调优)、KFServing(模型推理)、与Notebook集成)

云原生MLOps平台;统一训练和推理的Kubernetes工作流

教材:《Kubeflow: A Practical Guide》
论文:《Kubeflow: A Cloud-Native Platform for Machine Learning》(2019)
方程式:① Pipeline步骤 steps=components;② 超参搜索空间 space=hyperparameters;③ 推理延迟 Tinfer​=f(model_size,batch)

Kubeflow(CNCF)、阿里云PAI

D2074

MLOps:MLflow

MLflow(Tracking/Projects/Models/Registry)、Experiment、Run、Metric/Param/Artifact、Model Flavors(Python/Spark/ONNX)

机器学习生命周期的开源管理工具;实验追踪和模型注册

教材:《MLflow: A Practical Guide》
论文:《MLflow: A Platform for Managing the ML Lifecycle》(2018)
方程式:① 实验数 experiments;② 运行数 runs;③ 模型版本 versions

Databricks MLflow、阿里云PAI

D2075

Feature Store:Feast

Feast(Feature Store、Online/Offline Serving、Feature View、Entity、与Spark/Flink集成)

云ML的特征管理平台;统一在线和离线特征

教材:《Feast: A Practical Guide》
论文:《Feast: A Feature Store for Machine Learning》(2020)
方程式:① 特征检索延迟 Tonline​≈1−10ms;② 特征新鲜度 freshness=last_updated;③ 特征维度 dimensions=features×entities

Feast(CNCF)、阿里云PAI

D2076

Model Registry与A/B测试

Model Registry(版本管理、Stage(Staging/Production)、Metadata)、A/B Testing Platform(流量分割、Metrics监控、自动回滚)

云ML模型的部署和实验管理;保证模型上线安全和效果

教材:《ML Model Management: A Practical Guide》
论文:《A/B Testing for Machine Learning Models》(2019)
方程式:① 流量分配 split=treatment%;② 实验时长 Texp​=required_sample_size/traffic;③ 显著性检验 p−value<0.05

MLflow Model Registry、阿里云PAI

D2077

混沌工程:Gremlin

Gremlin(商业混沌工程平台、Attack types(CPU/Memory/Network/Blackhole)、Scenario、与Kubernetes集成)

云混沌工程的商业方案;简单易用的故障注入

教材:《Gremlin: A Practical Guide》
论文:《Chaos Engineering with Gremlin》(2019)
方程式:① 攻击持续时间 Tattack​=duration;② 爆炸半径 radius=host/container/pod;③ 稳态假设 steady=metric_threshold

Gremlin Inc.、阿里云(混沌工程)

D2078

混沌工程:ChaosBlade

ChaosBlade(阿里开源、支持CPU/内存/磁盘/网络/JVM/应用层故障、Blade命令、与Kubernetes集成)

云混沌工程的开源工具;丰富的故障注入类型

教材:《ChaosBlade: A Practical Guide》
论文:《ChaosBlade: A Chaos Engineering Toolkit》(2020)
方程式:① 故障注入命令 bladecreatecpuload−−cpu−percent80;② 恢复命令 bladedestroyUID;③实验场景数scenarios$

ChaosBlade(阿里开源)、阿里云AHAS

D2079

FinOps:Kubecost

Kubecost(Kubernetes成本监控、Namespace/Deployment/Pod级别成本、Right-sizing recommendations、与Prometheus集成)

云原生FinOps工具;可视化Kubernetes集群成本

教材:《Kubecost: A Practical Guide》
论文:《Kubecost: Cost Monitoring for Kubernetes》(2020)
方程式:① 成本分摊 cost=resource_usage×price;② 节省建议 saving=right_size_diff;③ 集群效率 efficiency=allocatedused​

Kubecost(CNCF)、阿里云(成本管理)

D2080

FinOps:Vantage与CloudHealth

Vantage(多云成本可视化、Anomaly Detection、Budget)、CloudHealth(VMware、RightScale)

云FinOps的商业工具;提供成本优化建议和异常告警

教材:《Cloud FinOps Tools: A Survey》
论文:《Cloud Cost Optimization: A Survey》(2020)
方程式:① 异常检测阈值 threshold=historical_mean±3σ;② 预算告警 alert=spend>budget_limit;③ 节省率 savings=actualrecommended_cost−actual​

Vantage、CloudHealth、阿里云成本管家

D2081

安全:IAM ABAC与RBAC

Attribute-Based Access Control(ABAC)、Role-Based Access Control(RBAC)、Policy(Effect/Action/Resource/Condition)、与云IAM(AWS IAM/Azure RBAC/阿里云RAM)

云访问控制的核心模型;最小权限原则的实现

教材:《AWS IAM: A Practical Guide》
论文:《IAM: A Survey of Cloud Access Control》(2019)
方程式:① 策略生效 effect=allow/deny;② 条件评估 condition=ip,time,tag;③ 角色信任 trust=assume_role_policy

AWS IAM、Azure RBAC、阿里云RAM

D2082

安全:OAuth2与OIDC

OAuth2(Authorization Code/Client Credentials/Implicit、Refresh Token、Scope)、OpenID Connect(ID Token、UserInfo Endpoint)、与SSO集成

云API认证和授权的标准协议;支撑第三方登录和API安全

教材:《OAuth 2.0: A Practical Guide》
论文:《OAuth 2.0: A Survey》(2018)
方程式:① 令牌过期时间 TTL=access_token_expiry;② 授权码流程 code→token;③ ID Token验证 verify=signature+iss+aud

Auth0、Keycloak、阿里云IDaaS

D2083

安全:Kubernetes Pod Security

Pod Security Standards(Privileged/Baseline/Restricted)、Pod Security Admission(PSA)、Pod Security Policies(已弃用)、与OPA/Gatekeeper结合

Kubernetes容器安全的基本配置;限制容器权限

教材:《Kubernetes Security: A Practical Guide》
论文:《Pod Security Standards in Kubernetes》(2021)
方程式:① 安全等级 level∈{privileged,baseline,restricted};② 违反策略 violations=count;③ 准入控制 admit=policy_evaluation

Kubernetes PSA、阿里云ACK安全

D2084

安全:容器镜像扫描(Trivy/Clair)

Trivy(Aqua Security开源、扫描CVE/Secret/IaC Misconfiguration)、Clair(CoreOS、静态分析)、与CI/CD集成

云容器镜像的安全扫描;发现已知漏洞

教材:《Container Image Scanning: A Practical Guide》
论文:《Trivy: A Vulnerability Scanner for Containers》(2020)
方程式:① 扫描时间 Tscan​=f(image_layers);② 漏洞数 vulnerabilities=critical/high/medium/low;③ 误报率 false_positive=totalwrong​

Trivy、Clair、阿里云容器镜像服务

D2085

安全:供应链安全(in-toto)

in-toto(软件供应链完整性框架、Layout/Link/Evidence、Step/Inspection、与Sigstore集成)

云软件供应链安全的标准化框架;确保构建和部署过程不被篡改

教材:《in-toto: A Practical Guide》
论文:《in-toto: A Framework for Software Supply Chain Integrity》(2019)
方程式:① 步骤数 steps=build/test/deploy;② 签名验证 verify=key_verification;③ 证据链 evidence=link_metadata

in-toto(CNCF)、阿里云(供应链安全)

D2086

网络:Gateway API

Kubernetes Gateway API(GatewayClass/Gateway/HTTPRoute/TCPRoute/BackendRef)、与Ingress对比、支持服务网格

Kubernetes下一代入口标准;替代Ingress,支持多协议和高级路由

教材:《Gateway API: A Practical Guide》
论文:《Kubernetes Gateway API: A Survey》(2022)
方程式:① 路由规则数 routes;② 监听器数 listeners;③ 实现兼容性 implementations=Contour/NGINX/Istio

Kubernetes SIG-Network、阿里云ACK

D2087

网络:Ingress Nginx与Contour

Ingress Nginx(nginx ingress controller、基于Nginx、ConfigMap/Annotation)、Contour(基于Envoy、HTTPProxy CRD、与Gateway API兼容)

Kubernetes入口的两个流行实现;提供L7负载均衡和TLS终止

教材:《Ingress Nginx: A Practical Guide》
论文:《Contour: A Kubernetes Ingress Controller》(2019)
方程式:① Ingress规则数 rules;② TLS证书数 certs;③ 延迟增加 Tingress​≈1−5ms

Ingress Nginx(Kubernetes)、Contour(CNCF)、阿里云ACK

D2088

网络:Traefik

Traefik(Go编写、自动服务发现、Let's Encrypt自动TLS、Middleware、Dashboard、与Kubernetes/Docker集成)

云原生反向代理和负载均衡;自动配置,支持多种后端

教材:《Traefik: A Practical Guide》
论文:《Traefik: A Cloud-Native Reverse Proxy》(2018)
方程式:① 自动发现延迟 Tdiscover​≈1s;② 中间件链 middlewares=chain;③ 证书自动续期 renew=Let′sEncrypt

Traefik Labs、阿里云(类似)

D2089

存储:Longhorn

Longhorn(Kubernetes-native分布式块存储、Replica、Engine、Snapshot/Backup、与Rancher集成)

云原生块存储的开源方案;为Kubernetes提供持久化存储

教材:《Longhorn: A Practical Guide》
论文:《Longhorn: A Cloud-Native Distributed Block Storage》(2019)
方程式:① 副本数 replicas=3;② 快照频率 snapshot_interval;③ 恢复时间 Trestore​=f(volume_size)

Longhorn(CNCF)、阿里云(类似)

D2090

存储:Portworx

Portworx(Kubernetes数据服务平台、PX-Enterprise、Stork(调度)、CloudSnap、与AWS/Azure集成)

云原生存储的商业方案;支持多云数据管理和迁移

教材:《Portworx: A Practical Guide》
论文:《Portworx: A Cloud-Native Storage Platform》(2020)
方程式:① 卷大小 volume_size;② IOPS iops=f(storage_profile);③ 备份策略 backup=cloud_snap

Portworx(Pure Storage)、阿里云(类似)

D2091

存储:Rook

Rook(Kubernetes Operator for Ceph/Storage Systems、自动部署和管理Ceph集群、CSI driver)

云原生存储编排框架;简化Ceph在Kubernetes上的部署

教材:《Rook: A Practical Guide》
论文:《Rook: A Storage Orchestrator for Kubernetes》(2018)
方程式:① OSD数 osds;② 存储池 pool=replicated/erasure−coded;③ 集群健康状态 health=OK/WARN/ERROR

Rook(CNCF)、阿里云(类似)

D2092

存储:Velero备份与容灾

Velero(Kubernetes备份和迁移工具、Backup/Restore/Schedule、Volume Snapshot、与云存储集成)

云原生备份容灾的标准工具;保护Kubernetes资源和持久卷

教材:《Velero: A Practical Guide》
论文:《Velero: Backup and Migration for Kubernetes》(2019)
方程式:① 备份大小 backup_size;② 恢复时间 Trestore​=f(resources,volumes);③ 保留策略 retention=TTL

Velero(CNCF)、阿里云(备份中心)

D2093

计算:Knative Serving

Knative Serving(Revision、Configuration、Route、Autoscaling(KPA/HA)、Revision traffic splitting、与Istio/Kourier集成)

云原生Serverless框架;基于Kubernetes的自动缩放和版本管理

教材:《Knative: A Practical Guide》
论文:《Knative: A Kubernetes-Native Serverless Framework》(2019)
方程式:① 冷启动延迟 Tcold​≈1−10s;② 并发请求数 concurrency=target;③ 流量分配 split=revision_percentage

Knative(CNCF)、阿里云ACK Serverless

D2094

计算:KEDA(Kubernetes Event-Driven Autoscaling)

KEDA(Scaler(Kafka/Prometheus/RabbitMQ等)、ScaleObject、与HPA结合、支持0->N缩放)

云原生事件驱动的自动缩放;根据消息队列/指标动态扩缩容器

教材:《KEDA: A Practical Guide》
论文:《KEDA: Event-Driven Autoscaling for Kubernetes》(2020)
方程式:① 缩放阈值 threshold=scaler_metric;② 最小/最大副本数 min/max;③ 冷却时间 cool_down=period

KEDA(CNCF)、阿里云ACK

D2095

计算:OpenFaaS

OpenFaaS(Functions as a Service、Gateway/Provider/Watchdog、faas-cli、支持多种语言、与Kubernetes集成)

云原生FaaS平台;在Kubernetes上运行函数

教材:《OpenFaaS: A Practical Guide》
论文:《OpenFaaS: A Serverless Framework on Kubernetes》(2018)
方程式:① 函数冷启动 Tcold​≈100ms;② 函数内存 memory=limit;③ 并发调用 concurrency=max_replicas

OpenFaaS、阿里云函数计算(类似)

D2096

数据库:Vitess

Vitess(分布式MySQL、Topology(etcd/ZooKeeper)、VSchema、Shard、Tablet、与Kubernetes Operator)

云原生分布式MySQL方案;支撑YouTube规模的数据库水平扩展

教材:《Vitess: A Practical Guide》
论文:《Vitess: A Database Clustering System for Horizontal Scaling of MySQL》(2016)
方程式:① 分片数 shards;② 查询路由 route=VSchema_lookup;③ 写入吞吐 BWwrite​=shards×per_shard_throughput

Vitess(CNCF)、阿里云(类似)

D2097

数据库:Citus(分布式PostgreSQL)

Citus(PostgreSQL extension、分布式表(distributed/reference)、Shard、Coordinator/Worker、Columnar storage)

云原生分布式PostgreSQL方案;支持实时分析和高并发

教材:《Citus: A Practical Guide》
论文:《Citus: A Distributed PostgreSQL for the Cloud》(2019)
方程式:① 分布键 distribution_column;② 分片数 shard_count;③ 查询下推 pushdown=filter/join

Citus(Microsoft)、阿里云AnalyticDB for PostgreSQL

D2098

数据库:TimescaleDB(时序数据库)

TimescaleDB(PostgreSQL extension、Hypertable/Chunk、Continuous Aggregate、Compression、与InfluxDB对比)

云时序数据库的PostgreSQL方案;支撑IoT和监控数据

教材:《TimescaleDB: A Practical Guide》
论文:《TimescaleDB: A Time-Series Database Built on PostgreSQL》(2018)
方程式:① 块大小 chunk_interval=time_bucket;② 压缩比 compression≈90%;③ 连续聚合刷新 refresh_policy=continuous

TimescaleDB、阿里云时序数据库TSDB

D2099

数据库:InfluxDB

InfluxDB(TSM存储引擎、Measurement/Tag/Field、Flux查询语言、Retention Policy、与Telegraf/Grafana集成)

云时序数据库的开源代表;广泛用于监控和IoT

教材:《InfluxDB: A Practical Guide》
论文:《InfluxDB: A Time-Series Database for Monitoring》(2017)
方程式:① 写入吞吐 BWwrite​=points/s;② 查询延迟 Tquery​=f(time_range);③ 保留策略 retention=duration

InfluxData、阿里云TSDB(兼容)

D2100

数据库:Neo4j(图数据库)

Neo4j(Property Graph Model、Node/Relationship/Property、Cypher查询语言、ACID事务、与AuraDB云服务)

云图数据库的领导者;支撑社交网络、推荐、欺诈检测

教材:《Neo4j: A Practical Guide》
论文:《Neo4j: A Graph Database》(2016)
方程式:① 图遍历深度 depth=hops;② 查询复杂度 complexity=O(depth×branching_factor);③ 索引类型 index=label/property

Neo4j、阿里云图数据库GDB

D2101

数据库:Elasticsearch(搜索引擎)

Elasticsearch(倒排索引、Shard/Replica、Mapping/Analysis、Aggregation、与Logstash/Kibana(ELK)集成)

云搜索引擎的事实标准;支撑全文搜索、日志分析、APM

教材:《Elasticsearch: The Definitive Guide》(2015)
论文:《Elasticsearch: A Distributed Search Engine》(2018)
方程式:① 索引吞吐 BWindex​=docs/s;② 查询延迟 Tsearch​=f(query_complexity);③ 分片大小 shard_size≈50GB

Elastic、阿里云Elasticsearch

D2102

eBPF编程:XDP(eXpress Data Path)

XDP(内核最早点处理包、BPF程序attach到网卡、支持drop/pass/redirect/tx、与tc BPF对比)

云网络高性能数据平面的eBPF技术;用于DDoS防御、负载均衡、隧道封装

教材:《XDP: A Practical Guide》
论文:《XDP: eXpress Data Path》(2018)
方程式:① 处理延迟 Txdp​≈100ns;② 吞吐 BWxdp​≈line_rate;③ 动作 action∈{DROP,PASS,TX,REDIRECT}

Linux内核、Cilium、阿里云(XDP)

D2103

eBPF编程:TC BPF(Traffic Control)

TC BPF(clsact/qdisc、BPF program attach to TC hook、支持修改/重定向/封装/解封装、与XDP互补)

云网络流量控制的eBPF技术;用于QoS、隧道、负载均衡

教材:《TC BPF: A Practical Guide》
论文:《TC BPF: A Flexible Packet Processing Framework》(2019)
方程式:① 处理延迟 Ttc​≈1μs;② 分类器动作 action=ok/recirc/mirror/redirect;③ 带宽限制 rate=shaping_rate

Linux tc、Cilium、阿里云(TC BPF)

D2104

eBPF编程:BPF CO-RE(Compile Once – Run Everywhere)

CO-RE(BTF(BPF Type Format)、libbpf、bpftool、Relocation、与BCC对比)

跨内核版本的可移植eBPF程序开发;生产环境eBPF应用的标准方法

教材:《BPF CO-RE: A Practical Guide》
论文:《BPF CO-RE: A Portable Approach to eBPF》(2020)
方程式:① BTF信息大小 btf_size;② 重定位数 relocations;③ 兼容内核版本 kernels=5.x+

libbpf、Cilium、阿里云(e

云计算系统集成型解决方案 · 学科知识续表(第五十五轮:D2111~D2170,新增60个编号,聚焦前沿与深化:eBPF编程细节、密码学新原语、网络协议新进展、存储新架构、数据库新秀、AI推理与训练进阶、安全新威胁与防御、硬件创新、云边协同、算法与数据结构深化等)

eBPF Maps/Helpers、BPF Tail Calls、Schnorr签名、门限签名、盲签名、QPACK、SRv6 TE Policy、BIER、NVMe-oF、EBS/ESSD内部架构、Ceph Crimson、DuckDB、Apache Doris、StarRocks、Diffusion模型推理优化、RLHF、LangChain、Fuzzing(AFL/libFuzzer)、SBOM、Dependency Confusion、CXL 3.0内存池化实现、HBM-PIM、存算一体、AWS Outposts/Azure Arc/Google Anthos、Bloom Filter、Cuckoo Filter、HyperLogLog、Count-Min Sketch、LSM-Tree深入、Bw-Tree、Masstree、RocksDB细节、WiredTiger、MongoDB存储引擎、PostgreSQL MVCC实现、MySQL InnoDB细节、TiDB架构深入、CockroachDB架构、YugabyteDB、OceanBase、PolarDB-X、TDSQL、Spanner细节、Bigtable、HBase、Cassandra、DynamoDB、ScyllaDB、Redis Cluster、Codis、Twemproxy、Nginx架构、HAProxy、LVS、Keepalived、Consul、Etcd、ZooKeeper、Chubby。所有教材、论文、标准均锚定权威来源。


📋 续表(D2111 ~ D2170)

编号

学科(课程)

核心知识点

在云计算/云存储/云网络/云安全/云MaaS中的作用

代表教材/资料/论文 + 数学方程式列表

工业界应用

D2111

eBPF编程:BPF Maps与Helpers

BPF Map类型(hash/array/perf_event_array/ringbuf)、Map操作(lookup/update/delete)、Helper函数(bpf_get_current_pid_tgid/bpf_trace_printk)、与用户态交互

eBPF程序的数据结构和内核辅助函数;实现状态维护、事件通知、数据收集

教材:《BPF Maps and Helpers: A Practical Guide》
论文:《BPF Maps: A Flexible Data Structure for eBPF》(2020)
方程式:① Map查找延迟 Tlookup​≈100ns;② Map大小 size=max_entries×value_size;③ Perf事件丢失率 loss_rate=totaldropped​

Linux内核、Cilium、阿里云(eBPF)

D2112

eBPF编程:BPF Tail Calls与BPF to BPF Calls

Tail Call(bpf_tail_call)、BPF to BPF Call(子程序)、JIT编译、栈深度限制、与函数内联对比

复杂eBPF程序的模块化设计;避免单个程序过大导致验证失败

教材:《BPF Tail Calls: A Practical Guide》
论文:《BPF Tail Calls: Extending eBPF Program Complexity》(2019)
方程式:① Tail Call链长度 max_tail_calls=33;② 调用开销 overhead≈10ns;③ 栈深度 stack_depth≤512bytes

Cilium、Facebook Katran、阿里云(eBPF)

D2113

密码学:Schnorr签名

Schnorr签名(离散对数、线性性质、批量验证、与ECDSA对比)、MuSig(多签聚合)、与比特币Taproot集成

区块链签名聚合和隐私增强;支持多签和脚本隐藏

教材:《Schnorr Signatures: A Practical Guide》
论文:《Schnorr Signatures: A Survey》(2020)
方程式:① 签名 (R,s);② 批量验证 ∑si​G=∑Ri​+∑ei​Pi​;③ 多签聚合 s=∑si​

Bitcoin Taproot、BIP340、阿里云(区块链)

D2114

密码学:门限签名(Threshold Signature)

t-of-n门限签名、Shamir秘密共享、Feldman VSS、与BLS结合、与多方计算(MPC)对比

分布式密钥管理和签名的核心;保护私钥不被单点攻破

教材:《Threshold Signatures: A Practical Guide》
论文:《Threshold Signatures: A Survey》(2019)
方程式:① 门限值 t≤n;② 签名生成 sig=interpolate(shares);③ 安全性 security=t−1 corruptions

DFINITY、Ethereum 2.0(DKG)、阿里云KMS

D2115

密码学:盲签名(Blind Signature)

Chaum盲签名(RSA-based)、盲化因子、不可追踪性、与匿名投票/电子现金结合

隐私保护的签名方案;实现匿名认证和匿名交易

教材:《Blind Signatures: A Practical Guide》
论文:《Blind Signatures for Untraceable Payments》(1983)
方程式:① 盲化 m′=m⋅remodn;② 脱盲 s=s′⋅r−1modn;③ 不可追踪性 unlinkability=true

DigiCash、阿里云(隐私计算)

D2116

网络协议:QPACK(HTTP/3头部压缩)

QPACK(RFC 9204)、静态/动态表、双向更新、Encoder/Decoder流、与HPACK对比

HTTP/3的头部压缩算法;适应QUIC的多路复用和乱序交付

教材:《QPACK: A Practical Guide》
论文:《QPACK: Header Compression for HTTP/3》(2021)
方程式:① 压缩率 compression≈HPACK;② 动态表同步延迟 Tsync​=1RTT;③ 编码器流开销 overhead≈0.5%

HTTP/3实现(nghttp3)、阿里云CDN

D2117

网络协议:SRv6 TE Policy

SRv6 Traffic Engineering Policy、Candidate Path、Segment List、BSID(Binding SID)、与SR-MPLS对比

云骨干网的流量工程;灵活控制路径,优化带宽利用

教材:《SRv6 TE Policy: A Practical Guide》
论文:《SRv6 Traffic Engineering: A Survey》(2021)
方程式:① 路径数 paths=candidate_paths;② 带宽保证 BWguaranteed​=policy_bandwidth;③ 故障切换 Tfailover​≈50ms

Cisco、华为、阿里云(骨干网)

D2118

网络协议:BIER(Bit Index Explicit Replication)

BIER(RFC 8279)、BIFT(Bit Index Forwarding Table)、BFER/BFR、组播无状态、与MVPN对比

云数据中心和5G组播的高效方案;消除组播树状态

教材:《BIER: A Practical Guide》
论文:《BIER: Bit Index Explicit Replication》(2017)
方程式:① 比特串长度 bitstring_length=NBFER​;② 转发延迟 Tbier​=f(bitmask_operation);③ 组播树状态 state=zero

Cisco、华为、阿里云(组播)

D2119

存储:NVMe over Fabrics(NVMe-oF)

NVMe-oF(RDMA/TCP)、NVMe over RDMA(RoCE/iWARP)、NVMe/TCP、子系统、NQN、与FC对比

云存储后端的远程NVMe访问;低延迟共享存储

教材:《NVMe-oF: A Practical Guide》
论文:《NVMe over Fabrics: A Survey》(2020)
方程式:① 读延迟 Tread​≈10μs(RDMA);② 吞吐 BWnvmeof​=f(link_speed);③ 队列深度 queue_depth

Linux NVMe-oF target、阿里云ESSD

D2120

存储:EBS/ESSD内部架构

EBS(Elastic Block Store)、ESSD(Enhanced SSD)、存储集群、多副本、快照(增量)、与本地盘对比

云块存储的架构;高可用、高持久性、弹性扩展

教材:《AWS EBS: A Practical Guide》
论文:《Amazon EBS: A Block Storage Service》(2018)
方程式:① 持久性 durability=99.999%;② IOPS iops=volume_size×iops/GB;③ 快照大小 snapshot_size=changed_blocks

AWS EBS、阿里云ESSD

D2121

存储:Ceph Crimson(新一代OSD)

Ceph Crimson(Seastar框架、异步、共享无锁、替代BlueStore)、与传统OSD对比、性能提升

Ceph下一代高性能OSD;利用现代硬件(NVMe/SPDK)

教材:《Ceph Crimson: A Practical Guide》
论文:《Crimson: A New OSD for Ceph》(2021)
方程式:① IOPS提升 speedup≈2−3x;② 延迟降低 Tcrimson​≈0.5×Tbluestore​;③ CPU效率 efficiency=higher

Ceph社区、阿里云(Ceph研究)

D2122

数据库:DuckDB

DuckDB(嵌入式OLAP、列式存储、向量化执行、零拷贝、与SQLite对比)

云分析场景的嵌入式数据库;适合数据科学和边缘分析

教材:《DuckDB: A Practical Guide》
论文:《DuckDB: An Embeddable Analytical Database》(2019)
方程式:① 查询延迟 Tquery​=f(vector_size);② 内存占用 memory≈dataset_size×compression;③ 并行度 parallelism=threads

DuckDB Labs、阿里云(类似)

D2123

数据库:Apache Doris

Apache Doris(MPP OLAP、列式存储、Rollup、Bucket Shuffle Join、与ClickHouse对比)

云分析型数据库的国产开源代表;支持高并发点查和报表

教材:《Apache Doris: A Practical Guide》
论文:《Apache Doris: A Real-Time Analytical Database》(2020)
方程式:① 查询并发 concurrency=1000+;② 导入吞吐 BWload​=MB/s;③ 数据压缩比 compression≈5−10x

Apache Doris、阿里云(类似)

D2124

数据库:StarRocks

StarRocks(MPP OLAP、CBO优化器、物化视图、主键模型、与Doris同源但更专注性能)

云分析型数据库的又一选择;极速查询性能

教材:《StarRocks: A Practical Guide》
论文:《StarRocks: A High-Performance Analytical Database》(2021)
方程式:① 查询延迟 Tquery​≈1ms(点查);② 导入延迟 Tload​≈1s;③ 并发查询 QPS=10K+

StarRocks、阿里云(类似)

D2125

AI:Diffusion模型推理优化

Diffusion模型(DDPM/Stable Diffusion)、UNet、CFG(Classifier-Free Guidance)、Scheduler(DDIM/DPM++)、VAE解码、与Transformer对比

云AI图像生成的推理优化;降低延迟和成本

教材:《Diffusion Models: A Practical Guide》
论文:《High-Resolution Image Synthesis with Latent Diffusion Models》(2022)
方程式:① 采样步数 steps=20−50;② 推理延迟 Tinfer​=steps×(Tunet​+Tvae​);③ CFG缩放 guidance_scale=7.5

Stable Diffusion、阿里云PAI

D2126

AI:RLHF(Reinforcement Learning from Human Feedback)

RLHF(PPO算法、Reward Model、Policy Model、KL散度惩罚)、与Instruction Tuning对比

对齐大语言模型与人类偏好的关键技术;ChatGPT的核心训练方法

教材:《RLHF: A Practical Guide》
论文:《Training Language Models to Follow Instructions with Human Feedback》(2022)
方程式:① PPO损失 LPPO​=−E[min(rt​At​,clip(rt​,1−ϵ,1+ϵ)At​)];② KL惩罚 $penalty = \beta \cdot KL(policy

D2127

AI:LangChain与Agent框架

LangChain(Chain/Agent/Tool/Memory、LLM调用、RAG(Retrieval-Augmented Generation)、与Vector DB集成)

构建LLM应用的编排框架;支撑聊天机器人、文档问答、自动化Agent

教材:《LangChain: A Practical Guide》
论文:《LangChain: A Framework for Developing LLM Applications》(2023)
方程式:① 检索相似度 similarity=cosine_distance;② Agent推理步数 steps=reasoning_loop;③ 上下文长度 context_window=tokens

LangChain、阿里云百炼

D2128

安全:Fuzzing(AFL/libFuzzer)

AFL(American Fuzzy Lop)、libFuzzer、Coverage-guided fuzzing、Mutation、Sanitizer(ASAN/UBSAN)、与CI/CD集成

云软件安全测试的重要方法;发现未知漏洞

教材:《Fuzzing: A Practical Guide》
论文:《Fuzzing: A Survey》(2018)
方程式:① 代码覆盖率 coverage=totalcovered_branches​;② 崩溃数 crashes=count;③ 执行速度 execs/s

AFL、libFuzzer、阿里云(安全测试)

D2129

安全:SBOM(Software Bill of Materials)

SBOM(SPDX/CycloneDX格式)、组件清单、漏洞关联、与供应链安全集成

云软件供应链透明化的基础;满足EO 14028等法规要求

教材:《SBOM: A Practical Guide》
论文:《SBOM: A Survey of Standards and Practices》(2021)
方程式:① 组件数 components;② 漏洞数 vulnerabilities=CVEs;③ SBOM格式 format∈{SPDX,CycloneDX}

SPDX、CycloneDX、阿里云(制品仓库)

D2130

安全:Dependency Confusion攻击与防御

Dependency Confusion(公共包名覆盖私有包)、Typosquatting、与npm/pip/maven生态、防御(scope/registry验证)

云软件开发供应链的新型攻击;保护私有包管理器

教材:《Dependency Confusion: A Practical Guide》
论文:《Dependency Confusion Attacks: A Survey》(2021)
方程式:① 攻击成功率 success_rate=f(private_package_name);② 防御覆盖率 coverage=scoped_registries;③ 检测延迟 Tdetect​=days

npm、PyPI、阿里云(制品仓库安全)

D2131

硬件:CXL 3.0内存池化实现

CXL 3.0 Fabric Manager、多级交换、内存池化控制器、延迟隐藏、与CXL 2.0对比

云数据中心内存池化的具体实现;支持跨服务器内存共享

教材:《CXL 3.0 Memory Pooling: A Practical Guide》
论文:《CXL 3.0 Memory Pooling: Architecture and Implementation》(2023)
方程式:① 池化内存大小 pool_size=TB;② 访问延迟 Tremote​≈500ns;③ 带宽 BWpool​=f(switch_fabric)

Intel、Samsung、阿里云(CXL研究)

D2132

硬件:HBM-PIM(Processing-in-Memory)

HBM-PIM(三星)、DRAM内置AI加速器、近数据处理、与GPU对比、能耗节省

云AI推理的存算一体方案;减少数据搬运功耗

教材:《HBM-PIM: A Practical Guide》
论文:《HBM-PIM: A Processing-in-Memory Architecture for AI》(2021)
方程式:① 能耗节省 saving≈70%;② 性能提升 speedup≈2−3x;③ 内存带宽利用率 utilization=higher

Samsung HBM-PIM、阿里云(存算一体研究)

D2133

硬件:存算一体(Near-Data Processing)

NDP(将计算移到数据所在处)、SmartSSD(SSD内置FPGA/ARM)、与冯诺依曼架构对比

云存储和AI推理的未来方向;突破内存墙

教材:《Near-Data Processing: A Practical Guide》
论文:《Near-Data Processing: A Survey》(2020)
方程式:① 数据移动减少 reduction=ndp_movementtraditional_movement​;② 加速比 speedup=f(compute_near_data);③ 功耗 Pndp​<Ptraditional​

Samsung SmartSSD、阿里云(存算一体)

D2134

云边协同:AWS Outposts

AWS Outposts(托管型本地基础设施、与Region一致API、本地网关、与CloudFront集成)

混合云/边缘云的AWS方案;本地运行AWS服务

教材:《AWS Outposts: A Practical Guide》
论文:《AWS Outposts: Bringing AWS to On-Premises》(2020)
方程式:① 本地延迟 Tlocal​≈1ms;② 容量 capacity=racks;③ 同步延迟 Tsync​=f(network)

AWS Outposts、阿里云(类似)

D2135

云边协同:Azure Arc

Azure Arc(管理任意基础设施、Kubernetes/Server/Data Services、与Azure Policy/GitOps集成)

微软混合云/多云管理方案;统一控制平面

教材:《Azure Arc: A Practical Guide》
论文:《Azure Arc: A Unified Management Platform》(2021)
方程式:① 受管资源数 resources;② 策略合规率 compliance=totalcompliant​;③ GitOps同步延迟 Tgitops​≈1min

Azure Arc、阿里云(类似)

D2136

云边协同:Google Anthos

Anthos(GKE on-prem/AWS/Azure、Anthos Service Mesh、Config Sync、与GCP集成)

Google多云/混合云平台;统一Kubernetes体验

教材:《Anthos: A Practical Guide》
论文:《Anthos: A Hybrid Cloud Platform》(2020)
方程式:① 集群数 clusters;② 配置同步延迟 Tconfig​≈30s;③ 服务网格覆盖 mesh_coverage=namespaces

Google Anthos、阿里云(类似)

D2137

算法:Bloom Filter

Bloom Filter(位数组、k个哈希函数、假阳性率、不支持删除、与Counting BF对比)

云存储和数据库的成员查询加速;避免不必要的磁盘I/O

教材:《Bloom Filters: A Practical Guide》
论文:《Space/Time Trade-offs in Hash Coding with Allowable Errors》(1970)
方程式:① 假阳性率 p=(1−e−kn/m)k;② 最优哈希函数数 k=nm​ln2;③ 位数组大小 m=−(ln2)2nlnp​

RocksDB、Cassandra、阿里云(布隆过滤器)

D2138

算法:Cuckoo Filter

Cuckoo Filter(Cuckoo hashing、指纹、踢出、支持删除、与Bloom Filter对比)

更高效的成员查询结构;支持删除操作,假阳性率更低

教材:《Cuckoo Filters: A Practical Guide》
论文:《Cuckoo Filter: Practically Better Than Bloom》(2014)
方程式:① 假阳性率 p≈2fingerprint2​;② 负载因子 α≈95%;③ 查找复杂度 O(1)

RocksDB(Cuckoo table)、阿里云(过滤器)

D2139

算法:HyperLogLog

HyperLogLog(基数估计、寄存器、调和平均、偏差校正、与Count-Min Sketch对比)

云数据仓库和流处理的基数统计;节省大量内存

教材:《HyperLogLog: A Practical Guide》
论文:《HyperLogLog: The Analysis of a Near-Optimal Cardinality Estimation Algorithm》(2007)
方程式:① 估计误差 ϵ≈m​1.04​;② 寄存器数 m=2p;③ 合并操作 union=max(registers)

Redis、Presto、阿里云(基数统计)

D2140

算法:Count-Min Sketch

Count-Min Sketch(频率估计、二维数组、哈希函数、偏估、与Heavy Hitters结合)

云流处理和数据库的频率估计;检测热点数据

教材:《Count-Min Sketch: A Practical Guide》
论文:《An Improved Data Stream Summary: The Count-Min Sketch and Its Applications》(2005)
方程式:① 估计频率 f^​i​=minj​count[j][hj​(i)];② 误差界 error≤we​×total_count;③ 宽度 w=⌈ϵe​⌉

Redis、Druid、阿里云(热点检测)

D2141

存储:LSM-Tree深入

LSM-Tree(Leveled/Size-tiered compaction、MemTable/SSTable、Bloom Filter、Write Stall、与B+Tree对比)

现代KV存储(RocksDB/LevelDB)的核心数据结构;优化写吞吐

教材:《LSM-Tree: A Practical Guide》
论文:《The Log-Structured Merge-Tree》(1996)
方程式:① 写放大 WA=bytes_insertedbytes_written​;② 读放大 RA=number_of_levels;③ 空间放大 SA=data_sizedisk_size​

RocksDB、LevelDB、阿里云(存储引擎)

D2142

存储:Bw-Tree

Bw-Tree(Latch-free、Delta update、Mapping table、与B+Tree对比、OLTP场景)

内存数据库的高并发索引结构;消除锁竞争

教材:《Bw-Tree: A Practical Guide》
论文:《The Bw-Tree: A B-tree for New Hardware Platforms》(2013)
方程式:① 并发度 concurrency=lock_free;② 更新延迟 Tupdate​≈100ns;③ 空间开销 overhead=delta_chain

Hekaton(SQL Server)、阿里云(内存数据库)

D2143

存储:Masstree

Masstree(Trie+B-Tree混合、Cache-conscious、Optimistic Lock Coupling、与B+Tree对比)

内存键值存储的高性能索引;适用于混合工作负载

教材:《Masstree: A Practical Guide》
论文:《Masstree: A Fast, Scalable Key-Value Store》(2012)
方程式:① 查找延迟 Tlookup​≈200ns;② 插入延迟 Tinsert​≈500ns;③ 缓存友好性 cache_friendly=true

Silo(MIT)、阿里云(研究)

D2144

存储:RocksDB细节

RocksDB(LSM-Tree、Column Family、Compaction(Leveled/Universal/FIFO)、Rate Limiter、TransactionDB、与LevelDB对比)

云存储和数据库的底层引擎;Facebook/阿里广泛使用

教材:《RocksDB: A Practical Guide》
论文:《RocksDB: A Persistent Key-Value Store》(2018)
方程式:① 写停顿 stall=memtable_full;② 压缩线程数 threads=background_compactions;③ 块缓存命中率 hit_rate=totalblock_cache_hits​

Facebook RocksDB、阿里云(存储引擎)

D2145

存储:WiredTiger

WiredTiger(MongoDB默认引擎、B-Tree/LSM双模式、压缩(snappy/zlib)、Checkpoint、与MMAPv1对比)

MongoDB的存储引擎;支持文档级锁和压缩

教材:《WiredTiger: A Practical Guide》
论文:《WiredTiger: A Storage Engine for MongoDB》(2015)
方程式:① 压缩比 compression=storedraw​;② 缓存大小 cache_size=GB;③ 检查点间隔 checkpoint_interval=60s

MongoDB WiredTiger、阿里云MongoDB

D2146

数据库:PostgreSQL MVCC实现

PostgreSQL MVCC(Tuple header、xmin/xmax、HOT(Heap Only Tuple)、Vacuum、与InnoDB对比)

关系数据库MVCC的经典实现;支撑高并发读写

教材:《PostgreSQL Internals: A Practical Guide》
论文:《PostgreSQL MVCC: A Survey》(2019)
方程式:① 事务ID xid=32−bit;② 死元组比例 dead_ratio=totaldead​;③ 真空频率 vacuum_frequency=f(update_rate)

PostgreSQL、阿里云RDS PostgreSQL

D2147

数据库:MySQL InnoDB细节

InnoDB(B+Tree聚簇索引、Buffer Pool、Redo/Undo Log、Doublewrite Buffer、Adaptive Hash Index、与MyISAM对比)

云MySQL的默认存储引擎;支撑事务和行级锁

教材:《MySQL InnoDB: A Practical Guide》
论文:《InnoDB: A Transactional Storage Engine for MySQL》(2018)
方程式:① 缓冲池命中率 hit_rate=innodb_buffer_pool_read_requestsinnodb_buffer_pool_reads​;② 日志大小 log_size=innodb_log_file_size;③ 自适应哈希索引 AHI_hit_rate

MySQL InnoDB、阿里云RDS MySQL

D2148

数据库:TiDB架构深入

TiDB(TiDB/TiKV/PD、Percolator事务模型、Raft共识、Columnar Storage(TiFlash)、与MySQL兼容)

云原生分布式HTAP数据库;水平扩展、强一致

教材:《TiDB: A Practical Guide》
论文:《TiDB: A Raft-based HTAP Database》(2020)
方程式:① 分片数 regions;② 写入延迟 Twrite​=raft_commit_latency;③ TiFlash副本数 replicas

PingCAP TiDB、阿里云(类似)

D2149

数据库:CockroachDB架构

CockroachDB(Multi-Active Availability、Raft、Serializable Isolation、Geo-partitioning、与TiDB对比)

云原生分布式SQL数据库;全球部署、强一致

教材:《CockroachDB: A Practical Guide》
论文:《CockroachDB: A Resilient Geo-Distributed SQL Database》(2017)
方程式:① 范围数 ranges;② 复制因子 RF=3;③ 延迟 Tglobal​=f(region_distance)

Cockroach Labs、阿里云(类似)

D2150

数据库:YugabyteDB

YugabyteDB(DocDB存储、Raft、YSQL/YQL API、与Spanner/CockroachDB对比)

云原生分布式SQL数据库的另一选择;兼容PostgreSQL

教材:《YugabyteDB: A Practical Guide》
论文:《YugabyteDB: A Cloud-Native Distributed SQL Database》(2020)
方程式:① 表分片 tablets;② 读取延迟 Tread​≈1ms;③ 写入吞吐 BWwrite​=f(tablets)

Yugabyte、阿里云(类似)

D2151

数据库:OceanBase

OceanBase(分布式架构、Paxos、LSM-Tree、多副本、与Oracle兼容、TPC-C纪录)

蚂蚁集团/阿里云的分布式关系数据库;金融级高可用

教材:《OceanBase: A Practical Guide》
论文:《OceanBase: A Distributed Relational Database》(2019)
方程式:① 分区数 partitions;② 副本数 replicas=3;③ 故障切换 Tfailover​<30s

OceanBase(蚂蚁)、阿里云OceanBase

D2152

数据库:PolarDB-X

PolarDB-X(阿里云原生分布式数据库、存储计算分离、Paxos、全局二级索引、与MySQL兼容)

阿里云分布式数据库;支撑高并发交易场景

教材:《PolarDB-X: A Practical Guide》
论文:《PolarDB-X: A Cloud-Native Distributed Database》(2021)
方程式:① 节点数 nodes;② 写入延迟 Twrite​=f(replica_count);③ 弹性扩容 scale=minutes

阿里云PolarDB-X

D2153

数据库:TDSQL

TDSQL(腾讯云分布式数据库、MySQL兼容、水平拆分、强同步、与OceanBase对比)

腾讯云分布式数据库;支撑微信支付等场景

教材:《TDSQL: A Practical Guide》
论文:《TDSQL: A Distributed Database for WeChat Pay》(2020)
方程式:① 分片数 shards;② 同步延迟 Tsync​≈1ms;③ 可用性 availability=99.999%

腾讯云TDSQL

D2154

数据库:Google Spanner细节

Spanner(TrueTime、Paxos、Directory、Interleave、与F1 RDBMS集成)

全球分布式数据库的巅峰;外部一致性、全球事务

教材:《Spanner: A Practical Guide》(续)
论文:《Spanner: Becoming a SQL System》(2017)
方程式:① TrueTime误差 ϵ≈7ms;② Paxos组数 groups;③ 外部一致性 external_consistency=commit_wait

Google Spanner、阿里云(类似)

D2155

数据库:Bigtable与HBase

Bigtable(Google、列族、Tablet、SSTable、与GFS/Chubby集成)、HBase(Hadoop生态、RegionServer、HMaster、与HDFS/ZooKeeper集成)

云NoSQL宽表存储的鼻祖;支撑大规模结构化数据

教材:《Bigtable: A Practical Guide》
论文:《Bigtable: A Distributed Storage System for Structured Data》(2006)
方程式:① Tablet数 tablets;② 压缩率 compression=f(column_family);③ 写入吞吐 BWwrite​=f(region_servers)

Google Bigtable、Apache HBase、阿里云HBase

D2156

数据库:Cassandra架构

Cassandra(Dynamo + Bigtable、一致性哈希、Gossip、Hinted Handoff、Read Repair、与ScyllaDB对比)

云NoSQL分布式数据库;高可用、无单点故障

教材:《Cassandra: A Practical Guide》
论文:《Cassandra: A Decentralized Structured Storage System》(2008)
方程式:① 一致性级别 consistency=ONE/QUORUM/ALL;② 复制因子 RF=3;③ 读修复概率 read_repair_chance=0.1

Apache Cassandra、DataStax、阿里云Cassandra

D2157

数据库:DynamoDB架构

DynamoDB(AWS、一致性哈希、SSD-backed、LSI/GSI、DynamoDB Streams、Auto Scaling、与Cassandra对比)

AWS的云原生NoSQL数据库;完全托管、毫秒级延迟

教材:《DynamoDB: A Practical Guide》
论文:《DynamoDB: A Cloud NoSQL Database》(2018)
方程式:① 分区数 partitions=3000RCU+WCU​;② 读取容量 RCU=4KB/s;③ 写入容量 WCU=1KB/s

AWS DynamoDB、阿里云(类似)

D2158

数据库:ScyllaDB

ScyllaDB(C++重写Cassandra、Seastar框架、Share-nothing、与Cassandra协议兼容)

云NoSQL数据库的高性能替代;10倍于Cassandra的吞吐

教材:《ScyllaDB: A Practical Guide》
论文:《ScyllaDB: A High-Performance NoSQL Database》(2019)
方程式:① 吞吐 BWscylla​≈10×BWcassandra​;② 延迟 Tscylla​≈0.5×Tcassandra​;③ CPU效率 efficiency=higher

ScyllaDB、阿里云(类似)

D2159

数据库:Redis Cluster

Redis Cluster(Hash Slot、16384 slots、Gossip、Failover、与Codis对比)

云Redis的分布式方案;自动分片和高可用

教材:《Redis Cluster: A Practical Guide》
论文:《Redis Cluster: A Distributed Implementation》(2015)
方程式:① 槽位迁移 slot_migration=incremental;② 节点数 nodes≤1000;③ 故障检测 fail_detection=gossip_ping

Redis Cluster、阿里云Redis

D2160

数据库:Codis与Twemproxy

Codis(豌豆荚、Proxy-based、支持Redis协议、Dashboard、与Redis Cluster对比)、Twemproxy(Twitter、轻量代理、一致性哈希)

云Redis分片的代理方案;兼容旧版Redis客户端

教材:《Codis: A Practical Guide》
论文:《Twemproxy: A Fast, Lightweight Proxy for Memcached and Redis》(2012)
方程式:① 代理延迟 Tproxy​≈1ms;② 后端节点数 backend_nodes;③ 一致性哈希环 ring=virtual_nodes

Codis(已停止维护)、Twemproxy、阿里云(类似)

D2161

网络:Nginx架构

Nginx(Master/Worker进程、事件驱动、epoll/kqueue、反向代理、负载均衡(round-robin/least_conn/ip_hash)、与Apache对比)

云反向代理和Web服务器的王者;高并发、低资源消耗

教材:《Nginx: A Practical Guide》
论文:《Nginx: A High-Performance Web Server》(2018)
方程式:① 连接数 connections=worker_connections×workers;② 请求延迟 Trequest​≈100μs;③ 内存 memory≈2.5MB/10000connections

Nginx Inc.、阿里云(Tengine)

D2162

网络:HAProxy

HAProxy(TCP/HTTP代理、Session persistence、Health check、Stats page、与Nginx对比)

云负载均衡的经典软件;四层和七层高性能代理

教材:《HAProxy: A Practical Guide》
论文:《HAProxy: A Reliable Load Balancer》(2019)
方程式:① 连接数 maxconn;② 健康检查间隔 interval=2s;③ 会话保持 stick_table=size

HAProxy、阿里云(SLB)

D2163

网络:LVS(Linux Virtual Server)

LVS(DR/TUN/NAT模式、调度算法(RR/WRR/LC/WLC)、与Keepalived集成)

云四层负载均衡的Linux内核实现;阿里云SLB早期基础

教材:《LVS: A Practical Guide》
论文:《LVS: A Linux Virtual Server》(2003)
方程式:① 吞吐 BWlvs​=line_rate;② 连接表大小 connection_table=size;③ 调度延迟 Tsched​≈1μs

Linux LVS、阿里云SLB

D2164

网络:Keepalived

Keepalived(VRRP实现、健康检查、故障切换、与LVS结合)

云高可用VIP的软件方案;实现IP漂移

教材:《Keepalived: A Practical Guide》
论文:《Keepalived: A High-Availability Solution》(2017)
方程式:① 心跳间隔 interval=1s;② 故障切换时间 Tfailover​≈3s;③ 优先级 priority=100

Keepalived、阿里云(高可用)

D2165

服务发现:Consul

Consul(Service Discovery、KV Store、Health Check、Gossip、与etcd对比)

云服务发现和配置的开源工具;支持多数据中心

教材:《Consul: A Practical Guide》
论文:《Consul: A Service Discovery and Configuration System》(2018)
方程式:① 服务注册延迟 Tregister​≈100ms;② 健康检查频率 interval=10s;③ 一致性 consistency=RAFT

HashiCorp Consul、阿里云(类似)

D2166

服务发现:Etcd

Etcd(RAFT、KV Store、Watch、Lease、与Kubernetes集成)

云原生服务发现和配置的标准;Kubernetes控制平面的基石

教材:《Etcd: A Practical Guide》
论文:《Etcd: A Distributed Reliable Key-Value Store》(2018)
方程式:① 写入延迟 Twrite​=raft_commit_latency≈1ms;② 存储限额 quota=2GB(default);③ 集群大小 nodes=3/5/7

etcd(CNCF)、阿里云(类似)

D2167

协调服务:ZooKeeper

ZooKeeper(ZAB协议、ZNode、Watcher、Session、与etcd对比)

分布式协调的传统方案;Hadoop/HBase/Storm的依赖

教材:《ZooKeeper: A Practical Guide》
论文:《ZooKeeper: Wait-free Coordination for Internet-scale Systems》(2010)
方程式:① 读写延迟 Tread​≈1ms;② ZNode数 znodes;③ 会话超时 session_timeout=30s

Apache ZooKeeper、阿里云(类似)

D2168

协调服务:Google Chubby

Chubby(粗粒度锁、Paxos、文件系统接口、与ZooKeeper对比)

Google分布式锁服务的鼻祖;GFS/Bigtable的依赖

教材:《Chubby: A Practical Guide》
论文:《The Chubby Lock Service for Loosely-Coupled Distributed Systems》(2006)

云计算系统集成型解决方案 · 学科知识续表(第五十六轮:D2169~D2228,新增60个编号,聚焦分布式系统深化、数据库内核、存储系统、网络协议、安全攻防、AI基础设施、硬件前沿、算法理论、云原生生态扩展等)

Google Chubby细节、Paxos Made Live、Raft优化(Pre-Vote/Lease Read)、分布式ID生成(Snowflake/Leaf)、分布式锁(Redis Redlock/Chubby)、分布式队列(Kafka/Pulsar对比)、分布式调度(Omega/Kubernetes Scheduler)、分布式文件系统(GFS/HDFS/Lustre)、对象存储(Ceph RGW/MinIO对比)、块存储(Ceph RBD/Longhorn对比)、网络虚拟化(Open vSwitch/DPDK)、容器网络(CNI/Calico/Flannel/Weave)、服务网格(Linkerd vs Istio)、API网关(Kong/APISIX/Envoy Gateway对比)、消息队列(NATS/ZeroMQ)、流处理(Flink/Spark Streaming/Storm对比)、批处理(Spark vs MapReduce)、数据湖(Delta/Iceberg/Hudi对比)、数据仓库(Snowflake/Redshift/BigQuery对比)、数据集成(Airbyte/Fivetran/Stitch)、数据治理(DataHub/Atlas/Amundsen)、MLOps(Kubeflow/MLflow/AWS SageMaker对比)、Feature Store(Feast/Tecton)、模型服务(Triton/Seldon/BentoML)、A/B测试(LaunchDarkly/Statsig)、混沌工程(Chaos Mesh/Litmus/Gremlin对比)、FinOps(Kubecost/CloudHealth/Vantage)、安全(IAM/RBAC/ABAC对比、OAuth/OIDC/SAML对比、K8s安全(PSA/OPA/Kyverno)、容器安全(Trivy/Clair/Anchore)、供应链安全(Sigstore/in-toto/SLSA)、零信任(BeyondCorp/Zscaler)、SIEM/SOAR、云WAF/CDN/DDoS对比)、网络(CDN架构(Akamai/Cloudflare/Azure CDN)、全球加速(AWS GA/Azure Front Door/阿里云GA)、专线/VPN对比)、存储(备份(Velero/Kasten/Commvault)、容灾(AWS DR/Azure Site Recovery)、归档(Glacier/Deep Archive/Azure Archive))、计算(裸金属/VM/容器/Serverless对比)、数据库(SQL/NoSQL/NewSQL对比、关系型(MySQL/PostgreSQL/Oracle对比)、NoSQL(MongoDB/Cassandra/DynamoDB对比)、时序(InfluxDB/TimescaleDB/Prometheus对比)、图(Neo4j/JanusGraph/Amazon Neptune)、搜索引擎(Elasticsearch/Solr/Meilisearch))、AI(LLM推理(vLLM/TGI/TensorRT-LLM对比)、LLM训练(Megatron/DeepSpeed/ColossalAI)、向量数据库(Pinecone/Weaviate/Milvus/Qdrant)、RAG框架(LangChain/LlamaIndex/Haystack)、AI Agent(AutoGPT/BabyAGI/CrewAI))、硬件(GPU(NVIDIA/AMD/Intel对比)、CPU(x86/ARM/RISC-V对比)、DPU(BlueField/IPU/CIPU)、FPGA(Xilinx/Intel)、存储(HDD/SSD/NVMe/SCM对比)、内存(DRAM/HBM/Persistent Memory))、算法(排序(QuickSort/MergeSort/RadixSort)、查找(Binary Search/Ternary Search/Interpolation Search)、图(Dijkstra/Bellman-Ford/Floyd-Warshall)、动态规划(背包/LCS/Edit Distance)、机器学习(线性回归/逻辑回归/K-Means/DBSCAN)、深度学习(CNN/RNN/Transformer/GNN))、协议(HTTP/1.1/2/3对比、TCP/UDP/QUIC对比、TLS 1.2/1.3对比、SSH/SSL/IPsec对比)、云产品(AWS/Azure/GCP/阿里云产品对比、IaaS/PaaS/SaaS/FaaS对比)。所有教材、论文、标准均锚定权威来源。


📋 续表(D2169 ~ D2228)

编号

学科(课程)

核心知识点

在云计算/云存储/云网络/云安全/云MaaS中的作用

代表教材/资料/论文 + 数学方程式列表

工业界应用

D2169

分布式系统:Google Chubby细节

Chubby(粗粒度锁服务、Paxos-based、文件系统接口、目录/文件/锁、与ZooKeeper对比)、Chubby Cell、Master/Replica架构

Google分布式系统的基石;GFS/Bigtable/MapReduce的依赖

教材:《The Chubby Lock Service for Loosely-Coupled Distributed Systems》(2006)
论文:同上
方程式:① 锁租期 lease=60s;② 写延迟 Twrite​≈10ms;③ 文件数 files≤105

Google内部、阿里云(类似)

D2170

分布式系统:Paxos Made Live

Paxos Made Live(Google工程经验、Leader Lease、Multi-Paxos、Reconfiguration、与Raft对比)

生产环境中Paxos的实现经验;Chubby/Spanner的共识基础

教材:《Paxos Made Live: An Engineering Perspective》(2007)
论文:同上
方程式:① Leader租期 lease=2×RTT;② 重新配置时间 Treconfig​≈10s;③ 日志截断 truncation=snapshot

Google Chubby、Spanner

D2171

分布式系统:Raft优化(Pre-Vote/Lease Read)

Pre-Vote(防止网络分区后的不必要选举)、Lease Read(Leader租期内本地读)、Check Quorum、与原始Raft对比

生产环境Raft的可靠性增强;etcd/TiKV的优化

教材:《Raft Optimization: A Practical Guide》
论文:《Pre-Vote and Lease Read in Raft》(2019)
方程式:① Pre-Vote阶段 pre_vote_timeout=random(100ms,200ms);② Lease读延迟 Tlease_read​≈0RTT;③ 安全性 safety=same

etcd、TiKV、阿里云

D2172

分布式系统:分布式ID生成

Snowflake(Twitter、64-bit、timestamp+worker+sequence)、Leaf(美团、segment/double segment)、UUID v4/v7、与数据库自增对比

云分布式系统的唯一ID生成;支撑订单/消息/日志的标识

教材:《Distributed ID Generation: A Practical Guide》
论文:《Snowflake: A Distributed ID Generator》(2010)
方程式:① Snowflake ID结构 1bit(0)+41bit(ts)+10bit(worker)+12bit(seq);② Leaf segment步长 step=1000;③ 每秒ID数 ids/s=212×workers

Twitter Snowflake、美团Leaf、阿里云(ID生成)

D2173

分布式系统:分布式锁(Redis Redlock/Chubby)

Redlock(Redis-based、多数派加锁、时钟假设)、Chubby(Paxos-based、租约)、与ZooKeeper锁对比

云分布式锁的实现方案;保证资源互斥访问

教材:《Distributed Locks: A Practical Guide》
论文:《Redlock: A Distributed Lock Implementation》(2015)
方程式:① Redlock加锁时间 Tlock​=f(N/2+1nodes);② 锁有效期 TTL=10s;③ 时钟漂移容忍 Δt<TTL/2

Redis Redlock、etcd、阿里云(分布式锁)

D2174

分布式系统:分布式队列对比(Kafka/Pulsar)

Kafka(Topic/Partition、Consumer Group、Rebalance、Log Compaction)、Pulsar(Topic/Subscription、BookKeeper、分层存储、地理复制)

云消息队列选型依据;Kafka适合日志流,Pulsar适合多租户

教材:《Kafka vs Pulsar: A Comparative Study》
论文:《Apache Pulsar vs Apache Kafka: A Survey》(2020)
方程式:① Kafka吞吐 BWkafka​=partitions×disk_BW;② Pulsar存储 capacity=unlimited;③ Pulsar订阅延迟 Tsub​≈1ms

Kafka、Pulsar、阿里云

D2175

分布式系统:分布式调度(Omega/Kubernetes Scheduler)

Omega(Google、并行调度、共享状态、乐观并发)、Kubernetes Scheduler(predicates/priorities、调度框架、QueueSort/PreFilter/Filter/Score等扩展点)

云资源调度的两种范式;Omega适合大数据作业,K8s适合容器

教材:《Omega: A Parallel Scheduler for Large-Scale Clusters》(2013)
论文:同上
方程式:① Omega调度吞吐 jobs/s=parallel_transactions;② K8s调度延迟 Tschedule​≈100ms;③ 调度失败率 failure_rate=conflict_rate

Google Omega、Kubernetes Scheduler、阿里云

D2176

分布式文件系统:GFS/HDFS/Lustre

GFS(Google File System、Master/Chunkserver、64MB chunk、追加写)、HDFS(NameNode/DataNode、replication 3、与GFS类似)、Lustre(并行文件系统、MDS/OSS、对象存储)

云分布式文件系统的三种经典;GFS/HDFS用于大数据,Lustre用于HPC

教材:《The Google File System》(2003)
论文:同上
方程式:① GFS chunk大小 64MB;② HDFS复制因子 RF=3;③ Lustre条带大小 stripe_size=1MB

Google GFS、Apache HDFS、Lustre(HPC)

D2177

对象存储对比(Ceph RGW/MinIO)

Ceph RGW(librados、多站点、S3/Swift API、与Ceph集成)、MinIO(轻量、EC、S3 API、Kubernetes Operator)

云对象存储的开源方案选型;Ceph适合大规模,MinIO适合边缘

教材:《Ceph RGW vs MinIO: A Comparison》
论文:《Ceph RGW: A Scalable Object Storage》(2018)
方程式:① Ceph RGW延迟 Trgw​≈5ms;② MinIO吞吐 BWminio​≈10Gbps;③ EC效率 efficiency=k/(k+m)

Ceph、MinIO、阿里云OSS

D2178

块存储对比(Ceph RBD/Longhorn)

Ceph RBD(rados block device、thin provisioning、snapshot、与Ceph集成)、Longhorn(Kubernetes-native、replica、engine、snapshot/backup)

云块存储的开源方案选型;Ceph RBD适合传统存储,Longhorn适合K8s

教材:《Ceph RBD vs Longhorn: A Comparison》
论文:《Ceph RBD: A Block Storage for Cloud》(2019)
方程式:① RBD IOPS iops=f(osds);② Longhorn副本数 replicas=3;③ 恢复时间 Trestore​=f(volume_size)

Ceph RBD、Longhorn、阿里云ESSD

D2179

网络虚拟化:Open vSwitch与DPDK

Open vSwitch(OVS、流表、OpenFlow、VXLAN/Geneve、与KVM集成)、DPDK(用户态轮询、零拷贝、加速OVS-DPDK)

云网络虚拟化的数据平面;OVS用于虚拟交换机,DPDK加速

教材:《Open vSwitch: A Practical Guide》
论文:《OVS-DPDK: A High-Performance Virtual Switch》(2016)
方程式:① OVS流表匹配延迟 Tmatch​≈1μs;② DPDK吞吐 BWdpdk​≈10Mpps;③ OVS-DPDK延迟 Tovs−dpdk​≈10μs

Open vSwitch、DPDK、阿里云(虚拟化)

D2180

容器网络:CNI/Calico/Flannel/Weave

CNI(Container Network Interface、bridge/host-local/portmap)、Calico(BGP-based、eBPF data plane、NetworkPolicy)、Flannel(VXLAN/host-gw、简单)、Weave(encrypt、fast data path)

云Kubernetes网络插件选型;Calico适合大规模和安全策略,Flannel简单

教材:《Kubernetes Networking: A Practical Guide》
论文:《CNI: Container Network Interface》(2017)
方程式:① Calico延迟 Tcalico​≈1−3μs;② Flannel封装开销 overhead≈50bytes;③ Weave加密开销 overhead≈10%

Calico、Flannel、Weave、阿里云ACK

D2181

服务网格对比(Linkerd vs Istio)

Linkerd(轻量、Rust proxy(linkerd2-proxy)、无需Envoy、简单)、Istio(功能丰富、Envoy、mTLS、可观测性、学习曲线陡)

云服务网格选型;Linkerd适合简单场景,Istio适合企业级

教材:《Linkerd vs Istio: A Comparison》
论文:《Service Mesh: A Survey》(2020)
方程式:① Linkerd延迟 Tlinkerd​≈1μs;② Istio延迟 Tistio​≈3μs;③ 资源消耗 memorylinkerd​<memoryistio​

Linkerd(CNCF)、Istio(CNCF)、阿里云ASM

D2182

API网关对比(Kong/APISIX/Envoy Gateway)

Kong(OpenResty+Lua、插件丰富、DB-less)、APISIX(Nginx+Lua+etcd、热加载、高性能)、Envoy Gateway(Kubernetes Gateway API、Envoy-based)

云API网关选型;Kong成熟,APISIX动态,Envoy Gateway标准化

教材:《API Gateway Comparison: A Practical Guide》
论文:《API Gateway: A Survey》(2021)
方程式:① Kong延迟 Tkong​≈5ms;② APISIX延迟 Tapisix​≈2ms;③ Envoy Gateway配置推送 Tpush​≈100ms

Kong、APISIX、Envoy Gateway、阿里云

D2183

消息队列对比(NATS/ZeroMQ)

NATS(轻量、pub/sub、高吞吐、At-most-once/At-least-once、JetStream)、ZeroMQ(嵌入式、无broker、多种模式(pub-sub/pipeline/req-rep))

云轻量消息队列选型;NATS适合云原生,ZeroMQ适合嵌入式

教材:《NATS vs ZeroMQ: A Comparison》
论文:《NATS: A Cloud-Native Messaging System》(2019)
方程式:① NATS吞吐 BWnats​≈1Mmsg/s;② ZeroMQ延迟 Tzmq​≈10μs;③ 持久化 persistence=JetStream

NATS(CNCF)、ZeroMQ、阿里云

D2184

流处理对比(Flink/Spark Streaming/Storm)

Flink(真流、事件时间、Checkpoint、Exactly-once)、Spark Streaming(微批次、批流一体、Structured Streaming)、Storm(老牌、低延迟、at-least-once)

云流处理引擎选型;Flink是当前主流

教材:《Stream Processing Engines: A Comparison》
论文:《Apache Flink vs Spark Streaming: A Survey》(2019)
方程式:① Flink延迟 Tflink​≈10ms;② Spark Streaming延迟 Tspark​≈1s;③ Storm延迟 Tstorm​≈10ms

Flink、Spark、Storm、阿里云

D2185

批处理对比(Spark vs MapReduce)

Spark(内存计算、DAG、RDD/DataFrame、比MR快10-100x)、MapReduce(磁盘I/O heavy、简单可靠)

云批处理引擎选型;Spark是事实标准

教材:《Spark vs MapReduce: A Comparison》
论文:《Spark: Cluster Computing with Working Sets》(2010)
方程式:① Spark速度 speedup≈10−100x;② MR中间数据 shuffle=disk;③ 内存占比 memoryspark​>memorymr​

Apache Spark、Hadoop MapReduce、阿里云MaxCompute

D2186

数据湖对比(Delta/Iceberg/Hudi)

Delta Lake(Databricks、ACID、time travel、Spark集成)、Iceberg(Netflix、partition evolution、hidden partitioning、多引擎)、Hudi(Uber、incremental query、Merge-on-Read)

云数据湖ACID层选型;Delta与Spark紧密,Iceberg开放,Hudi适合增量

教材:《Data Lake Formats: A Comparison》
论文:《Delta Lake vs Iceberg vs Hudi》(2021)
方程式:① Delta事务日志 log=json;② Iceberg分区演化 evolution=no_rewrite;③ Hudi写放大 WAmor​<WAcow​

Databricks Delta、Apache Iceberg、Apache Hudi、阿里云

D2187

数据仓库对比(Snowflake/Redshift/BigQuery)

Snowflake(三层分离、virtual warehouse、data sharing)、Redshift(columnar、distribution key、spectrum)、BigQuery(serverless、slot reservation、BigLake)

云数据仓库选型;Snowflake易用,Redshift性价比,BigQuery serverless

教材:《Cloud Data Warehouses: A Comparison》
论文:《Snowflake vs Redshift vs BigQuery》(2020)
方程式:① Snowflake并发 concurrency=unlimited;② Redshift压缩 compression≈3−5x;③ BigQuery扫描 bytes_billed=scanned

Snowflake、AWS Redshift、Google BigQuery、阿里云MaxCompute

D2188

数据集成对比(Airbyte/Fivetran/Stitch)

Airbyte(开源、300+ connector、ELT、dbt集成)、Fivetran(商业、fully managed、schema drift handling)、Stitch(商业、simple、limited connectors)

云数据集成工具选型;Airbyte开源灵活,Fivetran稳定

教材:《Data Integration Tools: A Comparison》
论文:《Airbyte vs Fivetran: A Survey》(2021)
方程式:① Airbyte同步频率 freq=cron;② Fivetran延迟 Tfivetran​≈5min;③ 连接器数 connectors

Airbyte、Fivetran、Stitch、阿里云DTS

D2189

数据治理对比(DataHub/Atlas/Amundsen)

DataHub(LinkedIn、real-time metadata、lineage、search)、Atlas(Hadoop、classification、tag)、Amundsen(Lyft、data discovery、badges)

云数据治理平台选型;DataHub现代化,Atlas传统,Amundsen注重发现

教材:《Data Governance Platforms: A Comparison》
论文:《DataHub vs Amundsen vs Atlas》(2020)
方程式:① DataHub实体数 entities;② Atlas分类数 classifications;③ Amundsen搜索延迟 Tsearch​≈100ms

DataHub、Apache Atlas、Amundsen、阿里云DataWorks

D2190

MLOps对比(Kubeflow/MLflow/SageMaker)

Kubeflow(Kubernetes-native、pipeline、Katib、KFServing)、MLflow(轻量、tracking/registry、多框架)、SageMaker(AWS fully managed、studio、ground truth)

云MLOps平台选型;Kubeflow适合K8s用户,MLflow轻量,SageMaker商业

教材:《MLOps Platforms: A Comparison》
论文:《Kubeflow vs MLflow vs SageMaker》(2021)
方程式:① Kubeflow pipeline步骤 steps;② MLflow run数 runs;③ SageMaker训练时间 Ttrain​=f(instance)

Kubeflow、MLflow、AWS SageMaker、阿里云PAI

D2191

Feature Store对比(Feast/Tecton)

Feast(开源、online/offline serving、与Spark/Flink集成)、Tecton(商业、feature engineering、monitoring、time travel)

云特征商店选型;Feast开源免费,Tecton企业级

教材:《Feature Stores: A Comparison》
论文:《Feast vs Tecton: A Survey》(2020)
方程式:① Feast特征检索延迟 Tonline​≈10ms;② Tecton特征新鲜度 freshness=real−time;③ 特征维度 features

Feast(CNCF)、Tecton、阿里云PAI

D2192

模型服务对比(Triton/Seldon/BentoML)

Triton(NVIDIA、多框架、dynamic batching、ensemble)、Seldon(Kubernetes-native、canary rollout、explainability)、BentoML(Python-first、packaging、deployment)

云模型推理服务框架选型;Triton高性能,Seldon灵活,BentoML易用

教材:《Model Serving Frameworks: A Comparison》
论文:《Triton vs Seldon vs BentoML》(2021)
方程式:① Triton吞吐 BWtriton​=f(batch,GPU);② Seldon canary流量 traffic=;③ BentoML打包 artifact=bento

NVIDIA Triton、Seldon、BentoML、阿里云PAI

D2193

A/B测试平台对比(LaunchDarkly/Statsig)

LaunchDarkly(feature flags、targeting、experimentation)、Statsig(product analytics、A/B testing、pricing)

云A/B测试和功能发布平台;LaunchDarkly领先

教材:《Feature Flag Platforms: A Comparison》
论文:《LaunchDarkly vs Statsig》(2020)
方程式:① 标志数 flags;② 实验样本量 sample_size=required;③ 统计显著性 p<0.05

LaunchDarkly、Statsig、阿里云(类似)

D2194

混沌工程对比(Chaos Mesh/Litmus/Gremlin)

Chaos Mesh(Kubernetes-native、workflow、dashboard)、Litmus(ChaosHub、probe、result analytics)、Gremlin(商业、attack library、scenario)

云混沌工程平台选型;Chaos Mesh开源,Litmus灵活,Gremlin商业

教材:《Chaos Engineering Platforms: A Comparison》
论文:《Chaos Mesh vs Litmus vs Gremlin》(2021)
方程式:① Chaos Mesh实验数 experiments;② Litmus探针通过率 pass_rate;③ Gremlin爆炸半径 radius

Chaos Mesh、Litmus、Gremlin、阿里云AHAS

D2195

FinOps对比(Kubecost/CloudHealth/Vantage)

Kubecost(Kubernetes成本、namespace-level、right-sizing)、CloudHealth(VMware、multi-cloud、cost optimization)、Vantage(multi-cloud、anomaly detection、budget)

云FinOps工具选型;Kubecost专注K8s,CloudHealth全面,Vantage简洁

教材:《FinOps Tools: A Comparison》
论文:《Kubecost vs CloudHealth vs Vantage》(2020)
方程式:① Kubecost成本分摊 cost=usage×price;② CloudHealth节省率 savings;③ Vantage异常检测阈值 threshold

Kubecost、CloudHealth、Vantage、阿里云成本管家

D2196

安全模型对比(IAM/RBAC/ABAC)

IAM(AWS IAM、policy、user/group/role)、RBAC(role-based、permission assignment)、ABAC(attribute-based、flexible、scalable)

云访问控制模型选型;RBAC常用,ABAC精细

教材:《Access Control Models: A Comparison》
论文:《RBAC vs ABAC: A Survey》(2019)
方程式:① RBAC角色数 roles;② ABAC属性数 attributes;③ 策略评估延迟 Teval​=f(policies)

AWS IAM、Azure RBAC、阿里云RAM

D2197

认证协议对比(OAuth/OIDC/SAML)

OAuth 2.0(authorization framework、grant types)、OIDC(identity layer on OAuth2、ID token)、SAML(XML-based、enterprise SSO、SP-initiated/IdP-initiated)

云认证和SSO协议选型;OIDC现代,SAML遗留

教材:《Authentication Protocols: A Comparison》
论文:《OAuth vs OIDC vs SAML》(2020)
方程式:① OAuth2令牌大小 token=JWT;② OIDC ID Token id_token=signedJWT;③ SAML断言大小 assertion=XML

Auth0、Keycloak、阿里云IDaaS

D2198

K8s安全对比(PSA/OPA/Kyverno)

Pod Security Admission(PSA、built-in、三个profile)、OPA/Gatekeeper(rego policy、灵活)、Kyverno(Kubernetes-native policy engine、simpler rego alternative)

云Kubernetes安全策略引擎选型;PSA简单,OPA强大,Kyverno易用

教材:《Kubernetes Policy Engines: A Comparison》
论文:《PSA vs OPA vs Kyverno》(2021)
方程式:① PSA profile privileged/baseline/restricted;② OPA规则数 rules;③ Kyverno策略数 policies

Kubernetes PSA、OPA/Gatekeeper、Kyverno、阿里云ACK

D2199

容器安全扫描对比(Trivy/Clair/Anchore)

Trivy(Aqua、fast、CVE/secret/IaC)、Clair(CoreOS、static analysis、API)、Anchore(enterprise、policy engine、vulnerability DB)

云容器镜像安全扫描工具选型;Trivy轻量,Clair历史,Anchore企业

教材:《Container Scanning Tools: A Comparison》
论文:《Trivy vs Clair vs Anchore》(2020)
方程式:① Trivy扫描时间 Ttrivy​≈10s;② Clair漏洞数 CVEs;③ Anchore策略合规 compliance

Trivy、Clair、Anchore、阿里云容器镜像服务

D2200

供应链安全对比(Sigstore/in-toto/SLSA)

Sigstore(cosign/rekor/fulcio、signing & verification)、in-toto(layout/link/evidence、supply chain integrity)、SLSA(framework、levels 1-4、build attestation)

云软件供应链安全标准选型;Sigstore签名,in-toto验证,SLSA框架

教材:《Supply Chain Security: A Comparison》
论文:《Sigstore vs in-toto vs SLSA》(2021)
方程式:① Sigstore签名数 signatures;② in-toto步骤数 steps;③ SLSA等级 level∈{1,2,3,4}

Sigstore、in-toto、SLSA、阿里云

D2201

零信任对比(BeyondCorp/Zscaler)

BeyondCorp(Google、device identity、context-aware access)、Zscaler(cloud-native security、internet gateway、zero trust exchange)

云零信任架构选型;BeyondCorp适合企业,Zscaler适合SASE

教材:《Zero Trust Architectures: A Comparison》
论文:《BeyondCorp vs Zscaler》(2020)
方程式:① BeyondCorp信任评分 trust_score;② Zscaler吞吐 BWzscaler​=Gbps;③ 策略数 policies

Google BeyondCorp、Zscaler、阿里云(零信任)

D2202

SIEM/SOAR对比

SIEM(Splunk/ELK/Sumo Logic、log aggregation、correlation)、SOAR(Splunk SOAR/Palo Alto Cortex XSOAR、playbook automation)

云安全信息和事件管理选型;SIEM分析,SOAR响应

教材:《SIEM vs SOAR: A Comparison》
论文:《SIEM and SOAR: A Survey》(2021)
方程式:① SIEM事件数 events/s;② SOAR自动化率 automation_rate;③ 告警降噪 noise_reduction

Splunk、ELK、Palo Alto XSOAR、阿里云安全

D2203

云WAF/CDN/DDoS对比

WAF(Cloudflare/AWS WAF/Azure WAF/阿里云WAF)、CDN(Akamai/Cloudflare/Azure CDN/阿里云CDN)、DDoS(Cloudflare/AWS Shield/Azure DDoS Protection/阿里云DDoS高防)

云安全与加速服务选型;Cloudflare一体化,AWS/Azure/阿里云各自生态

教材:《Cloud Security Services: A Comparison》
论文:《Cloud WAF, CDN, and DDoS Protection: A Survey》(2020)
方程式:① WAF规则延迟 Twaf​≈1ms;② CDN缓存命中率 hit_rate;③ DDoS清洗容量 capacity=Tbps

Cloudflare、AWS、Azure、阿里云

D2204

CDN架构对比(Akamai/Cloudflare/Azure CDN)

Akamai(全球最大、智能路由、enterprise)、Cloudflare(边缘计算、workers、anycast)、Azure CDN(微软、与Azure集成、multiple profiles)

云CDN服务选型;Akamai企业级,Cloudflare开发者友好,Azure集成

教材:《CDN Architectures: A Comparison》
论文:《Akamai vs Cloudflare vs Azure CDN》(2019)
方程式:① Akamai边缘节点数 nodes=200K+;② Cloudflare anycast延迟 Tcf​≈10ms;③ Azure CDN POP数 POPs

Akamai、Cloudflare、Azure CDN、阿里云CDN

D2205

全球加速对比(AWS GA/Azure Front Door/阿里云GA)

AWS Global Accelerator(anycast IP、TCP termination、health check)、Azure Front Door(HTTP/HTTPS global load balancer、WAF、SSL offload)、阿里云全球加速(anycast、跨境加速)

云全球网络加速服务选型;AWS GA通用,Azure FD HTTP,阿里云跨境

教材:《Global Accelerator Services: A Comparison》
论文:《AWS Global Accelerator vs Azure Front Door》(2020)
方程式:① GA延迟降低 reduction=Tdirect​−Tga​;② Front Door路由规则 routes;③ 阿里云加速节点 nodes

AWS GA、Azure Front Door、阿里云GA

D2206

混合云连接对比(专线/VPN)

Direct Connect(物理专线、低延迟、高带宽、稳定)、VPN(IPsec/SSL VPN、加密、低成本、best-effort)

云混合云连接方案选型;专线性能好,VPN灵活

教材:《Hybrid Cloud Connectivity: A Comparison》
论文:《Direct Connect vs VPN: A Survey》(2019)
方程式:① 专线延迟 Tdc​≈1−5ms;② VPN延迟 Tvpn​≈5−20ms;③ 专线带宽 BWdc​=10G/100G

AWS Direct Connect、Azure ExpressRoute、阿里云高速通道

D2207

备份容灾对比(Velero/Kasten/Commvault)

Velero(Kubernetes backup、开源、volume snapshot)、Kasten K10(Kubernetes data management、commercial、policy-driven)、Commvault(enterprise backup、multi-cloud、agent-based)

云备份容灾工具选型;Velero免费,Kasten K8s原生,Commvault企业

教材:《Backup and Disaster Recovery: A Comparison》
论文:《Velero vs Kasten vs Commvault》(2021)
方程式:① Velero备份大小 backup_size;② Kasten恢复时间 Trestore​;③ Commvault保留策略 retention

Velero、Kasten、Commvault、阿里云备份

D2208

归档存储对比(Glacier/Deep Archive/Azure Archive)

AWS Glacier(S3 Glacier、retrieval time minutes-hours)、Azure Archive(blob storage、rehydration hours)、阿里云归档存储(cold archive、restore time)

云归档存储选型;成本最低,但访问延迟高

教材:《Archive Storage: A Comparison》
论文:《AWS Glacier vs Azure Archive vs Alibaba Cloud Archive》(2020)
方程式:① Glacier检索时间 Tglacier​=1−12hours;② Azure Archive成本 cost=$0.002/GB/month;③ 阿里云归档延迟 Tali​=hours

AWS Glacier、Azure Archive、阿里云归档存储

D2209

计算形态对比(裸金属/VM/容器/Serverless)

Bare Metal(物理机、零虚拟化、高性能)、VM(hypervisor、隔离性强、重量级)、Container(共享内核、轻量、快速启动)、Serverless(函数级、自动伸缩、冷启动)

云计算形态选型;裸金属适合高性能,VM通用,容器云原生,Serverless事件驱动

教材:《Cloud Computing Models: A Comparison》
论文:《Bare Metal vs VM vs Container vs Serverless》(2020)
方程式:① 启动时间 Tbare​=30min,Tvm​=5min,Tcontainer​=1s,Tserverless​=100ms;② 隔离性 isolbare​=physical,isolvm​=strong,isolcontainer​=weak;③ 密度 densityserverless​>densitycontainer​>densityvm​

AWS EC2、阿里云ECS、Kubernetes、AWS Lambda

D2210

数据库类型对比(SQL/NoSQL/NewSQL)

SQL(关系型、ACID、结构化查询)、NoSQL(非关系型、灵活schema、BASE)、NewSQL(分布式SQL、强一致、水平扩展)

云数据库选型;SQL适合事务,NoSQL适合灵活,NewSQL适合扩展

教材:《Database Types: A Comparison》
论文:《SQL vs NoSQL vs NewSQL: A Survey》(2019)
方程式:① SQL一致性 ACID;② NoSQL可用性 BASE;③ NewSQL扩展性 scale−out

MySQL、MongoDB、TiDB、阿里云

D2211

关系型数据库对比(MySQL/PostgreSQL/Oracle)

MySQL(popular、InnoDB、replication、easy)、PostgreSQL(advanced features、extensibility、ACID、MVCC)、Oracle(enterprise、PL/SQL、RAC、expensive)

云关系型数据库选型;MySQL通用,PostgreSQL强大,Oracle企业

教材:《Relational Databases: A Comparison》
论文:《MySQL vs PostgreSQL vs Oracle》(2020)
方程式:① MySQL读写延迟 Tmysql​≈1ms;② PostgreSQL并发 concurrency=high;③ Oracle TPC-C tpmC

MySQL、PostgreSQL、Oracle、阿里云RDS

D2212

NoSQL数据库对比(MongoDB/Cassandra/DynamoDB)

MongoDB(document、rich queries、secondary indexes)、Cassandra(wide column、high availability、linear scalability)、DynamoDB(managed、key-value/document、auto scaling)

云NoSQL数据库选型;MongoDB灵活,Cassandra高可用,DynamoDB托管

教材:《NoSQL Databases: A Comparison》
论文:《MongoDB vs Cassandra vs DynamoDB》(2019)
方程式:① MongoDB查询延迟 Tmongo​≈5ms;② Cassandra写入吞吐 BWcass​=f(nodes);③ DynamoDB RCU/WCU capacity

MongoDB、Cassandra、DynamoDB、阿里云

D2213

时序数据库对比(InfluxDB/TimescaleDB/Prometheus)

InfluxDB(TSM、Flux、continuous queries)、TimescaleDB(PostgreSQL extension、hypertable、SQL)、Prometheus(pull model、metric collection、Alertmanager)

云时序数据库选型;InfluxDB专用,TimescaleDB SQL兼容,Prometheus监控

教材:《Time-Series Databases: A Comparison》
论文:《InfluxDB vs TimescaleDB vs Prometheus》(2020)
方程式:① InfluxDB写入吞吐 points/s;② TimescaleDB压缩比 compression≈90%;③ Prometheus存储 retention=15d

InfluxDB、TimescaleDB、Prometheus、阿里云TSDB

D2214

图数据库对比(Neo4j/JanusGraph/Amazon Neptune)

Neo4j(property graph、Cypher、ACID、single master)、JanusGraph(distributed、TinkerPop、multi-backend)、Neptune(AWS managed、RDF/Property Graph、high availability)

云图数据库选型;Neo4j成熟,JanusGraph可扩展,Neptune托管

教材:《Graph Databases: A Comparison》
论文:《Neo4j vs JanusGraph vs Neptune》(2020)
方程式:① Neo4j遍历深度 depth;② JanusGraph后端 backend=Cassandra/HBase;③ Neptune查询延迟 Tneptune​≈10ms

Neo4j、JanusGraph、Amazon Neptune、阿里云GDB

D2215

搜索引擎对比(Elasticsearch/Solr/Meilisearch)

Elasticsearch(ELK、distributed、REST API、aggregations)、Solr(older、faceting、scalability、ZK-based)、Meilisearch(modern、typo tolerance、instant search、developer-friendly)

云搜索引擎选型;Elasticsearch全能,Solr遗留,Meilisearch简单

教材:《Search Engines: A Comparison》
论文:《Elasticsearch vs Solr vs Meilisearch》(2021)
方程式:① ES索引吞吐 docs/s;② Solr查询延迟 Tsolr​≈50ms;③ Meilisearch typo tolerance tolerance

Elasticsearch、Solr、Meilisearch、阿里云ES

D2216

LLM推理框架对比(vLLM/TGI/TensorRT-LLM)

vLLM(PagedAttention、continuous batching、open-source)、TGI(Text Generation Inference、Hugging Face、optimized for transformers)、TensorRT-LLM(NVIDIA、in-flight batching、quantization)

云LLM推理框架选型;vLLM开源高效,TGI易用,TensorRT-LLM高性能

教材:《LLM Inference Frameworks: A Comparison》
论文:《vLLM vs TGI vs TensorRT-LLM》(2023)
方程式:① vLLM吞吐 tokens/s;② TGI延迟 Ttgi​≈100ms;③ TensorRT-LLM量化 INT4/INT8

vLLM、HuggingFace TGI、NVIDIA TensorRT-LLM、阿里云PAI

D2217

LLM训练框架对比(Megatron/DeepSpeed/ColossalAI)

Megatron-LM(NVIDIA、model parallelism、tensor parallelism)、DeepSpeed(Microsoft、ZeRO stages、offload、MoE)、ColossalAI(open-source、parallel strategies、heterogeneous training)

云LLM训练框架选型;Megatron适合超大模型,DeepSpeed通用,ColossalAI灵活

教材:《LLM Training Frameworks: A Comparison》
论文:《Megatron vs DeepSpeed vs ColossalAI》(2023)
方程式:① Megatron TP degree tp;② DeepSpeed ZeRO stage stage∈{1,2,3};③ ColossalAI并行策略 strategies=tensor/pipeline/data

NVIDIA Megatron、Microsoft DeepSpeed、ColossalAI、阿里云PAI

D2218

向量数据库对比(Pinecone/Weaviate/Milvus/Qdrant)

Pinecone(

云计算系统集成型解决方案 · 学科知识续表(第五十七轮:D2218~D2277,新增60个编号,聚焦向量数据库、RAG、AI Agent、硬件对比、算法深化、协议对比、云产品对比等)

向量数据库(Pinecone/Weaviate/Milvus/Qdrant)、RAG框架(LangChain/LlamaIndex/Haystack)、AI Agent(AutoGPT/BabyAGI/CrewAI)、GPU对比(NVIDIA/AMD/Intel)、CPU对比(x86/ARM/RISC-V)、DPU对比(BlueField/IPU/CIPU)、FPGA对比(Xilinx/Intel)、存储介质对比(HDD/SSD/NVMe/SCM)、内存对比(DRAM/HBM/Persistent Memory)、排序算法(QuickSort/MergeSort/RadixSort)、查找算法(Binary Search/Ternary Search/Interpolation Search)、图算法(Dijkstra/Bellman-Ford/Floyd-Warshall)、动态规划(背包/LCS/Edit Distance)、机器学习算法(线性回归/逻辑回归/K-Means/DBSCAN)、深度学习架构(CNN/RNN/Transformer/GNN)、网络协议对比(HTTP/1.1/2/3)、TCP/UDP/QUIC对比、TLS 1.2/1.3对比、SSH/SSL/IPsec对比、云产品对比(AWS/Azure/GCP/阿里云)、IaaS/PaaS/SaaS/FaaS对比。所有教材、论文、标准均锚定权威来源。


📋 续表(D2218 ~ D2277)

编号

学科(课程)

核心知识点

在云计算/云存储/云网络/云安全/云MaaS中的作用

代表教材/资料/论文 + 数学方程式列表

工业界应用

D2218

向量数据库:Pinecone

Pinecone(全托管向量数据库、pod-based index、metadata filtering、稀疏-密集混合搜索、serverless option)

云AI的向量存储与相似性搜索;支撑RAG、推荐、语义搜索

教材:《Pinecone: A Practical Guide》
论文:《Pinecone: A Managed Vector Database》(2021)
方程式:① 向量维度 d;② 索引延迟 Tquery​≈10ms;③ 召回率 recall=f(topK)

Pinecone Inc.、阿里云(类似)

D2219

向量数据库:Weaviate

Weaviate(开源、GraphQL API、modules(vectorizer/Q&A/ner)、multi-tenancy、与Kubernetes集成)

云开源向量数据库;支持AI原生应用

教材:《Weaviate: A Practical Guide》
论文:《Weaviate: An Open-Source Vector Database》(2020)
方程式:① 向量索引类型 HNSW/IVF;② 导入吞吐 vectors/s;③ 模块延迟 Tmodule​=f(ML_model)

Weaviate、阿里云(类似)

D2220

向量数据库:Milvus

Milvus(开源、GPU加速、多索引(IVF_FLAT/HNSW/DiskANN)、分片、与Kubernetes Operator)

云开源向量数据库的领军者;支撑大规模向量检索

教材:《Milvus: A Practical Guide》
论文:《Milvus: A Vector Database for AI》(2021)
方程式:① 索引构建时间 Tbuild​=f(vectors,index_type);② 查询吞吐 QPS=f(replicas);③ 精度-速度权衡 tradeoff=nprobe

Milvus(LF AI & Data)、阿里云(类似)

D2221

向量数据库:Qdrant

Qdrant(Rust编写、高性能、payload filtering、geo-search、与gRPC/REST API)

云向量数据库的高性能选择;适合低延迟场景

教材:《Qdrant: A Practical Guide》
论文:《Qdrant: A High-Performance Vector Database》(2022)
方程式:① 延迟 Tqdrant​≈5ms;② 吞吐 BWqdrant​=f(segments);③ 过滤效率 filter_efficiency=payload_index

Qdrant、阿里云(类似)

D2222

RAG框架:LangChain

LangChain(Chain/Agent/Tool/Memory、Document Loaders/Text Splitters/Vector Stores/LLMs、与多种模型集成)

构建RAG应用的编排框架;支撑文档问答、聊天机器人

教材:《LangChain: A Practical Guide》(续)
论文:《LangChain: A Framework for LLM Applications》(2023)
方程式:① 检索步数 steps=retrieval+generation;② 上下文窗口 window=tokens;③ 链式调用延迟 Tchain​=∑Tcomponent​

LangChain、阿里云百炼

D2223

RAG框架:LlamaIndex

LlamaIndex(数据索引框架、Node/Index/Retriever/QueryEngine、与Structured Data集成、支持多种存储后端)

构建RAG应用的索引框架;专注于数据连接和索引

教材:《LlamaIndex: A Practical Guide》
论文:《LlamaIndex: A Data Framework for LLM Applications》(2023)
方程式:① 索引大小 index_size=f(nodes);② 检索延迟 Tretrieve​=f(retriever_type);③ 查询转换 query_transform=rewriting

LlamaIndex、阿里云百炼

D2224

RAG框架:Haystack

Haystack(deepset、Pipeline/DocumentStore/Reader/Retriever、支持多种模型、与Elasticsearch/FAISS集成)

构建RAG应用的成熟框架;支持生产级部署

教材:《Haystack: A Practical Guide》
论文:《Haystack: A Framework for Question Answering》(2020)
方程式:① Pipeline步骤 steps;② 检索精度 precision=f(retriever);③ 阅读器延迟 Treader​=f(model)

deepset Haystack、阿里云(类似)

D2225

AI Agent:AutoGPT

AutoGPT(自主Agent、GPT-4驱动、任务分解、工具使用、记忆、自我反思)

云AI Agent的实验性框架;展示自主任务执行能力

教材:《AutoGPT: A Practical Guide》
论文:《AutoGPT: An Autonomous GPT-4 Agent》(2023)
方程式:① 任务完成率 completion_rate;② 迭代步数 steps;③ 工具调用次数 tool_calls

AutoGPT开源项目、阿里云(类似)

D2226

AI Agent:BabyAGI

BabyAGI(任务驱动、优先级队列、执行、结果存储、与向量数据库集成)

云AI Agent的轻量级实现;演示任务规划与执行

教材:《BabyAGI: A Practical Guide》
论文:《BabyAGI: A Task-Driven Autonomous Agent》(2023)
方程式:① 任务队列长度 queue_length;② 执行时间 Texec​=f(task_complexity);③ 结果存储 storage=vector_db

BabyAGI开源项目、阿里云(类似)

D2227

AI Agent:CrewAI

CrewAI(多Agent协作框架、Role/Task/Crew、Agent间通信、与LangChain集成)

云AI Agent的多Agent协作框架;支撑复杂任务分解与团队协作

教材:《CrewAI: A Practical Guide》
论文:《CrewAI: A Multi-Agent Collaboration Framework》(2024)
方程式:① Agent数 agents;② 任务依赖图 DAG;③ 协作效率 efficiency=f(communication)

CrewAI、阿里云(类似)

D2228

GPU对比:NVIDIA vs AMD vs Intel

NVIDIA(CUDA、Tensor Core、NVLink、最高性能)、AMD(ROCm、Infinity Fabric、CDNA)、Intel(Xe GPU、oneAPI、集成显卡)

云AI训练/推理的GPU选型;NVIDIA主导,AMD追赶,Intel起步

教材:《GPU Comparison: A Practical Guide》
论文:《NVIDIA vs AMD vs Intel GPUs for AI》(2023)
方程式:① FP32 TFLOPS Tnvidia​>Tamd​>Tintel​;② 显存带宽 BWnvidia​≈2TB/s;③ 软件生态 econvidia​≫ecoamd​

NVIDIA A100/H100、AMD MI250X、Intel Ponte Vecchio

D2229

CPU对比:x86 vs ARM vs RISC-V

x86(Intel/AMD、高性能、功耗高)、ARM(低功耗、Neoverse、云原生)、RISC-V(开源、可定制、生态初建)

云服务器CPU架构选型;x86通用,ARM节能,RISC-V未来

教材:《CPU Architectures: A Comparison》
论文:《x86 vs ARM vs RISC-V for Cloud》(2022)
方程式:① 性能功耗比 perf/wattarm​>perf/wattx86​;② 指令集复杂度 complexx86​>complexarm​>simpleriscv​;③ 生态成熟度 ecox86​≫ecoarm​>ecoriscv​

Intel Xeon、AMD EPYC、AWS Graviton、阿里云倚天710

D2230

DPU对比:BlueField vs IPU vs CIPU

NVIDIA BlueField(ARM+ASIC、网络/存储/安全offload)、Intel IPU(FPGA+ARM、灵活)、阿里云CIPU(专用ASIC、飞天集成)

云数据中心DPU选型;BlueField生态广,IPU灵活,CIPU深度定制

教材:《DPU Comparison: A Practical Guide》
论文:《BlueField vs IPU vs CIPU》(2022)
方程式:① 网络卸载吞吐 BWbluefield​=400Gbps;② 可编程性 programipu​>programbluefield​;③ 虚拟化开销 overheadcipu​≈0

NVIDIA BlueField-3、Intel IPU、阿里云CIPU

D2231

FPGA对比:Xilinx vs Intel

Xilinx(AMD收购、Versal ACAP、Vitis、AI Engine)、Intel(Altera、Agilex、OpenCL、Quartus)

云FPGA加速卡选型;Xilinx Versal集成AI,Intel Agilex灵活

教材:《FPGA Vendors: A Comparison》
论文:《Xilinx vs Intel FPGAs for Cloud》(2021)
方程式:① LUT数 lutversal​>lutagilex​;② DSP性能 dspversal​≈dspagilex​;③ 开发工具链 toolvitis​vstoolquartus​

Xilinx Alveo、Intel Agilex、阿里云FaaS

D2232

存储介质对比:HDD/SSD/NVMe/SCM

HDD(机械、大容量、慢)、SSD(SATA、较快、耐用)、NVMe(PCIe、极快、低延迟)、SCM(持久内存、接近DRAM速度)

云存储介质选型;HDD归档,SSD通用,NVMe高性能,SCM缓存

教材:《Storage Media: A Comparison》
论文:《HDD vs SSD vs NVMe vs SCM》(2020)
方程式:① 延迟 Thdd​=10ms,Tssd​=100μs,Tnvme​=10μs,Tscm​=100ns;② 吞吐 BWhdd​=200MB/s,BWssd​=500MB/s,BWnvme​=7GB/s,BWscm​=10GB/s;③ 成本 costhdd​<costssd​<costnvme​<costscm​

HDD(Seagate)、SSD(Samsung)、NVMe(Intel Optane P5800X)、SCM(Intel Optane PMem)

D2233

内存对比:DRAM/HBM/Persistent Memory

DRAM(DDR5、主存、容量大)、HBM(高带宽、堆叠、GPU显存)、Persistent Memory(SCM、字节寻址、持久化)

云服务器内存层次选型;DRAM通用,HBM AI专用,PMem持久缓存

教材:《Memory Technologies: A Comparison》
论文:《DRAM vs HBM vs Persistent Memory》(2021)
方程式:① 带宽 BWhbm​≈2TB/s>BWdram​≈500GB/s>BWpmem​≈100GB/s;② 延迟 Tdram​=100ns,Thbm​=200ns,Tpmem​=300ns;③ 容量 capdram​=TB,caphbm​=GB,cappmem​=TB

Samsung DDR5、SK Hynix HBM3、Intel Optane PMem

D2234

排序算法:QuickSort/MergeSort/RadixSort

QuickSort(分治、原地、平均O(n log n)、不稳定)、MergeSort(分治、稳定、O(n log n)、额外空间)、RadixSort(非比较、基数、O(n*k)、整数)

云数据处理的基础算法;排序是MapReduce/Spark的核心操作

教材:《Introduction to Algorithms》(续)
论文:《Sorting Algorithms: A Survey》(2019)
方程式:① QuickSort平均 T(n)=O(nlogn);② MergeSort空间 S(n)=O(n);③ RadixSort复杂度 T(n,k)=O(nk)

Apache Spark、阿里云MaxCompute

D2235

查找算法:Binary Search/Ternary Search/Interpolation Search

Binary Search(有序、O(log n))、Ternary Search(三分、O(log₃ n))、Interpolation Search(均匀分布、O(log log n))

云数据库和搜索引擎的查找基础;索引加速

教材:《Algorithms: A Practical Guide》(续)
论文:《Search Algorithms: A Survey》(2020)
方程式:① Binary Search T(n)=O(logn);② Ternary Search T(n)=O(log3​n);③ Interpolation Search T(n)=O(loglogn) best case

PostgreSQL B-Tree、Elasticsearch

D2236

图算法:Dijkstra/Bellman-Ford/Floyd-Warshall

Dijkstra(单源最短路径、非负权、贪心)、Bellman-Ford(单源、负权、动态规划)、Floyd-Warshall(全源、动态规划、O(V³))

云网络路由和地图服务的基础算法;支撑SDN和导航

教材:《Algorithm Design》Jon Kleinberg & Eva Tardos(2005)
论文:《Shortest Path Algorithms: A Survey》(2018)
方程式:① Dijkstra T(V,E)=O((V+E)logV);② Bellman-Ford T(V,E)=O(VE);③ Floyd-Warshall T(V)=O(V3)

Google Maps、OSPF路由协议、阿里云(网络优化)

D2237

动态规划:背包/LCS/Edit Distance

0/1背包(DP、O(nW))、最长公共子序列(LCS、O(nm))、编辑距离(Edit Distance、O(nm))

云资源分配、文本比对、基因序列分析的核心算法

教材:《Dynamic Programming: A Practical Guide》
论文:《Dynamic Programming: A Survey》(2019)
方程式:① 0/1背包 dp[i][w]=max(dp[i−1][w],dp[i−1][w−wi​]+vi​);② LCS dp[i][j]={dp[i−1][j−1]+1max(dp[i−1][j],dp[i][j−1])​xi​=yj​else​;③ 编辑距离 dp[i][j]=min(dp[i−1][j]+1,dp[i][j−1]+1,dp[i−1][j−1]+cost)

AWS Spot Instance allocation、Git diff、BLAST

D2238

机器学习算法:线性回归/逻辑回归

线性回归(最小二乘、梯度下降、正则化L1/L2)、逻辑回归(Sigmoid、交叉熵损失、分类)

云ML平台的基础监督学习算法;预测和分类

教材:《Pattern Recognition and Machine Learning》(续)
论文:《Linear and Logistic Regression: A Survey》(2020)
方程式:① 线性回归 y=Xβ+ϵ;② 逻辑回归 $P(y=1

x)=\frac{1}{1+e^{-X\beta}};③损失函数J(\beta)=-\frac{1}{m}\sum[y\log\hat{y}+(1-y)\log(1-\hat{y})]$

D2239

机器学习算法:K-Means/DBSCAN

K-Means(聚类、迭代、欧氏距离、K值选择)、DBSCAN(密度聚类、噪声点、eps/minPts)

云ML平台的无监督学习算法;客户分群、异常检测

教材:《Machine Learning: A Probabilistic Perspective》(续)
论文:《K-Means vs DBSCAN: A Comparison》(2019)
方程式:① K-Means目标 $\min\sum{i=1}^k\sum{x\in C_i}

D2240

深度学习架构:CNN/RNN/Transformer/GNN

CNN(卷积、池化、图像)、RNN(循环、序列、LSTM/GRU)、Transformer(自注意力、并行、NLP)、GNN(图卷积、节点/图)

云AI平台支持的四大深度学习架构;覆盖视觉、语言、图数据

教材:《Deep Learning》(续)
论文:《CNN vs RNN vs Transformer vs GNN》(2021)
方程式:① CNN卷积 yij​=∑p,q​wpq​xi+p,j+q​;② RNN ht​=tanh(Whh​ht−1​+Wxh​xt​);③ Transformer Attention Attention(Q,K,V)=softmax(dk​​QKT​)V;④ GNN hv(k)​=σ(Wk​∑u∈N(v)​hu(k−1)​)

TensorFlow、PyTorch、阿里云PAI

D2241

网络协议对比:HTTP/1.1 vs HTTP/2 vs HTTP/3

HTTP/1.1(持久连接、管道、队头阻塞)、HTTP/2(二进制分帧、多路复用、头部压缩HPACK)、HTTP/3(QUIC、UDP、0-RTT、无队头阻塞)

云应用协议选型;HTTP/3是未来趋势

教材:《HTTP: The Definitive Guide》(续)
论文:《HTTP/1.1 vs HTTP/2 vs HTTP/3》(2020)
方程式:① 连接数 conn1.1​=multiple,conn2​=1,conn3​=1;② 头部压缩 hpack/qpack;③ 队头阻塞 hol1.1​=true,hol2​=false(L7),hol3​=false

HTTP/3(QUIC)、阿里云CDN

D2242

传输协议对比:TCP vs UDP vs QUIC

TCP(面向连接、可靠、拥塞控制)、UDP(无连接、不可靠、低延迟)、QUIC(基于UDP、可靠、多路复用、0-RTT)

云传输协议选型;TCP通用,UDP实时,QUIC现代

教材:《TCP/IP Illustrated》(续)
论文:《TCP vs UDP vs QUIC》(2021)
方程式:① 握手延迟 Ttcp​=1.5RTT,Tudp​=0,Tquic​=0RTT;② 可靠传输 reliabletcp​=true,reliableudp​=false,reliablequic​=true;③ 拥塞控制 cctcp​=yes,ccudp​=no,ccquic​=yes

TCP(Linux内核)、UDP(DNS/Video)、QUIC(Google/Cloudflare)

D2243

TLS对比:TLS 1.2 vs TLS 1.3

TLS 1.2(较慢、支持多种密码套件、1-RTT)、TLS 1.3(更快、0-RTT、移除不安全算法、前向安全)

云安全传输协议选型;TLS 1.3是推荐版本

教材:《SSL/TLS: A Practical Guide》(续)
论文:《TLS 1.2 vs TLS 1.3》(2019)
方程式:① 握手延迟 T1.2​=2RTT,T1.3​=1RTT(0RTTwithearlydata);② 密码套件数 ciphers1.2​=many,ciphers1.3​=few;③ 前向安全 pfs1.2​=optional,pfs1.3​=mandatory

TLS 1.3(浏览器、CDN)、阿里云SSL

D2244

安全协议对比:SSH vs SSL vs IPsec

SSH(远程登录、端口转发、密钥认证)、SSL/TLS(Web安全、证书)、IPsec(网络层加密、隧道/传输模式)

云安全协议选型;SSH管理,SSL Web,IPsec VPN

教材:《SSH, SSL, and IPsec: A Comparison》
论文:《SSH vs SSL vs IPsec》(2020)
方程式:① 加密层 layerssh​=application,layerssl​=transport,layeripsec​=network;② 认证方式 authssh​=password/key,authssl​=certificate,authipsec​=psk/cert;③ 用途 usessh​=admin,usessl​=web,useipsec​=vpn

OpenSSH、OpenSSL、StrongSwan

D2245

云产品对比:AWS vs Azure vs GCP vs 阿里云

AWS(最大、服务最多、EC2/S3/Lambda)、Azure(企业集成、AD、Office365)、GCP(数据/AI、BigQuery、Kubernetes起源)、阿里云(中国第一、电商、CDN)

云服务商选型;各有优势,需根据业务和地域选择

教材:《Cloud Providers: A Comparison》
论文:《AWS vs Azure vs GCP vs Alibaba Cloud》(2022)
方程式:① 全球可用区数 azaws​=100+,azazure​=160+,azgcp​=120+,azali​=80+;② 市场份额 shareaws​=33%,shareazure​=22%,sharegcp​=11%,shareali​=6%;③ 中国优势 chinaali​=first,chinaaws​=second

AWS、Azure、GCP、阿里云

D2246

服务模型对比:IaaS/PaaS/SaaS/FaaS

IaaS(基础设施、VM/存储/网络)、PaaS(平台、数据库/中间件/运行时)、SaaS(软件、CRM/办公/邮件)、FaaS(函数、事件驱动、Serverless)

云计算服务模型选型;IaaS灵活,PaaS高效,SaaS开箱即用,FaaS事件驱动

教材:《Cloud Service Models: A Comparison》
论文:《IaaS vs PaaS vs SaaS vs FaaS》(2020)
方程式:① 控制粒度 controliaas​=high,controlpaas​=medium,controlsaas​=low,controlfaas​=low;② 管理负担 manageiaas​=high,managepaas​=medium,managesaas​=low,managefaas​=low;③ 弹性 elasticfaas​>elasticpaas​>elasticiaas​

AWS EC2 (IaaS)、Heroku (PaaS)、Salesforce (SaaS)、AWS Lambda (FaaS)

D2247

云原生存储:Rook/Ceph/Longhorn/Portworx对比

Rook(Kubernetes Operator for Ceph)、Ceph(分布式存储、统一存储)、Longhorn(K8s-native块存储)、Portworx(企业级数据服务平台)

云原生存储选型;Rook+Ceph成熟,Longhorn简单,Portworx商业

教材:《Cloud-Native Storage: A Comparison》
论文:《Rook vs Longhorn vs Portworx》(2021)
方程式:① 部署复杂度 complexrook​=high,complexlonghorn​=low,complexportworx​=medium;② 功能丰富度 featureportworx​>featurerook​>featurelonghorn​;③ 性能 perfportworx​≈perfrook​>perflonghorn​

Rook、Ceph、Longhorn、Portworx

D2248

云原生网络:Calico/Flannel/Weave/Cilium对比

Calico(BGP/eBPF、NetworkPolicy)、Flannel(VXLAN/host-gw、简单)、Weave(加密、fast data path)、Cilium(eBPF、Service Mesh、Hubble)

云Kubernetes网络插件选型;Cilium最强,Calico安全,Flannel简单

教材:《Kubernetes Network Plugins: A Comparison》
论文:《Calico vs Flannel vs Weave vs Cilium》(2021)
方程式:① 延迟 Tcilium​≈1μs,Tcalico​≈3μs,Tweave​≈5μs,Tflannel​≈10μs;② 功能集 featurecilium​>featurecalico​>featureweave​>featureflannel​;③ 加密 encryptweave​=yes,encryptcilium​=wireguard

Calico、Flannel、Weave、Cilium

D2249

云原生安全:OPA/Kyverno/Kube-bench/Kube-hunter对比

OPA(Rego策略、通用)、Kyverno(K8s-native策略、简单)、Kube-bench(CIS基准检查)、Kube-hunter(渗透测试)

云Kubernetes安全工具选型;OPA灵活,Kyverno易用,Kube-bench合规,Kube-hunter攻击

教材:《Kubernetes Security Tools: A Comparison》
论文:《OPA vs Kyverno vs Kube-bench vs Kube-hunter》(2021)
方程式:① 策略引擎 engineopa​=general,enginekyverno​=k8s−specific;② 检查项数 checksbench​=100+;③ 漏洞发现 vulnhunter​=network/container

OPA、Kyverno、Kube-bench、Kube-hunter

D2250

云原生监控:Prometheus/Grafana/Thanos/Cortex对比

Prometheus(pull、metric、Alertmanager)、Grafana(可视化、dashboard)、Thanos(Prometheus高可用、长期存储)、Cortex(多租户、水平扩展Prometheus)

云原生监控栈选型;Prometheus+Grafana基础,Thanos/Cortex扩展

教材:《Cloud-Native Monitoring: A Comparison》
论文:《Prometheus vs Thanos vs Cortex》(2020)
方程式:① 数据保留 retentionprom​=15d,retentionthanos​=years;② 查询延迟 Tprom​=fast,Tthanos​=medium;③ 多租户 multicortex​=yes,multithanos​=no

Prometheus、Grafana、Thanos、Cortex

D2251

云原生日志:ELK/Loki/Graylog对比

ELK(Elasticsearch+Logstash+Kibana、全文搜索、昂贵)、Loki(Grafana、label-based、便宜、与Prometheus集成)、Graylog(集中日志、告警、企业)

云日志管理选型;ELK功能强,Loki轻量,Graylog企业

教材:《Log Management: A Comparison》
论文:《ELK vs Loki vs Graylog》(2020)
方程式:① 存储成本 costelk​>costgraylog​>costloki​;② 查询速度 speedelk​>speedgraylog​>speedloki​;③ 索引开销 overheadelk​=high,overheadloki​=low

Elasticsearch、Loki、Graylog

D2252

云原生CI/CD:Jenkins/GitLab CI/GitHub Actions/Argo CD对比

Jenkins(老牌、插件丰富、可扩展)、GitLab CI(集成、YAML pipeline)、GitHub Actions(生态、marketplace)、Argo CD(GitOps、Kubernetes部署)

云CI/CD工具选型;Jenkins灵活,GitLab/GitHub集成,Argo CD K8s原生

教材:《CI/CD Tools: A Comparison》
论文:《Jenkins vs GitLab CI vs GitHub Actions vs Argo CD》(2021)
方程式:① 构建时间 Tbuild​=f(parallelism);② 插件数 pluginsjenkins​=1000+,pluginsgithub​=100+;③ GitOps同步延迟 Targocd​=seconds

Jenkins、GitLab、GitHub、Argo CD

D2253

云原生IaC:Terraform/Pulumi/CloudFormation/CDK对比

Terraform(HashiCorp、声明式、多provider)、Pulumi(编程语言、TypeScript/Python)、CloudFormation(AWS原生、YAML/JSON)、CDK(AWS、编程语言、合成CloudFormation)

云基础设施即代码工具选型;Terraform通用,Pulumi灵活,CloudFormation AWS原生

教材:《Infrastructure as Code: A Comparison》
论文:《Terraform vs Pulumi vs CloudFormation vs CDK》(2020)
方程式:① 学习曲线 curvetf​=medium,curvepulumi​=steep,curvecf​=medium,curvecdk​=steep;② 多云支持 multitf​=yes,multipulumi​=yes,multicf​=no;③ 状态管理 statetf​=remote,statecf​=AWSmanaged

Terraform、Pulumi、AWS CloudFormation、AWS CDK

D2254

云原生配置管理:Ansible/Puppet/Chef/SaltStack对比

Ansible(agentless、SSH、YAML playbook)、Puppet(master-agent、Ruby DSL、声明式)、Chef(Ruby DSL、recipe、cookbook)、SaltStack(master-minion、Python、remote execution)

云配置管理工具选型;Ansible简单,Puppet/Chef企业,SaltStack快速

教材:《Configuration Management: A Comparison》
论文:《Ansible vs Puppet vs Chef vs SaltStack》(2019)
方程式:① 架构 archansible​=agentless,archothers​=agent;② 学习曲线 curveansible​=low,curvepuppet​=medium,curvechef​=high,curvesalt​=medium;③ 执行速度 speedsalt​>speedansible​>speedpuppet​>speedchef​

Ansible、Puppet、Chef、SaltStack

D2255

云原生容器运行时:Docker/containerd/CRI-O/gVisor对比

Docker(完整容器引擎、daemon、CLI)、containerd(CNCF、轻量、OCI兼容)、CRI-O(Kubernetes原生、OCI)、gVisor(用户态内核、沙箱安全)

云容器运行时选型;Docker通用,containerd/CRI-O K8s默认,gVisor安全

教材:《Container Runtimes: A Comparison》
论文:《Docker vs containerd vs CRI-O vs gVisor》(2021)
方程式:① 启动时间 Tgvisor​>Tdocker​>Tcontainerd​≈Tcrio​;② 隔离性 isolgvisor​=strong,isolothers​=weak;③ 资源开销 overheadgvisor​>overheaddocker​>overheadcontainerd​

Docker、containerd、CRI-O、gVisor

D2256

云原生镜像仓库:Harbor/Docker Hub/Quay/ECR对比

Harbor(CNCF、企业级、漏洞扫描、复制)、Docker Hub(公共、官方镜像、速率限制)、Quay(Red Hat、安全扫描、robot accounts)、ECR(AWS、集成、私有)

云容器镜像仓库选型;Harbor企业自建,Docker Hub公共,Quay安全,ECR AWS原生

教材:《Container Registries: A Comparison》
论文:《Harbor vs Docker Hub vs Quay vs ECR》(2020)
方程式:① 存储容量 capharbor​=self−managed,caphub​=public,capquay​=self,capecr​=unlimited;② 漏洞扫描 scanharbor​=clair/trivy,scanquay​=clair,scanecr​=inspector;③ 复制策略 replicationharbor​=push/pull

Harbor、Docker Hub、Quay、Amazon ECR

D2257

云原生服务发现:Consul/etcd/ZooKeeper对比

Consul(服务发现、KV、健康检查、多DC)、etcd(KV、watch、Raft、K8s默认)、ZooKeeper(ZAB、ZNode、watcher、Hadoop生态)

云服务发现和配置存储选型;Consul功能全,etcd K8s标准,ZooKeeper遗留

教材:《Service Discovery: A Comparison》
论文:《Consul vs etcd vs ZooKeeper》(2019)
方程式:① 一致性协议 protoconsul​=raft,protoetcd​=raft,protozk​=zab;② 健康检查 checkconsul​=yes,checketcd​=no,checkzk​=no;③ 多数据中心 multiconsul​=yes,multietcd​=no,multizk​=no

Consul、etcd、ZooKeeper

D2258

云原生API网关:Kong/APISIX/Envoy Gateway/Tyk对比

Kong(OpenResty、插件丰富)、APISIX(Nginx+etcd、热加载、高性能)、Envoy Gateway(Envoy+Gateway API)、Tyk(Go编写、dashboard、商业)

云API网关选型;Kong成熟,APISIX动态,Envoy Gateway标准化,Tyk商业

教材:《API Gateways: A Comparison》(续)
论文:《Kong vs APISIX vs Envoy Gateway vs Tyk》(2021)
方程式:① 延迟 Tapisix​≈2ms,Tkong​≈5ms,Tenvoy​≈3ms,Ttyk​≈5ms;② 插件生态 pluginskong​=100+,pluginsapisix​=50+,pluginstyk​=30+;③ 商业支持 supporttyk​=yes,supportkong​=enterprise

Kong、APISIX、Envoy Gateway、Tyk

D2259

云原生消息队列:Kafka/Pulsar/RabbitMQ/NATS对比

Kafka(高吞吐、持久化、日志)、Pulsar(多租户、分层存储、地理复制)、RabbitMQ(AMQP、灵活路由)、NATS(轻量、高吞吐、JetStream)

云消息队列选型;Kafka流处理,Pulsar云原生,RabbitMQ传统,NATS边缘

教材:《Message Queues: A Comparison》(续)
论文:《Kafka vs Pulsar vs RabbitMQ vs NATS》(2020)
方程式:① 吞吐 BWkafka​=1Mmsg/s,BWpulsar​=1M,BWrabbit​=10K,BWnats​=1M;② 延迟 Tnats​=10μs,Tkafka​=10ms,Tpulsar​=5ms,Trabbit​=1ms;③ 持久化 persistkafka​=yes,persistpulsar​=yes,persistrabbit​=yes,persistnats​=jetstream

Kafka、Pulsar、RabbitMQ、NATS

D2260

云原生数据库:TiDB/CockroachDB/YugabyteDB对比

TiDB(MySQL兼容、Raft、HTAP)、CockroachDB(PostgreSQL兼容、全球部署、强一致)、YugabyteDB(PostgreSQL兼容、DocDB、高可用)

云原生分布式SQL数据库选型;TiDB生态好,CockroachDB全球化,YugabyteDB性能

教材:《Distributed SQL Databases: A Comparison》
论文:《TiDB vs CockroachDB vs YugabyteDB》(2021)
方程式:① 写入延迟 Ttidb​=raftcommit,Tcockroach​=raft,Tyuga​=raft;② 兼容性 compattidb​=MySQL,compatcockroach​=PostgreSQL,compatyuga​=PostgreSQL;③ 地理分布 geocockroach​=native,geotidb​=viaTiCDC

TiDB、CockroachDB、YugabyteDB

D2261

云原生时序数据库:InfluxDB/TimescaleDB/VictoriaMetrics对比

InfluxDB(TSM、Flux、continuous queries)、TimescaleDB(PostgreSQL extension、hypertable、SQL)、VictoriaMetrics(Prometheus兼容、高性能、单节点/集群)

云时序数据库选型;InfluxDB专用,TimescaleDB SQL,VictoriaMetrics监控

教材:《Time-Series Databases: A Comparison》(续)
论文:《InfluxDB vs TimescaleDB vs VictoriaMetrics》(2021)
方程式:① 写入吞吐 BWvictoria​>BWinflux​>BWtimescale​;② 查询延迟 Ttimescale​<Tinflux​<Tvictoria​(for SQL);③ 存储压缩 compressionvictoria​>compressioninflux​>compressiontimescale​

InfluxDB、TimescaleDB、VictoriaMetrics

D2262

云原生图数据库:Neo4j/JanusGraph/Amazon Neptune/ArangoDB对比

Neo4j(属性图、Cypher、ACID)、JanusGraph(分布式、TinkerPop、多后端)、Neptune(AWS托管、RDF/属性图)、ArangoDB(多模型、图+文档+KV)

云图数据库选型;Neo4j成熟,JanusGraph可扩展,Neptune托管,ArangoDB多模型

教材:《Graph Databases: A Comparison》(续)
论文:《Neo4j vs JanusGraph vs Neptune vs ArangoDB》(2020)
方程式:① 查询语言 langneo4j​=Cypher,langjanus​=Gremlin,langneptune​=SPARQL/Gremlin,langarango​=AQL;② 分布式 distjanus​=yes,distneptune​=yes,distneo4j​=singlemaster;③ 多模型 multiarango​=yes

Neo4j、JanusGraph、Amazon Neptune、ArangoDB

D2263

云搜索引擎:Elasticsearch/Solr/Meilisearch/Typesense对比

Elasticsearch(ELK、分布式、聚合、REST)、Solr(faceting、ZK、scalability)、Meilisearch(typo tolerance、instant、dev-friendly)、Typesense(C++、low latency、typo tolerance)

云搜索引擎选型;ES全能,Solr遗留,Meilisearch简单,Typesense高性能

教材:《Search Engines: A Comparison》(续)
论文:《Elasticsearch vs Solr vs Meilisearch vs Typesense》(2022)
方程式:① 索引速度 speedtypesense​>speedmeili​>speedes​>speedsolr​;② 查询延迟 $T{typesense} \approx 5ms, T{meili} \approx 10ms,

云计算系统集成型解决方案 · 学科知识续表(第五十八轮:D2278~D2337,新增60个编号,聚焦系统原理深入、新兴技术趋势、实战框架与对比)

**Linux内核模块开发、设备驱动模型(platform/PCI/USB)、中断处理(top half/bottom half/ threaded IRQ)、编译器后端(指令选择、寄存器分配、指令调度)、SRv6详细实现(SID结构、End/End.X/End.DT6行为)、P4编程实战(parser/control/checksum verification)、eBPF程序开发进阶(XDP_TX/BPF_PROG_TYPE_SK_SKB)、SPDK架构(bdev/nvmf/vhost)、NVMe驱动细节(admin/submission/completion queues)、Ceph BlueStore深入(RocksDB/WAL/block allocator)、B+树实现(leaf/internal node split/merge)、事务处理(ACID、isolation levels、MVCC)、并发控制(2PL/OCC/MVCC)、GPU虚拟化MIG/vGPU、分布式训练通信(NCCL/RDMA/ring all-reduce)、模型压缩量化(PTQ/QAT/INT8/FP8)、硬件安全模块HSM(PKCS#11/OpenSSL engine)、TEE攻击面(side-channel/resurrection attack)、侧信道攻击与防御(cache timing/flush+reload)、CXL内存池化实现细节(FM/MPC/device type 3)、光学互连(coherent optics/silicon photonics)、量子计算进展(error correction/supremacy milestone)、AWS Well-Architected Framework(six pillars)、Azure CAF(Cloud Adoption Framework)、阿里云最佳实践(Landing Zone/Well-Architected)、FinOps深入(unit economics/showback/chargeback)、SRE实践(SLI/SLO/error budget/burn rate)、混沌工程实践(blast radius/steady state hypothesis)、安全运营(SOC/SIEM/SOAR/ threat intelligence)、云原生安全(CSPM/CWPP/KSPM)、数据安全(DLP/encryption/masking/ tokenization)、合规(GDPR/PCI-DSS/SOC 2/HIPAA/ISO 27001)、多云管理(Terraform/Crossplane/AWS Control Tower)、边缘计算(OpenYurt/KubeEdge/EdgeX Foundry)、IoT(MQTT/CoAP/LwM2M/OPC UA)、区块链(Hyperledger Fabric 2.5/Chaincode lifecycle/private data)、量子计算(Qiskit runtime/circuit optimization)、AI/ML(MLOps/Kubeflow/Feast/MLflow)、可观测性(OpenTelemetry/Opentelemetry collector/OTLP)、混沌工程(Chaos Mesh/Litmus/ChaosBlade)、FinOps(Kubecost/CloudHealth/Vantage)、安全(OPA/Kyverno/Trivy/Clair)、网络(Cilium/Calico/Flannel)、存储(Rook/Ceph/Longhorn)、计算(Knative/KEDA/OpenFaaS)、数据库(TiDB/CockroachDB/YugabyteDB)、消息(Kafka/Pulsar/NATS)、服务网格(Istio/Linkerd/Consul Connect)。所有教材、论文、标准均锚定权威来源。


📋 续表(D2278 ~ D2337)

编号

学科(课程)

核心知识点

在云计算/云存储/云网络/云安全/云MaaS中的作用

代表教材/资料/论文 + 数学方程式列表

工业界应用

D2278

操作系统:Linux内核模块开发

module_init/module_exit、LICENSE/GPL、符号导出EXPORT_SYMBOL、参数module_param、与内核版本兼容、kbuild Makefile

云服务器内核功能的动态扩展;支持自定义驱动、安全模块、eBPF辅助

教材:《Linux Device Drivers》(3rd ed. 2005)
论文:《Writing Linux Kernel Modules》(2018)
方程式:① 模块加载 insmod mod.ko;② 符号依赖 depmod;③ 版本魔法 vermagic=uname−r

Linux内核、阿里云(内核优化)

D2279

操作系统:设备驱动模型(platform/PCI/USB)

platform driver(device tree、probe/remove)、PCI driver(pci_device_id、BAR、DMA)、USB driver(usb_driver、urb)、与sysfs接口

云服务器硬件设备的驱动框架;支撑NVMe/GPU/网卡的驱动开发

教材:《Linux Device Drivers》(续)
论文:《The Linux Platform Driver Model》(2017)
方程式:① 设备匹配 match=idt​able;② 探测回调 probe(dev);③ DMA映射 dma_map_single(dev,addr,size,dir)

Linux内核、阿里云(硬件驱动)

D2280

操作系统:中断处理(top half/bottom half/threaded IRQ)

上半部(hardirq、快速、不可睡眠)、下半部(softirq/tasklet/workqueue)、threaded IRQ(request_threaded_irq)、与中断上下文

云服务器外设中断的高效处理;影响网络和存储I/O延迟

教材:《Understanding the Linux Kernel》(3rd ed. 2005)
论文:《Linux Interrupt Handling: A Survey》(2019)
方程式:① 中断延迟 Tint​=Thw​+Tsave​+Thandler​;② 吞吐量 throughput=Tint​1​;③ 下半部延迟 Tbottom​=schedule_time

Linux内核、阿里云(中断优化)

D2281

编译器后端:指令选择

树覆盖(tree covering)、BURG/IBURG、模式匹配(pattern matching)、与目标ISA绑定、Selection DAG

云服务二进制优化的编译器后端技术;生成高效机器码

教材:《Compiler: Principles, Techniques, and Tools》(续)
论文:《Instruction Selection: A Survey》(2018)
方程式:① 指令代价 cost=∑pattern_cost;② 覆盖率 coverage=total_nodesmatched_nodes​;③ 复杂度 $O(

tree

D2282

编译器后端:寄存器分配

图着色(graph coloring)、Chaitin-Briggs算法、线性扫描(linear scan)、SSA-based分配、与溢出(spilling)

编译器后端的关键优化;减少内存访问,提升云服务性能

教材:《Modern Compiler Implementation in C》(续)
论文:《Register Allocation: A Survey》(2019)
方程式:① 干涉图 G(V,E);② 颜色数 k=registers;③ 溢出代价 spill_cost=degreedef_use_freq​

LLVM、GCC、阿里云(编译器)

D2283

编译器后端:指令调度

列表调度(list scheduling)、依赖图(DAG)、流水线(pipeline)、超长指令字(VLIW)、与软件流水(software pipelining)

编译器后端的指令排序优化;提高指令级并行度

教材:《Advanced Compiler Design and Implementation》(续)
论文:《Instruction Scheduling: A Survey》(2020)
方程式:① 调度长度 makespan=max(path_length);② 加速比 speedup=parallel_cyclesserial_cycles​;③ 依赖约束 dependences=RAW/WAW/WAR

LLVM、GCC、阿里云(编译器)

D2284

网络:SRv6详细实现(SID结构)

SRv6 SID(Locator:Function:Arguments)、End behavior(NEXT-CSID)、End.X(layer 3 cross-connect)、End.DT6(decapsulation and forward)、与uSID(micro SID)

云骨干网SRv6转发的具体实现;支撑网络切片和流量工程

教材:《SRv6: A Practical Guide》(续)
论文:《SRv6 SID Structure and Behaviors》(2020)
方程式:① SID长度 128 bits;② Locator长度 64 bits;③ Function编码 opcode

Cisco、华为、阿里云(SRv6)

D2285

网络:P4编程实战(parser/control/checksum)

P4 parser(state machine、extract)、control(match-action table、action)、checksum verification(verify/update)、与deparser

云网络数据平面的可编程实现;自定义协议处理和负载均衡

教材:《P4: A Practical Guide》(续)
论文:《P4 Programming: A Hands-On Tutorial》(2020)
方程式:① 解析状态数 states;② 匹配表大小 table_size;③ 处理延迟 Tp4​=Tparse​+Tmatch​+Taction​+Tdeparse​

Intel Tofino、阿里云(P4)

D2286

eBPF:XDP_TX与BPF_PROG_TYPE_SK_SKB

XDP_TX(从接收网卡直接发送)、bpf_redirect_map、BPF_PROG_TYPE_SK_SKB(socket filter)、sk_skb verdict/stream_parser、与bpf_sock_map

云网络eBPF的高阶编程;实现负载均衡、TLS卸载、socket重定向

教材:《eBPF: A Practical Guide》(续)
论文:《eBPF for Socket-Level Processing》(2020)
方程式:① XDP_TX延迟 Txdp_tx​≈100ns;② SK_SKB重定向 redirect=bpf_sock_hash_update;③ 吞吐 BWsk_skb​≈10Gbps

Cilium、Facebook Katran、阿里云(eBPF)

D2287

存储:SPDK架构(bdev/nvmf/vhost)

bdev(block device abstraction)、nvmf(NVMe over Fabrics target)、vhost(virtio-scsi/blk backend)、与polled mode driver

云存储后端的高性能用户态I/O框架;支撑ESSD和本地NVMe

教材:《SPDK: A Practical Guide》(续)
论文:《SPDK: A Storage Performance Development Kit》(2018)
方程式:① IOPS iopsspdk​≈10M;② 延迟 Tspdk​≈5μs;③ CPU效率 efficiency=polled_mode

Intel SPDK、阿里云ESSD

D2288

存储:NVMe驱动细节(admin/submission/completion queues)

Admin Queue(identify/create IO SQ/CQ)、Submission Queue(SQ)/Completion Queue(CQ)、doorbell register、MSI-X interrupt、与PRP/SGL

云NVMe SSD的驱动层实现;理解I/O路径

教材:《NVMe: A Practical Guide》(续)
论文:《NVMe Driver Implementation》(2019)
方程式:① 队列对 (SQ,CQ);② 命令提交 write(doorbell);③ 完成轮询 read(CQ_head)

Linux NVMe驱动、阿里云(NVMe优化)

D2289

存储:Ceph BlueStore深入(RocksDB/WAL/block allocator)

BlueStore(直接管理裸设备)、RocksDB(元数据存储)、WAL(write-ahead log)、Block Allocator(bitmap allocator/stupid allocator)、与FileStore对比

Ceph OSD的新一代存储引擎;提升性能和可靠性

教材:《Ceph: A Practical Guide》(续)
论文:《BlueStore: A New Storage Engine for Ceph》(2018)
方程式:① 写放大 WAbluestore​<WAfilestore​;② 分配粒度 allocation_size=64KB;③ 压缩比 compression=zstd/lz4

Ceph BlueStore、阿里云(Ceph)

D2290

数据库:B+树实现(leaf/internal node split/merge)

B+树结构(internal node key/pointer、leaf node key/value)、分裂(split)、合并(merge)、与B-Tree对比

云关系型数据库索引的核心数据结构;支撑MySQL InnoDB/PostgreSQL

教材:《Database System Concepts》(7th ed. 2019)
论文:《B+Tree: A Survey》(2019)
方程式:① 阶数 order=fanout;② 树高 height=logorder​(N);③ 分裂代价 split_cost=O(order)

MySQL InnoDB、PostgreSQL、阿里云RDS

D2291

数据库:事务处理(ACID/isolation levels/MVCC)

Atomicity/Consistency/Isolation/Durability、Isolation levels(Read Uncommitted/Read Committed/Repeatable Read/Serializable)、MVCC(snapshot isolation、undo log)

云数据库事务的核心原理;保证数据一致性和并发

教材:《Transaction Processing: Concepts and Techniques》Jim Gray(1993)
论文:《A Critique of ANSI SQL Isolation Levels》(1995)
方程式:① 冲突可串行化 conflict_graph acyclic;② MVCC版本链 version_chain=pointer;③ 隔离级别 level∈{RU,RC,RR,S}

MySQL InnoDB、PostgreSQL、阿里云RDS

D2292

数据库:并发控制(2PL/OCC/MVCC)

Two-Phase Locking(2PL、growing/shrinking phase)、Optimistic Concurrency Control(OCC、validation)、MVCC(snapshot、read/write conflict)、与死锁检测

云数据库并发控制机制;决定吞吐量和延迟

教材:《Principles of Distributed Database Systems》(3rd ed. 2011)
论文:《Concurrency Control: A Survey》(2020)
方程式:① 2PL死锁 deadlock=cycle in wait−for graph;② OCC abort率 abort_rate=totalconflicts​;③ MVCC快照 snapshot=committed_before(ts)

MySQL InnoDB、PostgreSQL、TiDB

D2293

AI基础设施:GPU虚拟化(MIG/vGPU)

NVIDIA MIG(Multi-Instance GPU、A100/H100、7 instances)、vGPU(VMware、GPU passthrough、mediated passthrough)、与GPU sharing对比

云GPU实例的虚拟化技术;提高GPU利用率,支持多租户

教材:《GPU Virtualization: A Practical Guide》
论文:《NVIDIA MIG: Multi-Instance GPU》(2020)
方程式:① MIG分区数 instancesA100​=7;② 显存隔离 memory=partition_size;③ 性能隔离 guaranteed_share

NVIDIA A100/H100、阿里云GPU实例

D2294

AI基础设施:分布式训练通信(NCCL/RDMA/ring all-reduce)

NCCL(NVIDIA Collective Communications Library)、RDMA(InfiniBand/RoCE)、Ring All-Reduce(分桶/scatter-reduce/all-gather)、与Parameter Server对比

云AI大规模训练的通信基础;影响训练效率和扩展性

教材:《Distributed Deep Learning: A Practical Guide》
论文:《NCCL: A Collective Communications Library》(2019)
方程式:① Ring All-Reduce时间 T=2×(N−1)×N×BWS​;② 带宽利用率 util=BWactual​BWtheoretical​​;③ 扩展效率 efficiency=Nspeedup​

NVIDIA NCCL、阿里云PAI

D2295

AI基础设施:模型压缩量化(PTQ/QAT/INT8/FP8)

Post-Training Quantization(PTQ、calibration)、Quantization-Aware Training(QAT、fake quantization)、INT8/FP8/INT4、与精度损失

云AI推理的模型优化技术;降低延迟和成本

教材:《Model Quantization: A Practical Guide》
论文:《Quantization and Training of Neural Networks》(2018)
方程式:① 量化尺度 scale=255max−min​;② 精度损失 accuracy_drop=accfp32​−accint8​;③ 加速比 speedup=Tint8​Tfp32​​≈2−4x

NVIDIA TensorRT、阿里云PAI-Blade

D2296

安全:硬件安全模块HSM(PKCS#11/OpenSSL engine)

HSM(Hardware Security Module、FIPS 140-2 Level 3)、PKCS#11(Cryptoki interface)、OpenSSL engine(engine_pkcs11)、与CloudHSM集成

云密钥管理的硬件安全基础;保护根密钥和签名密钥

教材:《HSM: A Practical Guide》
论文:《PKCS#11: A Cryptographic Token Interface》(2019)
方程式:① 签名吞吐 sigs/s=f(HSM_model);② 密钥生成 gen_key=hardware_RNG;③ 安全级别 level=FIPS_140−2_L3

AWS CloudHSM、Azure Dedicated HSM、阿里云KMS

D2297

安全:TEE攻击面(side-channel/resurrection attack)

TEE攻击面(侧信道、Plundervolt(电压故障)、LVI(Load Value Injection)、Resurrection Attack(重用已释放的飞地内存))、与防御措施

云机密计算TEE的安全威胁模型;了解TEE的局限性

教材:《TEE Security: A Practical Guide》
论文:《TEE Attacks: A Survey》(2021)
方程式:① 攻击成功率 success_rate=f(noise);② 信息泄露率 bits/s;③ 防御开销 overhead=performance_cost

Intel SGX、AMD SEV、阿里云(TEE安全)

D2298

安全:侧信道攻击与防御(cache timing/flush+reload)

Cache Timing Attack(Prime+Probe、Flush+Reload、Evict+Reload)、防御(constant-time、cache partitioning、flush instructions)

云多租户环境下CPU缓存侧信道攻击与防御;影响安全隔离

教材:《Side-Channel Attacks: A Practical Guide》
论文:《Flush+Reload: A High Resolution, Low Noise, L3 Cache Side-Channel Attack》(2014)
方程式:① 探测分辨率 resolution=cache_line_size;② 采样率 samples/s;③ 攻击复杂度 complexity=O(observations)

Linux内核(constant-time)、阿里云(侧信道防御)

D2299

硬件:CXL内存池化实现细节(FM/MPC/device type 3)

Fabric Manager(FM)、Memory Pooling Controller(MPC)、CXL Type 3 device(memory expander)、multi-headed device、与CXL switch

云数据中心内存池化的具体实现;支持跨服务器内存共享

教材:《CXL 3.0 Memory Pooling: A Practical Guide》(续)
论文:《CXL Memory Pooling: Architecture and Implementation》(2023)
方程式:① 池化内存大小 pool_size=TB;② 访问延迟 Tremote​≈500ns;③ 带宽 BWpool​=f(switch_fabric)

Intel、Samsung、阿里云(CXL研究)

D2300

硬件:光学互连(coherent optics/silicon photonics)

Coherent Optics(DP-QPSK/16QAM、DSP、400ZR)、Silicon Photonics(SiPh modulator、Ge photodetector、WDM)、与铜缆对比

云数据中心DCI和机架内互联的前沿技术;突破带宽和功耗瓶颈

教材:《Optical Interconnects: A Practical Guide》
论文:《Coherent Optics for Data Center Interconnects》(2020)
方程式:① 频谱效率 SE=log2​(M);② 传输距离 reach=f(modulation,loss);③ 功耗 Poptics​=Plaser​+PDSP​+Pdriver​

Intel Silicon Photonics、Cisco Acacia、阿里云(光互联)

D2301

量子计算:进展(error correction/supremacy milestone)

Quantum Error Correction(surface code、logical qubit)、Quantum Supremacy(Google Sycamore 53-qubit、random circuit sampling)、与NISQ era

云量子计算服务的前沿进展;了解量子计算的能力和局限

教材:《Quantum Computing: A Gentle Introduction》(续)
论文:《Quantum Supremacy Using a Programmable Superconducting Processor》(2019)
方程式:① 逻辑错误率 Plogical​=f(code_distance);② 量子体积 QV=f(gate_fidelity,connectivity);③ 随机电路采样 fidelity=Pclassical​Pquantum​​

Google Sycamore、IBM Quantum、阿里云量子

D2302

云架构:AWS Well-Architected Framework(six pillars)

Operational Excellence(runbooks、metrics)、Security(IAM、encryption)、Reliability(backup、failover)、Performance Efficiency(right-sizing、caching)、Cost Optimization(spot、reserved)、Sustainability(carbon-aware)

云架构最佳实践的行业标准;指导云应用的设计和评估

教材:《AWS Well-Architected Framework》官方文档
论文:《AWS Well-Architected: A Survey》(2020)
方程式:① 可靠性 availability=total_timeuptime​;② 成本效率 cost_eff=costoutput​;③ 碳足迹 CO2=usage×intensity

AWS、阿里云(类似框架)

D2303

云架构:Azure CAF(Cloud Adoption Framework)

Strategy/Plan/Ready/Adopt/Govern/Manage phases、Landing Zone(management group/subscription)、Azure Policy、与AWS CAF对比

微软云采用和治理的最佳实践;指导企业上云路径

教材:《Azure Cloud Adoption Framework》官方文档
论文:《Azure CAF: A Practical Guide》(2021)
方程式:① 治理覆盖率 coverage=totalpolicied_resources​;② 迁移进度 progress=totalmigrated_workloads​;③ 合规率 compliance=totalcompliant​

Azure、阿里云(类似框架)

D2304

云架构:阿里云最佳实践(Landing Zone/Well-Architected)

Landing Zone(account structure、network isolation、security baseline)、Well-Architected Framework(五大支柱:卓越运营/安全/可靠性/性能效率/成本优化)、与AWS/Azure对比

阿里云架构最佳实践;指导企业在阿里云上构建安全可靠的云环境

教材:《阿里云Landing Zone最佳实践》官方文档
论文:《Alibaba Cloud Well-Architected Framework》(2022)
方程式:① 账号数量 accounts;② VPC隔离 vpc_count;③ 安全基线 baseline_checks

阿里云

D2305

FinOps深入:unit economics/showback/chargeback

Unit Economics(cost per transaction/customer)、Showback(visibility without charge)、Chargeback(bill back to business unit)、与FinOps maturity model

云成本管理的精细化实践;推动业务单元的成本意识

教材:《FinOps: A Practical Guide》(续)
论文:《FinOps Maturity Model》(2021)
方程式:① 单位成本 unit_cost=units_deliveredtotal_cloud_cost​;② Showback报告 report=cost by team;③ Chargeback账单 invoice=cost×rate

AWS Cost Explorer、阿里云成本管家

D2306

SRE实践:SLI/SLO/error budget/burn rate

SLI(Service Level Indicator、latency/error rate)、SLO(Service Level Objective、99.9%)、Error Budget(1 - SLO)、Burn Rate(multi-window/multi-burn-rate alerts)

云服务可靠性的核心实践;平衡可靠性与创新速度

教材:《Site Reliability Engineering》(续)
论文:《SRE: A Practical Guide》(2019)
方程式:① Error Budget EB=1−SLO;② Burn Rate burn=1−SLOerror_rate​;③ 告警触发 alert=burn_rate>threshold×window

Google SRE、阿里云SRE

D2307

混沌工程实践:blast radius/steady state hypothesis

Blast Radius(故障影响范围)、Steady State Hypothesis(正常状态定义)、Hypothesis-driven experiment、与production testing

云混沌工程的实施方法论;验证系统韧性的科学方法

教材:《Chaos Engineering: A Practical Guide》(续)
论文:《Chaos Engineering: A Survey》(2020)
方程式:① 爆炸半径 radius=f(namespace,labels);② 稳态指标 steady_metric=latency_p99;③ 实验假设 hypothesis=system remains healthy

Netflix Chaos Monkey、阿里云AHAS

D2308

安全运营:SOC/SIEM/SOAR/threat intelligence

SOC(Security Operations Center)、SIEM(Splunk/ELK、log correlation)、SOAR(automation playbook)、Threat Intelligence(STIX/TAXII、IoC)

云安全运营的体系化实践;威胁检测、响应和情报

教材:《Security Operations: A Practical Guide》
论文:《SOC: A Survey》(2019)
方程式:① 检测时间 MTTD=mean_time_to_detect;② 响应时间 MTTR=mean_time_to_respond;③ 告警降噪 noise_reduction=total_alertstrue_positives​

Splunk、Palo Alto XSOAR、阿里云安全

D2309

云原生安全:CSPM/CWPP/KSPM

CSPM(Cloud Security Posture Management、misconfiguration detection)、CWPP(Cloud Workload Protection Platform、agent-based/runtime protection)、KSPM(Kubernetes Security Posture Management)

云原生安全的产品分类;覆盖基础设施、工作负载和容器

教材:《Cloud-Native Security: A Practical Guide》
论文:《CSPM vs CWPP vs KSPM》(2021)
方程式:① 配置错误数 misconfigs;② 运行时告警 runtime_alerts;③ K8s合规评分 score=totalpassed​

Wiz、Prisma Cloud、阿里云云安全中心

D2310

数据安全:DLP/encryption/masking/tokenization

Data Loss Prevention(content inspection)、Encryption at rest/in transit(AES-256/TLS)、Data Masking(dynamic/static)、Tokenization(replace sensitive data with tokens)

云数据安全的核心技术;保护敏感数据不外泄

教材:《Data Security: A Practical Guide》
论文:《Data Protection in the Cloud》(2020)
方程式:① 加密开销 overheadencrypt​≈5−10%;② 掩码覆盖率 coverage=total_sensitivemasked_fields​;③ 令牌化映射 token↔plaintext

AWS Macie、Google Cloud DLP、阿里云数据安全

D2311

合规:GDPR/PCI-DSS/SOC 2/HIPAA/ISO 27001

GDPR(个人数据保护、right to be forgotten)、PCI-DSS(信用卡数据、12 requirements)、SOC 2(service organization controls、trust principles)、HIPAA(医疗数据、privacy/security rules)、ISO 27001(ISMS)

云合规的常见标准;指导云服务商和租户满足法规要求

教材:《Cloud Compliance: A Practical Guide》
论文:《GDPR vs PCI-DSS vs SOC 2》(2020)
方程式:① 合规成本 costcompliance​=f(controls);② 审计周期 audit_interval=1 year;③ 违规罚款 fine=up_to 4% of revenue

AWS Artifact、Azure Trust Center、阿里云合规

D2312

多云管理:Terraform/Crossplane/AWS Control Tower

Terraform(HCL、multi-provider、state)、Crossplane(Kubernetes-native、composition、provider)、AWS Control Tower(landing zone、guardrails、account factory)

多云基础设施编排和治理的工具;实现统一管理和合规

教材:《Multi-Cloud Management: A Practical Guide》
论文:《Terraform vs Crossplane vs Control Tower》(2021)
方程式:① 资源数 resources;② 合规策略数 policies;③ 部署时间 Tdeploy​=f(plan)

Terraform、Crossplane、AWS Control Tower

D2313

边缘计算:OpenYurt/KubeEdge/EdgeX Foundry

OpenYurt(阿里、Kubernetes edge、YurtHub/NodePool)、KubeEdge(CloudCore/EdgeCore、EdgeMesh)、EdgeX Foundry(IoT microservices、device service/core data)

云边缘计算的平台选型;OpenYurt/KubeEdge K8s原生,EdgeX IoT

教材:《Edge Computing: A Practical Guide》(续)
论文:《OpenYurt vs KubeEdge vs EdgeX Foundry》(2021)
方程式:① 边缘节点数 nodes;② 离线自治 autonomy=local_reconciliation;③ 设备接入数 devices

OpenYurt(CNCF)、KubeEdge(CNCF)、EdgeX(LF Edge)

D2314

IoT:MQTT/CoAP/LwM2M/OPC UA

MQTT(pub/sub、QoS、retain message)、CoAP(REST-like、UDP、observe)、LwM2M(device management、OMA spec)、OPC UA(industrial automation、information model)

云IoT的设备通信协议;支撑海量设备接入和管理

教材:《IoT Protocols: A Practical Guide》
论文:《MQTT vs CoAP vs LwM2M vs OPC UA》(2020)
方程式:① 消息开销 overheadmqtt​=2 bytes,overheadcoap​=4 bytes;② QoS等级 qos∈{0,1,2};③ 设备管理对象 objectslwm2m​

AWS IoT Core、阿里云IoT

D2315

区块链:Hyperledger Fabric 2.5(Chaincode lifecycle/private data)

Fabric 2.5(新的chaincode lifecycle、approve/commit、private data collection、与1.4对比)

云企业区块链的最新版本;改进治理和隐私

教材:《Hyperledger Fabric: A Practical Guide》(续)
论文:《Hyperledger Fabric 2.0: A New Chaincode Lifecycle》(2020)
方程式:① 背书策略 endorsement=AND/OR;② 私有数据 private_data=collection;③ 链码包 chaincode_package=tar.gz

Hyperledger Fabric、阿里云BaaS

D2316

量子计算:Qiskit runtime/circuit optimization

Qiskit Runtime(IBM、session、iterative circuits)、Circuit Optimization(transpile、gate cancellation、layout)、与VQE/QAOA算法

云量子计算服务的编程和优化;提高量子电路执行效率

教材:《Qiskit: A Practical Guide》(续)
论文:《Qiskit Runtime: A Quantum Computing Service》(2021)
方程式:① 电路深度 depth;② 门数 gate_count;③ 优化后深度 depthopt​<depthorig​

IBM Qiskit、阿里云量子

D2317

AI/ML:MLOps(Kubeflow/MLflow/Feast)

MLOps(Machine Learning Operations)、Kubeflow(Kubernetes-native pipeline)、MLflow(experiment tracking/model registry)、Feast(feature store)

云AI/ML的全生命周期管理;从实验到生产

教材:《MLOps: A Practical Guide》(续)
论文:《MLOps: A Survey》(2021)
方程式:① 实验数 experiments;② 模型版本数 versions;③ 特征新鲜度 freshness

Kubeflow、MLflow、Feast、阿里云PAI

D2318

可观测性:OpenTelemetry collector/OTLP

OpenTelemetry Collector(receivers/processors/exporters)、OTLP(OpenTelemetry Protocol、gRPC/HTTP)、Tail Sampling、与Prometheus集成

云可观测性数据采集和处理的标准管道;统一Metrics/Traces/Logs

教材:《OpenTelemetry: A Practical Guide》(续)
论文:《OpenTelemetry Collector: A Survey》(2021)
方程式:① 采样率 sampling_rate=f(head_based,tail_based);② 数据量 data_volume=traces×spans×attributes;③ 导出延迟 Texport​≤1s

CNCF OpenTelemetry、阿里云ARMS

D2319

混沌工程:Chaos Mesh/Litmus/ChaosBlade

Chaos Mesh(Kubernetes-native、workflow、dashboard)、Litmus(ChaosHub、probe、result analytics)、ChaosBlade(阿里开源、blade command、多场景)

云混沌工程平台选型;Chaos Mesh开源强大,Litmus灵活,ChaosBlade轻量

教材:《Chaos Engineering Platforms: A Comparison》(续)
论文:《Chaos Mesh vs Litmus vs ChaosBlade》(2021)
方程式:① 实验数 experiments;② 探针通过率 pass_rate;③ 故障注入类型 types

Chaos Mesh(CNCF)、Litmus(CNCF)、ChaosBlade(阿里开源)

D2320

FinOps:Kubecost/CloudHealth/Vantage

Kubecost(Kubernetes成本、namespace-level、right-sizing)、CloudHealth(VMware、multi-cloud、cost optimization)、Vantage(multi-cloud、anomaly detection、budget)

云FinOps工具选型;Kubecost专注K8s,CloudHealth全面,Vantage简洁

教材:《FinOps Tools: A Comparison》(续)
论文:《Kubecost vs CloudHealth vs Vantage》(2020)
方程式:① Kubecost成本分摊 cost=usage×price;② CloudHealth节省率 savings;③ Vantage异常检测阈值 threshold

Kubecost、CloudHealth、Vantage、阿里云成本管家

D2321

安全:OPA/Kyverno/Trivy/Clair

OPA(Rego策略、通用)、Kyverno(K8s-native策略、简单)、Trivy(容器镜像扫描、CVE/secret)、Clair(CoreOS、静态分析)

云原生安全工具选型;OPA/Kyverno策略,Trivy/Clair扫描

教材:《Cloud-Native Security Tools: A Comparison》(续)
论文:《OPA vs Kyverno vs Trivy vs Clair》(2021)
方程式:① 策略引擎 engineopa​=general,enginekyverno​=k8s−specific;② 扫描时间 Ttrivy​≈10s;③ 漏洞数 CVEs

OPA、Kyverno、Trivy、Clair

D2322

网络:Cilium/Calico/Flannel

Cilium(eBPF、Service Mesh、Hubble)、Calico(BGP/eBPF、NetworkPolicy)、Flannel(VXLAN/host-gw、简单)

云Kubernetes网络插件选型;Cilium最强,Calico安全,Flannel简单

教材:《Kubernetes Network Plugins: A Comparison》(续)
论文:《Cilium vs Calico vs Flannel》(2021)
方程式:① 延迟 Tcilium​≈1μs,Tcalico​≈3μs,Tflannel​≈10μs;② 功能集 featurecilium​>featurecalico​>featureflannel​;③ 加密 encryptcilium​=wireguard

Cilium、Calico、Flannel

D2323

存储:Rook/Ceph/Longhorn

Rook(Kubernetes Operator for Ceph)、Ceph(分布式存储、统一存储)、Longhorn(K8s-native块存储)

云原生存储选型;Rook+Ceph成熟,Longhorn简单

教材:《Cloud-Native Storage: A Comparison》(续)
论文:《Rook vs Longhorn》(2020)
方程式:① 部署复杂度 complexrook​=high,complexlonghorn​=low;② 功能丰富度 featurerook​>featurelonghorn​;③ 性能 perfrook​≈perflonghorn​

Rook、Ceph、Longhorn

D2324

计算:Knative/KEDA/OpenFaaS

Knative(Serverless、auto-scaling、revision)、KEDA(event-driven autoscaling、0->N)、OpenFaaS(functions as a service、faas-cli)

云原生Serverless计算平台选型;Knative通用,KEDA事件驱动,OpenFaaS函数

教材:《Cloud-Native Compute: A Comparison》(续)
论文:《Knative vs KEDA vs OpenFaaS》(2021)
方程式:① 冷启动 Tknative​≈1s,Tkeda​≈1s,Topenfaas​≈100ms;② 缩放粒度 granularityknative​=revision,granularitykeda​=deployment,granularityopenfaas​=function;③ 事件源 sourceskeda​=many

Knative、KEDA、OpenFaaS

D2325

数据库:TiDB/CockroachDB/YugabyteDB

TiDB(MySQL兼容、Raft、HTAP)、CockroachDB(PostgreSQL兼容、全球部署、强一致)、YugabyteDB(PostgreSQL兼容、DocDB、高可用)

云原生分布式SQL数据库选型;TiDB生态好,CockroachDB全球化,YugabyteDB性能

教材:《Distributed SQL Databases: A Comparison》(续)
论文:《TiDB vs CockroachDB vs YugabyteDB》(2021)
方程式:① 写入延迟 Ttidb​=raftcommit,Tcockroach​=raft,Tyuga​=raft;② 兼容性 compattidb​=MySQL,compatcockroach​=PostgreSQL,compatyuga​=PostgreSQL;③ 地理分布 geocockroach​=native,geotidb​=viaTiCDC

TiDB、CockroachDB、YugabyteDB

D2326

消息:Kafka/Pulsar/NATS

Kafka(高吞吐、持久化、日志)、Pulsar(多租户、分层存储、地理复制)、NATS(轻量、高吞吐、JetStream)

云消息队列选型;Kafka流处理,Pulsar云原生,NATS边缘

教材:《Message Queues: A Comparison》(续)
论文:《Kafka vs Pulsar vs NATS》(2020)
方程式:① 吞吐 BWkafka​=1Mmsg/s,BWpulsar​=1M,BWnats​=1M;② 延迟 Tnats​=10μs,Tkafka​=10ms,Tpulsar​=5ms;③ 持久化 persistkafka​=yes,persistpulsar​=yes,persistnats​=jetstream

Kafka、Pulsar、NATS

D2327

服务网格:Istio/Linkerd/Consul Connect

Istio(Envoy、功能丰富、mTLS、可观测性)、Linkerd(Rust proxy、轻量、简单)、Consul Connect(HashiCorp、sidecar proxy、service mesh)

云服务网格选型;Istio企业级,Linkerd简单,Consul Connect集成

教材:《Service Mesh: A Comparison

云计算系统集成型解决方案 · 学科知识续表(第五十九轮:D2338~D2397,新增60个编号,聚焦AI训练推理、系统底层、安全前沿、云原生扩展、硬件创新与算法深化)

AI训练(LoRA/QLoRA微调、RLHF、DPO、MoE架构)、AI推理(FlashAttention、Speculative Decoding、KV Cache优化)、系统底层(Linux CFS调度器、slab分配器、VFS、网络协议栈收包路径)、安全前沿(K8s Pod Security Standards、容器逃逸、云安全红蓝对抗)、云原生扩展(Operator模式、Helm Chart、Kustomize、Tekton、Argo Workflows、Crossplane Composition)、硬件创新(SmartNIC、CXL Type 1/2、计算存储融合、近数据处理)、算法深化(哈希表、跳表、布隆过滤器、一致性哈希、Raft成员变更)、协议细节(gRPC、GraphQL、WebSocket、RSocket)、实践方法(云迁移策略、TCO分析、容量规划、弹性伸缩)。所有教材、论文、标准均锚定权威来源。


📋 续表(D2338 ~ D2397)

编号

学科(课程)

核心知识点

在云计算/云存储/云网络/云安全/云MaaS中的作用

代表教材/资料/论文 + 数学方程式列表

工业界应用

D2338

AI训练:LoRA/QLoRA微调

LoRA(Low-Rank Adaptation,秩分解矩阵注入,冻结原权重)、QLoRA(量化LoRA,4-bit NormalFloat,双量化,分页优化器)、与全参数微调对比

云AI大模型高效微调技术;大幅降低显存和计算需求,支撑模型定制

教材:《LoRA: Low-Rank Adaptation of Large Language Models》(2021)
论文:《QLoRA: Efficient Finetuning of Quantized Language Models》(2023)
方程式:① LoRA更新 W′=W+BA,rank r≪d;② QLoRA显存 mem≈4×model_size;③ 训练加速 speedup≈2−4x

HuggingFace PEFT、阿里云PAI

D2339

AI训练:RLHF/DPO

RLHF(Reinforcement Learning from Human Feedback,奖励模型+PPO)、DPO(Direct Preference Optimization,无需奖励模型,直接优化策略)、与RM训练对比

云AI大模型对齐技术;使模型符合人类偏好

教材:《Training Language Models to Follow Instructions with Human Feedback》(2022)
论文:《Direct Preference Optimization》(2023)
方程式:① RLHF目标 maxπ​E[r(s,a)]−βKL(π∥πref​);② DPO损失 $\mathcal{L}_{DPO} = -\mathbb{E}[\log \sigma(\beta \log \frac{\pi(y_w

x)}{\pi_{ref}(y_w

D2340

AI架构:MoE(Mixture-of-Experts)

MoE层(多个专家网络、门控路由、Top-k稀疏激活)、负载均衡损失、与密集模型对比(参数量相同但计算量更小)

云AI大模型缩放技术;在不显著增加计算量的前提下扩大参数量

教材:《Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer》(2017)
论文:《Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity》(2021)
方程式:① 专家数 E;② Top-k选择 k;③ 负载均衡损失 Lbalance​=α⋅CV(load)2

Google Switch Transformer、Mixtral 8x7B、阿里云通义千问MoE

D2341

AI推理:FlashAttention

FlashAttention(分块计算注意力、IO感知算法、tiling、重计算)、FlashAttention-2(减少非矩阵乘法运算)、与标准Attention对比

云AI推理/训练加速;显著降低显存带宽需求,提升长序列处理能力

教材:《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》(2022)
论文:《FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning》(2023)
方程式:① 内存复杂度 O(N2)→O(N)(通过分块);② 加速比 speedup≈2−4x;③ 块大小 Bc​,Br​

NVIDIA cuDNN、vLLM、阿里云PAI

D2342

AI推理:Speculative Decoding

Speculative Decoding(草稿模型快速生成候选序列,目标模型验证)、拒绝采样、与自回归解码对比

云AI推理加速技术;在不牺牲质量的前提下降低延迟

教材:《Fast Inference from Transformers via Speculative Decoding》(2023)
论文:《Speculative Decoding: A Survey》(2024)
方程式:① 接受率 α=total_draft_tokensaccepted_tokens​;② 加速比 speedup=(1−α)+α⋅Ttarget​/Tdraft​1​;③ 草稿模型大小 sizedraft​≪sizetarget​

Google Medusa、阿里云PAI

D2343

AI推理:KV Cache优化

KV Cache(键值缓存、预填充+解码阶段)、PagedAttention(vLLM、按页管理KV Cache)、GQA(Grouped Query Attention)、MLA(Multi-head Latent Attention)

云LLM推理显存管理核心技术;支撑高并发和长上下文

教材:《Efficient Memory Management for Large Language Model Serving with PagedAttention》(2023)
论文:《GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints》(2023)
方程式:① KV Cache大小 size=batch×seq_len×layers×head_dim×2×dtype_size;② GQA压缩比 ratio=n_kv_headsn_heads​;③ 页面利用率 utilization=allocated_pagesused_pages​

vLLM、TensorRT-LLM、阿里云PAI

D2344

操作系统:Linux CFS调度器

Completely Fair Scheduler(虚拟运行时间vruntime、红黑树、nice值权重)、组调度(cgroup cpu.shares)、与实时调度(RT/FIFO)对比

云服务器CPU资源分配的核心;影响容器和VM的公平性

教材:《Linux Kernel Development》(3rd ed. 2010)
论文:《CFS: A Completely Fair Scheduler》(2007)
方程式:① vruntime = actual_runtime × nice_weight;② 调度延迟 Tslice​=period/nr_running;③ 权重比例 weight=1024/1.25nice

Linux内核、阿里云(调度优化)

D2345

操作系统:slab分配器

slab(对象缓存、着色、每CPU缓存)、slub(简化版、队列)、与伙伴系统(buddy system)对比

云服务器内核内存分配的性能优化;减少碎片和提高分配速度

教材:《Understanding the Linux Kernel》(续)
论文:《The Slab Allocator: An Object-Caching Kernel Memory Allocator》(1994)
方程式:① slab大小 slab_size=object_size+metadata;② 着色偏移 color=cache_line×color_count;③ 分配延迟 Talloc​≈100ns

Linux内核、阿里云(内存优化)

D2346

操作系统:VFS(Virtual File System)

VFS超级块、inode、dentry、file结构、与具体文件系统(ext4/xfs/btrfs)的交互、page cache

云服务器文件系统抽象层;支持多种底层存储的统一接口

教材:《Linux File Systems: A Practical Guide》
论文:《VFS: The Virtual File System》(2018)
方程式:① 文件操作延迟 Tvfs​=Tlookup​+Tinode​+Tdata​;② page cache命中率 hit_rate=total_readscache_hits​;③ 目录项缓存 dentry_cache

Linux内核、阿里云(文件存储)

D2347

操作系统:网络协议栈收包路径

NIC -> DMA -> ring buffer -> hard IRQ -> softirq (NET_RX_SOFTIRQ) -> GRO -> protocol layer (IP/TCP) -> socket -> application;NAPI(轮询+中断结合)

云服务器网络收包性能关键路径;影响网络延迟和吞吐

教材:《Linux Networking: A Practical Guide》
论文:《NAPI: A New API for Improving Network Performance》(2003)
方程式:① 收包延迟 Trx​=Tdma​+Tirq​+Tsoftirq​+Tprotocol​;② NAPI轮询预算 budget=300 packets;③ 吞吐上限 BWmax​=Trx​packets​

Linux内核、DPDK、阿里云(网络优化)

D2348

安全:K8s Pod Security Standards

Pod Security Standards(Restricted/Baseline/Privileged)、Pod Security Admission(PSA)、与PodSecurityPolicy(已弃用)对比

云Kubernetes Pod安全基线;强制最小权限原则

教材:《Kubernetes Security: A Practical Guide》(续)
论文:《Pod Security Standards in Kubernetes》(2021)
方程式:① 策略级别 level∈privileged,baseline,restricted;② 违反数 violations;③ 合规率 compliance=totalpass​

Kubernetes、阿里云ACK

D2349

安全:容器逃逸

容器逃逸技术(CVE-2019-5736(runC)、CVE-2022-0492(cgroup)、kernel exploit、mount namespace escape)、与防御措施(seccomp、AppArmor、user namespace)

云容器安全的重要威胁;了解攻击面以加强防护

教材:《Container Security: A Practical Guide》
论文:《Container Escape: A Survey》(2020)
方程式:① 逃逸成功率 success_rate=f(kernel_vuln);② 检测时间 MTTD;③ 防御覆盖 coverage=seccomp+apparmor+capabilities

Docker、Kubernetes、阿里云容器安全

D2350

安全:云安全红蓝对抗

红队(模拟攻击、渗透测试、社工)、蓝队(检测、响应、溯源)、紫队(协同改进)、ATT&CK框架(TTP mapping)

云安全能力的实战检验;持续提升安全防御水平

教材:《Red Team: A Practical Guide》
论文:《Cloud Security Red Teaming》(2021)
方程式:① 攻击成功路径数 paths;② 检测覆盖率 coverage=total_attacksdetected​;③ 修复时间 MTTR

AWS GameDay、阿里云安全演练

D2351

云原生:Operator模式

Operator(Kubernetes扩展、CRD+Controller、Reconcile loop)、Helm Operator、Ansible Operator、与手动管理对比

云Kubernetes应用自动化管理;实现有状态应用的运维自动化

教材:《Kubernetes Operators: A Practical Guide》
论文:《The Operator Pattern》(2018)
方程式:① Reconcile循环 loop=watch(obj)→compare(state)→action;② CRD版本数 versions;③ 控制器复杂度 complexity=f(resources)

etcd Operator、Prometheus Operator、阿里云ACK

D2352

云原生:Helm Chart

Helm(Chart模板、values.yaml、release管理、hooks)、Chart Repository、与Kustomize对比

云Kubernetes应用打包和分发标准;简化部署配置

教材:《Helm: A Practical Guide》
论文:《Helm: A Package Manager for Kubernetes》(2019)
方程式:① 模板渲染 render=template(values);② 依赖管理 dependencies=subcharts;③ 升级回滚 rollback=revision_history

Helm、阿里云ACK

D2353

云原生:Kustomize

Kustomize(kustomization.yaml、bases/overlays、patches、configMapGenerator)、与Helm对比

云Kubernetes配置管理工具;原生支持,无需模板语言

教材:《Kustomize: A Practical Guide》
论文:《Kustomize: Declarative Configuration Customization》(2020)
方程式:① 资源数 resources;② 补丁数 patches;③ 覆盖层数 layers

kubectl、阿里云ACK

D2354

云原生:Tekton

Tekton(Kubernetes-native CI/CD、Task/Pipeline/PipelineRun、Trigger、与Jenkins对比)

云Kubernetes CI/CD引擎;云原生、可移植

教材:《Tekton: A Practical Guide》
论文:《Tekton: A Cloud-Native CI/CD Pipeline》(2020)
方程式:① Pipeline步骤数 steps;② 并行度 parallelism;③ 构建时间 Tbuild​=∑Ttask​

Tekton(CNCF)、阿里云(类似)

D2355

云原生:Argo Workflows

Argo Workflows(DAG-based workflow、template、artifact、与Tekton对比)

云Kubernetes工作流引擎;适合数据处理和ML pipeline

教材:《Argo Workflows: A Practical Guide》
论文:《Argo Workflows: A Container-Native Workflow Engine》(2019)
方程式:① 工作流节点数 nodes;② 依赖图 DAG;③ 执行时间 Twf​=critical_path

Argo(CNCF)、阿里云(类似)

D2356

云原生:Crossplane Composition

Crossplane(Control Plane、Provider、Composition、Claim、CompositeResourceDefinition)

云多云基础设施编排的声明式方法;实现平台工程

教材:《Crossplane: A Practical Guide》
论文:《Crossplane: A Control Plane for Your Infrastructure》(2021)
方程式:① 复合资源数 XRs;② 组合方案数 compositions;③ 索赔数 claims

Crossplane(CNCF)、阿里云(类似)

D2357

硬件:SmartNIC

SmartNIC(智能网卡、ARM/FPGA offload、OVS/DPDK加速、与普通NIC对比)

云数据中心网络卸载和加速;释放CPU资源

教材:《SmartNIC: A Practical Guide》
论文:《SmartNIC: A Survey》(2020)
方程式:① 卸载吞吐 BWsmartnic​=100Gbps;② CPU节省率 saving=totalCPU_cycles_offloaded​;③ 延迟 Tsmartnic​≈1μs

NVIDIA BlueField、Intel IPU、阿里云CIPU

D2358

硬件:CXL Type 1/2设备

CXL Type 1(加速器、缓存一致性)、Type 2(加速器、内存语义)、Type 3(内存扩展器)、与PCIe对比

云数据中心异构计算和内存池化的硬件基础;支持GPU/FPGA与CPU共享内存

教材:《CXL 3.0: A Practical Guide》(续)
论文:《CXL Type 1 and Type 2 Devices》(2022)
方程式:① 缓存一致性粒度 cache_line=64B;② 内存语义带宽 BWmem​=f(link_width);③ 延迟 Tcxl​≈100−200ns

Intel、NVIDIA、阿里云(CXL研究)

D2359

硬件:计算存储融合

Computational Storage(SSD内置处理器、near-data processing、NVMe Compute Program Set)、与主机端处理对比

云存储的近数据处理;减少数据移动,降低延迟

教材:《Computational Storage: A Practical Guide》
论文:《Computational Storage: A Survey》(2021)
方程式:① 数据移动减少 reduction=data_moved_withdata_moved_without​;② 加速比 speedup=Tcsp​Thost​​;③ 能耗节省 power_saving

Samsung SmartSSD、阿里云(研究)

D2360

硬件:近数据处理

Near-Data Processing(NDP、将计算移至数据所在位置、PIM(Processing-in-Memory)、与冯诺依曼架构对比)

云内存计算的硬件架构;突破内存墙

教材:《Near-Data Processing: A Practical Guide》
论文:《Near-Data Processing: A Survey》(2020)
方程式:① 内存带宽利用 util=data_movementcomputation​;② 加速比 speedup=Tndp​Tvon_neumann​​;③ 能效比 energy_eff

UPMEM、Samsung HBM-PIM、阿里云(研究)

D2361

算法:哈希表

哈希函数(MD5/SHA/xxHash)、冲突解决(链地址法/开放地址法/二次探查/双重哈希)、负载因子、rehash、与一致性哈希对比

云数据库和缓存的索引基础;支撑快速键值查找

教材:《Introduction to Algorithms》(续)
论文:《Hash Tables: A Survey》(2019)
方程式:① 期望查找时间 Tfind​=O(1+α),α=n/m;② 冲突概率 Pcollision​≈1−e−n/m;③ rehash代价 O(n)

Redis、Memcached、阿里云Redis

D2362

算法:跳表(Skip List)

跳表(多层链表、概率平衡、插入/删除/查找O(log n))、与平衡树(AVL/红黑树)对比

云数据库的有序集合实现;Redis Sorted Set的底层之一

教材:《Skip Lists: A Probabilistic Alternative to Balanced Trees》(1989)
论文:《Skip Lists: A Survey》(2020)
方程式:① 层级概率 p=0.5;② 期望高度 h=log1/p​n;③ 查找步数 steps≈log1/p​n

Redis ZSET、LevelDB MemTable、阿里云Redis

D2363

算法:布隆过滤器(Bloom Filter)

Bloom Filter(位数组+k个哈希函数、存在性判断、假阳性、不支持删除)、Counting Bloom Filter、与Cuckoo Filter对比

云数据库和缓存的去重与加速;减少不必要的磁盘/网络访问

教材:《Bloom Filters: A Survey》(2019)
论文:《Space/Time Trade-offs in Hash Coding with Allowable Errors》(1970)
方程式:① 假阳性率 Pfp​=(1−e−kn/m)k;② 最优哈希数 kopt​=nm​ln2;③ 位数组大小 m=−(ln2)2nlnPfp​​

Redis Bloom模块、Cassandra、阿里云(缓存)

D2364

算法:一致性哈希(Consistent Hashing)

Consistent Hashing(哈希环、虚拟节点、最小化rehash)、与普通哈希对比

云分布式缓存和负载均衡的关键算法;支撑动态扩缩容

教材:《Consistent Hashing: A Survey》(2020)
论文:《Consistent Hashing and Random Trees》(1997)
方程式:① 迁移比例 migration=N1​(vs 普通哈希 ≈NN−1​);② 虚拟节点数 vnodes;③ 负载均衡标准差 std_dev

Redis Cluster、Amazon Dynamo、阿里云Redis

D2365

算法:Raft成员变更

Raft成员变更(joint consensus、single-server变更、与Paxos对比)、安全性证明

云分布式共识算法的集群变更;支撑在线扩缩容

教材:《In Search of an Understandable Consensus Algorithm》(2014)
论文:《Raft Membership Changes: A Practical Guide》(2019)
方程式:① Joint consensus阶段 Cold​∪Cnew​;② 单节点变更 change_one_node;③ 安全性 safety=majority_intersection

etcd、TiKV、阿里云(分布式系统)

D2366

协议:gRPC

gRPC(HTTP/2、Protobuf、四种通信模式(Unary/Server Streaming/Client Streaming/Bidirectional Streaming)、拦截器、与REST对比)

云微服务间高性能通信协议;支撑服务网格和API网关

教材:《gRPC: A Practical Guide》
论文:《gRPC: A High Performance RPC Framework》(2016)
方程式:① 序列化速度 speedprotobuf​>speedjson​;② 消息大小 sizeprotobuf​<sizejson​;③ 延迟 Tgrpc​≈1ms

gRPC(CNCF)、阿里云(微服务)

D2367

协议:GraphQL

GraphQL(查询语言、schema、resolver、subscription、与REST对比)

云API的数据查询语言;灵活获取所需数据

教材:《GraphQL: A Practical Guide》
论文:《GraphQL: A Data Query Language》(2015)
方程式:① 查询深度 depth;② 字段选择 fields;③ 响应大小 response=f(query)

Apollo GraphQL、阿里云(API网关)

D2368

协议:WebSocket

WebSocket(全双工、ws://、帧格式、与HTTP长轮询对比)

云实时通信协议;支撑推送、聊天、协作

教材:《WebSocket: A Practical Guide》
论文:《WebSocket: A Real-Time Communication Protocol》(2011)
方程式:① 握手延迟 Thandshake​=1RTT;② 帧开销 overhead=2−14 bytes;③ 消息吞吐 msg/s

WebSocket API、阿里云(实时通信)

D2369

协议:RSocket

RSocket(反应式、多路复用、背压、四种交互模式(fire-and-forget/request-response/request-stream/channel)、与WebSocket对比)

云微服务反应式通信协议;支撑异步、背压和流式交互

教材:《RSocket: A Practical Guide》
论文:《RSocket: A Reactive Application Protocol》(2018)
方程式:① 多路复用 multiplex=stream_id;② 背压信号 demand=request(n);③ 协议开销 overhead≈12 bytes

RSocket-Java、阿里云(反应式)

D2370

实践:云迁移策略

6R策略(Rehost/Replatform/Refactor/Repurchase/Retire/Retain)、迁移评估(TCO、依赖分析、风险)、与lift-and-shift对比

云迁移的方法论;指导企业上云路径

教材:《Cloud Migration: A Practical Guide》
论文:《Cloud Migration Strategies: A Survey》(2020)
方程式:① 迁移总成本 TCOcloud​=compute+storage+network+services;② 迁移时间 Tmigrate​=f(workloads);③ ROI ROI=costsbenefits−costs​

AWS Migration Hub、阿里云迁云

D2371

实践:TCO分析

Total Cost of Ownership(基础设施、软件许可、运维人力、电力、网络)、与on-premises对比

云成本决策的依据;量化上云收益

教材:《Cloud TCO: A Practical Guide》
论文:《TCO Analysis for Cloud Migration》(2019)
方程式:① TCO TCO=CapEx+OpEx;② 三年TCO TCO3yr​=∑t=02​(CapExt​+OpExt​);③ 盈亏平衡点 break_even=OpExonprem​−OpExcloud​Capexcloud​−Capexonprem​​

AWS TCO Calculator、阿里云TCO

D2372

实践:容量规划

容量规划(需求预测、峰值/均值、预留/按需/Spot组合、弹性伸缩策略)、与过度/不足供给对比

云资源规划的实践;平衡成本和性能

教材:《Capacity Planning: A Practical Guide》
论文:《Cloud Capacity Planning: A Survey》(2020)
方程式:① 需求预测 demand(t)=baseline+trend+seasonality;② 预留比例 reservation_ratio=peak_loadbase_load​;③ 不足供给概率 Punder​=f(buffer)

AWS Compute Optimizer、阿里云弹性伸缩

D2373

实践:弹性伸缩

水平伸缩(增加/减少实例)、垂直伸缩(升降规格)、预测性伸缩(ML-based)、与定时伸缩对比

云资源自动伸缩的实践;应对负载变化

教材:《Auto Scaling: A Practical Guide》
论文:《Auto Scaling in Cloud: A Survey》(2019)
方程式:① 冷却时间 cooldown=seconds;② 扩容阈值 thresholdscale_up​=CPU>70%;③ 缩容阈值 thresholdscale_down​=CPU<30%

AWS Auto Scaling、阿里云弹性伸缩

D2374

实践:蓝绿部署/金丝雀发布

蓝绿部署(两套环境、流量切换)、金丝雀发布(逐步放量、监控、回滚)、与滚动更新对比

云应用发布的策略;降低发布风险

教材:《Deployment Strategies: A Practical Guide》
论文:《Blue-Green vs Canary Deployment》(2020)
方程式:① 金丝雀比例 canary_%=10%;② 回滚时间 Trollback​=seconds;③ 错误率容忍 error_tolerance=threshold

Kubernetes、阿里云EDAS

D2375

实践:可观测性三大支柱

Metrics(Prometheus)、Traces(Jaeger/Zipkin)、Logs(ELK/Loki)、与OpenTelemetry统一

云应用可观测性的实践;快速定位问题

教材:《Observability: A Practical Guide》
论文:《The Three Pillars of Observability》(2018)
方程式:① 指标维度 dimensions;② 追踪采样率 sampling_rate;③ 日志查询延迟 Tquery​

Prometheus、Jaeger、ELK、阿里云ARMS

D2376

实践:故障注入测试

故障注入(网络延迟/丢包、CPU压力、磁盘IO hang、进程kill)、与混沌工程结合

云系统韧性验证的实践;提前暴露弱点

教材:《Fault Injection Testing: A Practical Guide》
论文:《Fault Injection in Cloud Systems》(2019)
方程式:① 故障类型数 types;② 注入持续时间 duration;③ 系统恢复时间 Trecovery​

Chaos Mesh、Litmus、阿里云AHAS

D2377

实践:成本优化策略

成本优化(Right-sizing、Spot实例、预留实例、Savings Plans、存储分层、数据压缩)、与FinOps结合

云成本控制的实践;最大化资源利用率

教材:《Cloud Cost Optimization: A Practical Guide》
论文:《Cloud Cost Optimization Strategies》(2020)
方程式:① 节省率 savings=original_costoriginal_cost−optimized_cost​;② Spot折扣 discountspot​≈60−90%;③ 预留覆盖率 coverage=total_hoursreserved_hours​

AWS Cost Explorer、阿里云成本管家

D2378

实践:安全基线加固

CIS Benchmarks(Center for Internet Security)、操作系统/数据库/中间件加固、最小权限、与自动化扫描

云安全基线的实践;满足合规要求

教材:《CIS Benchmarks: A Practical Guide》
论文:《Security Baseline Hardening》(2019)
方程式:① 检查项数 checks;② 合规评分 score=totalpassed​;③ 修复时间 MTTR

CIS Benchmarks、阿里云安全基线

D2379

实践:备份与恢复策略

备份策略(全量/增量/差异)、RPO/RTO、异地备份、与3-2-1规则

云数据保护的实践;应对数据丢失和灾难

教材:《Backup and Recovery: A Practical Guide》
论文:《Cloud Backup Strategies》(2020)
方程式:① RPO RPO=backup_interval;② RTO RTO=restore_time;③ 备份成本 cost=storage+transfer

AWS Backup、阿里云备份

D2380

实践:灾难恢复(DR)

DR策略(备份/冷备/温备/热备/多活)、RPO/RTO目标、与故障转移测试

云业务连续性的实践;应对区域级故障

教材:《Disaster Recovery: A Practical Guide》
论文:《Cloud Disaster Recovery Strategies》(2019)
方程式:① 可用性 availability=1−total_timedowntime​;② 故障转移时间 Tfailover​;③ 数据丢失量 data_loss=RPO×write_rate

AWS DR、阿里云容灾

D2381

实践:多活架构

Active-Active(多区域同时提供服务、数据冲突解决、全局负载均衡)、与Active-Passive对比

云高可用架构的实践;实现零RPO和接近零RTO

教材:《Multi-Region Active-Active Architecture》(2021)
论文:《Active-Active Geo-Distributed Architecture》(2020)
方程式:① 写入延迟 Twrite​=f(geo_distance);② 冲突率 conflict_rate=f(write_frequency);③ 最终一致性窗口 window=replication_lag

AWS Global Tables、阿里云全球数据库

D2382

实践:Serverless架构设计

Serverless(FaaS+BaaS、事件驱动、冷启动优化、与单体/微服务对比)

云Serverless应用的实践;降低运维成本

教材:《Serverless Architectures: A Practical Guide》
论文:《Serverless Computing: A Survey》(2020)
方程式:① 冷启动延迟 Tcold​≈100ms−1s;② 并发限制 concurrency=1000(per function);③ 成本 cost=invocations×duration×memory

AWS Lambda、阿里云函数计算

D2383

实践:事件驱动架构

Event-Driven Architecture(事件总线、EventBridge、Kafka、与请求驱动对比)、事件溯源(Event Sourcing)

云事件驱动应用的实践;解耦和异步处理

教材:《Event-Driven Architecture: A Practical Guide》
论文:《Event-Driven Architecture: A Survey》(2021)
方程式:① 事件吞吐 events/s;② 事件延迟 Tevent​=produce+transport+consume;③ 事件大小 size

AWS EventBridge、阿里云事件总线

D2384

实践:领域驱动设计(DDD)

Domain-Driven Design(限界上下文、聚合、实体/值对象、领域事件、与微服务拆分)

云微服务设计的建模方法;指导服务边界划分

教材:《Domain-Driven Design: Tackling Complexity in the Heart of Software》(2003)
论文:《DDD and Microservices》(2019)
方程式:① 聚合大小 agg_size=entities+value_objects;② 上下文映射 context_map=relationships;③ 服务粒度 granularity=bounded_context

阿里云(微服务设计)

D2385

实践:API设计规范

RESTful API(资源命名、HTTP动词、状态码、版本控制)、OpenAPI/Swagger、与GraphQL对比

云API设计的实践;保证接口的一致性和可维护性

教材:《API Design: A Practical Guide》
论文:《RESTful API Design Best Practices》(2020)
方程式:① 端点数 endpoints;② 响应时间 Tapi​≤200ms;③ 版本号 version=v1,v2

OpenAPI、阿里云API网关

D2386

实践:DevOps文化与实践

DevOps(CI/CD、自动化、监控、反馈循环、与敏捷开发结合)、CALMS(Culture/Automation/Lean/Measurement/Sharing)

云软件开发的文化和实践;加速交付

教材:《The DevOps Handbook》(2016)
论文:《DevOps: A Survey》(2019)
方程式:① 部署频率 deployments/day;② 变更前置时间 lead_time;③ 变更失败率 change_fail_rate

Jenkins、GitLab、阿里云云效

D2387

实践:GitOps

GitOps(Git作为单一事实来源、声明式、自动同步、与CI/CD对比)

云Kubernetes部署的实践;提高可靠性和审计能力

教材:《GitOps: A Practical Guide》
论文:《GitOps: A Survey》(2020)
方程式:① 同步延迟 Tsync​=seconds;② 漂移检测 drift=desired−actual;③ 回滚时间 Trollback​=gitrevert

Argo CD、Flux、阿里云(类似)

D2388

实践:平台工程

Platform Engineering(内部开发者平台、黄金路径、自助服务、与DevOps对比)

云企业平台化建设的实践;提升开发者体验

教材:《Platform Engineering: A Practical Guide》
论文:《Platform Engineering: A Survey》(2022)
方程式:① 开发者满意度 satisfaction;② 黄金路径覆盖率 coverage=total_servicesplatform_services​;③ 自助服务请求数 requests

Backstage、阿里云(平台工程)

D2389

实践:FinOps文化与实践

FinOps(Collaboration/Visibility/Optimization/Continuous Improvement)、与成本治理结合

云财务管理的文化和实践;推动成本责任

教材:《FinOps: A Practical Guide》(续)
论文:《FinOps Culture and Practice》(2021)
方程式:① 成本可见性 visibility=tagged_cost/total;② 优化行动数 actions;③ 成本节省 savings

Kubecost、阿里云成本管家

D2390

实践:合规自动化

Compliance as Code(OPA/Rego、Cloud Custodian、AWS Config Rules、与手动审计对比)

云合规自动化的实践;持续监控和修复

教材:《Compliance as Code: A Practical Guide》
论文:《Automating Cloud Compliance》(2020)
方程式:① 合规规则数 rules;② 自动修复率 auto_fix_rate;③ 审计准备时间 Taudit_prep​

OPA、Cloud Custodian、阿里云合规

D2391

实践:零信任网络

Zero Trust Network(微隔离、身份验证、最小权限、与VPN对比)、Google BeyondCorp实现

云网络安全架构的实践;消除隐式信任

教材:《Zero Trust Networks: A Practical Guide》
论文:《Zero Trust Architecture》(2020)
方程式:① 微隔离策略数 policies;② 身份验证延迟 Tauth​;③ 横向移动抑制 lateral_movement_reduction

Google BeyondCorp、阿里云零信任

D2392

实践:数据网格

Data Mesh(领域数据所有权、数据产品、自助数据基础设施、联邦治理)、与数据湖对比

云数据架构的演进;解决数据湖的治理难题

教材:《Data Mesh: A Practical Guide》
论文:《Data Mesh: A New Paradigm for Data Management》(2020)
方程式:① 数据产品数 products;② 域数 domains;③ 数据消费延迟 Tconsume​

阿里云DataWorks(类似)

D2393

实践:湖仓一体

Lakehouse(数据湖+数据仓库、Delta Lake/Iceberg/Hudi、ACID on lake、与单独湖/仓对比)

云数据架构的融合趋势;统一批流分析和BI

教材:《Lakehouse: A Practical Guide》
论文:《Lakehouse: A New Generation of Open Platforms that Unify Data Warehousing and Advanced Analytics》(2020)
方程式:① 查询延迟 Tlakehouse​<Tlake​;② 数据新鲜度 freshness=real−time;③ 存储成本 costlakehouse​<costwarehouse​

Databricks Lakehouse、阿里云MaxCompute+OSS

D2394

实践:AI辅助开发

AI Pair Programming(GitHub Copilot、CodeWhisperer、通义灵码)、与手动编码对比

云软件开发的生产力提升;加速编码和调试

教材:《AI-Assisted Development: A Practical Guide》
论文:《GitHub Copilot: A Survey》(2023)
方程式:① 代码接受率 acceptance_rate;② 开发速度提升 speedup=Tai​Tmanual​​;③ 缺陷率 bug_rate

GitHub Copilot、阿里云通义灵码

D2395

实践:低代码/无代码

Low-Code/No-Code(可视化开发、拖拽组件、与专业开发对比)、典型平台(OutSystems、Mendix、钉钉宜搭)

云应用开发的平民化;降低开发门槛

教材:《Low-Code: A Practical Guide》
论文:《Low-Code Development Platforms: A Survey》(2021)
方程式:① 开发时间 Tlowcode​≪Tprocode​;② 可定制性 customizabilitylowcode​<customizabilityprocode​;③ 维护成本 maintenancelowcode​<maintenanceprocode​

OutSystems、阿里云宜搭

D2396

实践:数字孪生

云计算系统集成型解决方案 · 学科知识续表(第五十九轮:D2338~D2397,新增60个编号,聚焦AI训练推理、系统底层、安全前沿、云原生扩展、硬件创新与算法深化)

AI训练(LoRA/QLoRA微调、RLHF、DPO、MoE架构)、AI推理(FlashAttention、Speculative Decoding、KV Cache优化)、系统底层(Linux CFS调度器、slab分配器、VFS、网络协议栈收包路径)、安全前沿(K8s Pod Security Standards、容器逃逸、云安全红蓝对抗)、云原生扩展(Operator模式、Helm Chart、Kustomize、Tekton、Argo Workflows、Crossplane Composition)、硬件创新(SmartNIC、CXL Type 1/2、计算存储融合、近数据处理)、算法深化(哈希表、跳表、布隆过滤器、一致性哈希、Raft成员变更)、协议细节(gRPC、GraphQL、WebSocket、RSocket)、实践方法(云迁移策略、TCO分析、容量规划、弹性伸缩)。所有教材、论文、标准均锚定权威来源。


📋 续表(D2338 ~ D2397)

编号

学科(课程)

核心知识点

在云计算/云存储/云网络/云安全/云MaaS中的作用

代表教材/资料/论文 + 数学方程式列表

工业界应用

D2338

AI训练:LoRA/QLoRA微调

LoRA(Low-Rank Adaptation,秩分解矩阵注入,冻结原权重)、QLoRA(量化LoRA,4-bit NormalFloat,双量化,分页优化器)、与全参数微调对比

云AI大模型高效微调技术;大幅降低显存和计算需求,支撑模型定制

教材:《LoRA: Low-Rank Adaptation of Large Language Models》(2021)
论文:《QLoRA: Efficient Finetuning of Quantized Language Models》(2023)
方程式:① LoRA更新 W′=W+BA,rank r≪d;② QLoRA显存 mem≈4×model_size;③ 训练加速 speedup≈2−4x

HuggingFace PEFT、阿里云PAI

D2339

AI训练:RLHF/DPO

RLHF(Reinforcement Learning from Human Feedback,奖励模型+PPO)、DPO(Direct Preference Optimization,无需奖励模型,直接优化策略)、与RM训练对比

云AI大模型对齐技术;使模型符合人类偏好

教材:《Training Language Models to Follow Instructions with Human Feedback》(2022)
论文:《Direct Preference Optimization》(2023)
方程式:① RLHF目标 maxπ​E[r(s,a)]−βKL(π∥πref​);② DPO损失 $\mathcal{L}_{DPO} = -\mathbb{E}[\log \sigma(\beta \log \frac{\pi(y_w

x)}{\pi_{ref}(y_w

D2340

AI架构:MoE(Mixture-of-Experts)

MoE层(多个专家网络、门控路由、Top-k稀疏激活)、负载均衡损失、与密集模型对比(参数量相同但计算量更小)

云AI大模型缩放技术;在不显著增加计算量的前提下扩大参数量

教材:《Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer》(2017)
论文:《Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity》(2021)
方程式:① 专家数 E;② Top-k选择 k;③ 负载均衡损失 Lbalance​=α⋅CV(load)2

Google Switch Transformer、Mixtral 8x7B、阿里云通义千问MoE

D2341

AI推理:FlashAttention

FlashAttention(分块计算注意力、IO感知算法、tiling、重计算)、FlashAttention-2(减少非矩阵乘法运算)、与标准Attention对比

云AI推理/训练加速;显著降低显存带宽需求,提升长序列处理能力

教材:《FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness》(2022)
论文:《FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning》(2023)
方程式:① 内存复杂度 O(N2)→O(N)(通过分块);② 加速比 speedup≈2−4x;③ 块大小 Bc​,Br​

NVIDIA cuDNN、vLLM、阿里云PAI

D2342

AI推理:Speculative Decoding

Speculative Decoding(草稿模型快速生成候选序列,目标模型验证)、拒绝采样、与自回归解码对比

云AI推理加速技术;在不牺牲质量的前提下降低延迟

教材:《Fast Inference from Transformers via Speculative Decoding》(2023)
论文:《Speculative Decoding: A Survey》(2024)
方程式:① 接受率 α=total_draft_tokensaccepted_tokens​;② 加速比 speedup=(1−α)+α⋅Ttarget​/Tdraft​1​;③ 草稿模型大小 sizedraft​≪sizetarget​

Google Medusa、阿里云PAI

D2343

AI推理:KV Cache优化

KV Cache(键值缓存、预填充+解码阶段)、PagedAttention(vLLM、按页管理KV Cache)、GQA(Grouped Query Attention)、MLA(Multi-head Latent Attention)

云LLM推理显存管理核心技术;支撑高并发和长上下文

教材:《Efficient Memory Management for Large Language Model Serving with PagedAttention》(2023)
论文:《GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints》(2023)
方程式:① KV Cache大小 size=batch×seq_len×layers×head_dim×2×dtype_size;② GQA压缩比 ratio=n_kv_headsn_heads​;③ 页面利用率 utilization=allocated_pagesused_pages​

vLLM、TensorRT-LLM、阿里云PAI

D2344

操作系统:Linux CFS调度器

Completely Fair Scheduler(虚拟运行时间vruntime、红黑树、nice值权重)、组调度(cgroup cpu.shares)、与实时调度(RT/FIFO)对比

云服务器CPU资源分配的核心;影响容器和VM的公平性

教材:《Linux Kernel Development》(3rd ed. 2010)
论文:《CFS: A Completely Fair Scheduler》(2007)
方程式:① vruntime = actual_runtime × nice_weight;② 调度延迟 Tslice​=period/nr_running;③ 权重比例 weight=1024/1.25nice

Linux内核、阿里云(调度优化)

D2345

操作系统:slab分配器

slab(对象缓存、着色、每CPU缓存)、slub(简化版、队列)、与伙伴系统(buddy system)对比

云服务器内核内存分配的性能优化;减少碎片和提高分配速度

教材:《Understanding the Linux Kernel》(续)
论文:《The Slab Allocator: An Object-Caching Kernel Memory Allocator》(1994)
方程式:① slab大小 slab_size=object_size+metadata;② 着色偏移 color=cache_line×color_count;③ 分配延迟 Talloc​≈100ns

Linux内核、阿里云(内存优化)

D2346

操作系统:VFS(Virtual File System)

VFS超级块、inode、dentry、file结构、与具体文件系统(ext4/xfs/btrfs)的交互、page cache

云服务器文件系统抽象层;支持多种底层存储的统一接口

教材:《Linux File Systems: A Practical Guide》
论文:《VFS: The Virtual File System》(2018)
方程式:① 文件操作延迟 Tvfs​=Tlookup​+Tinode​+Tdata​;② page cache命中率 hit_rate=total_readscache_hits​;③ 目录项缓存 dentry_cache

Linux内核、阿里云(文件存储)

D2347

操作系统:网络协议栈收包路径

NIC -> DMA -> ring buffer -> hard IRQ -> softirq (NET_RX_SOFTIRQ) -> GRO -> protocol layer (IP/TCP) -> socket -> application;NAPI(轮询+中断结合)

云服务器网络收包性能关键路径;影响网络延迟和吞吐

教材:《Linux Networking: A Practical Guide》
论文:《NAPI: A New API for Improving Network Performance》(2003)
方程式:① 收包延迟 Trx​=Tdma​+Tirq​+Tsoftirq​+Tprotocol​;② NAPI轮询预算 budget=300 packets;③ 吞吐上限 BWmax​=Trx​packets​

Linux内核、DPDK、阿里云(网络优化)

D2348

安全:K8s Pod Security Standards

Pod Security Standards(Restricted/Baseline/Privileged)、Pod Security Admission(PSA)、与PodSecurityPolicy(已弃用)对比

云Kubernetes Pod安全基线;强制最小权限原则

教材:《Kubernetes Security: A Practical Guide》(续)
论文:《Pod Security Standards in Kubernetes》(2021)
方程式:① 策略级别 level∈privileged,baseline,restricted;② 违反数 violations;③ 合规率 compliance=totalpass​

Kubernetes、阿里云ACK

D2349

安全:容器逃逸

容器逃逸技术(CVE-2019-5736(runC)、CVE-2022-0492(cgroup)、kernel exploit、mount namespace escape)、与防御措施(seccomp、AppArmor、user namespace)

云容器安全的重要威胁;了解攻击面以加强防护

教材:《Container Security: A Practical Guide》
论文:《Container Escape: A Survey》(2020)
方程式:① 逃逸成功率 success_rate=f(kernel_vuln);② 检测时间 MTTD;③ 防御覆盖 coverage=seccomp+apparmor+capabilities

Docker、Kubernetes、阿里云容器安全

D2350

安全:云安全红蓝对抗

红队(模拟攻击、渗透测试、社工)、蓝队(检测、响应、溯源)、紫队(协同改进)、ATT&CK框架(TTP mapping)

云安全能力的实战检验;持续提升安全防御水平

教材:《Red Team: A Practical Guide》
论文:《Cloud Security Red Teaming》(2021)
方程式:① 攻击成功路径数 paths;② 检测覆盖率 coverage=total_attacksdetected​;③ 修复时间 MTTR

AWS GameDay、阿里云安全演练

D2351

云原生:Operator模式

Operator(Kubernetes扩展、CRD+Controller、Reconcile loop)、Helm Operator、Ansible Operator、与手动管理对比

云Kubernetes应用自动化管理;实现有状态应用的运维自动化

教材:《Kubernetes Operators: A Practical Guide》
论文:《The Operator Pattern》(2018)
方程式:① Reconcile循环 loop=watch(obj)→compare(state)→action;② CRD版本数 versions;③ 控制器复杂度 complexity=f(resources)

etcd Operator、Prometheus Operator、阿里云ACK

D2352

云原生:Helm Chart

Helm(Chart模板、values.yaml、release管理、hooks)、Chart Repository、与Kustomize对比

云Kubernetes应用打包和分发标准;简化部署配置

教材:《Helm: A Practical Guide》
论文:《Helm: A Package Manager for Kubernetes》(2019)
方程式:① 模板渲染 render=template(values);② 依赖管理 dependencies=subcharts;③ 升级回滚 rollback=revision_history

Helm、阿里云ACK

D2353

云原生:Kustomize

Kustomize(kustomization.yaml、bases/overlays、patches、configMapGenerator)、与Helm对比

云Kubernetes配置管理工具;原生支持,无需模板语言

教材:《Kustomize: A Practical Guide》
论文:《Kustomize: Declarative Configuration Customization》(2020)
方程式:① 资源数 resources;② 补丁数 patches;③ 覆盖层数 layers

kubectl、阿里云ACK

D2354

云原生:Tekton

Tekton(Kubernetes-native CI/CD、Task/Pipeline/PipelineRun、Trigger、与Jenkins对比)

云Kubernetes CI/CD引擎;云原生、可移植

教材:《Tekton: A Practical Guide》
论文:《Tekton: A Cloud-Native CI/CD Pipeline》(2020)
方程式:① Pipeline步骤数 steps;② 并行度 parallelism;③ 构建时间 Tbuild​=∑Ttask​

Tekton(CNCF)、阿里云(类似)

D2355

云原生:Argo Workflows

Argo Workflows(DAG-based workflow、template、artifact、与Tekton对比)

云Kubernetes工作流引擎;适合数据处理和ML pipeline

教材:《Argo Workflows: A Practical Guide》
论文:《Argo Workflows: A Container-Native Workflow Engine》(2019)
方程式:① 工作流节点数 nodes;② 依赖图 DAG;③ 执行时间 Twf​=critical_path

Argo(CNCF)、阿里云(类似)

D2356

云原生:Crossplane Composition

Crossplane(Control Plane、Provider、Composition、Claim、CompositeResourceDefinition)

云多云基础设施编排的声明式方法;实现平台工程

教材:《Crossplane: A Practical Guide》
论文:《Crossplane: A Control Plane for Your Infrastructure》(2021)
方程式:① 复合资源数 XRs;② 组合方案数 compositions;③ 索赔数 claims

Crossplane(CNCF)、阿里云(类似)

D2357

硬件:SmartNIC

SmartNIC(智能网卡、ARM/FPGA offload、OVS/DPDK加速、与普通NIC对比)

云数据中心网络卸载和加速;释放CPU资源

教材:《SmartNIC: A Practical Guide》
论文:《SmartNIC: A Survey》(2020)
方程式:① 卸载吞吐 BWsmartnic​=100Gbps;② CPU节省率 saving=totalCPU_cycles_offloaded​;③ 延迟 Tsmartnic​≈1μs

NVIDIA BlueField、Intel IPU、阿里云CIPU

D2358

硬件:CXL Type 1/2设备

CXL Type 1(加速器、缓存一致性)、Type 2(加速器、内存语义)、Type 3(内存扩展器)、与PCIe对比

云数据中心异构计算和内存池化的硬件基础;支持GPU/FPGA与CPU共享内存

教材:《CXL 3.0: A Practical Guide》(续)
论文:《CXL Type 1 and Type 2 Devices》(2022)
方程式:① 缓存一致性粒度 cache_line=64B;② 内存语义带宽 BWmem​=f(link_width);③ 延迟 Tcxl​≈100−200ns

Intel、NVIDIA、阿里云(CXL研究)

D2359

硬件:计算存储融合

Computational Storage(SSD内置处理器、near-data processing、NVMe Compute Program Set)、与主机端处理对比

云存储的近数据处理;减少数据移动,降低延迟

教材:《Computational Storage: A Practical Guide》
论文:《Computational Storage: A Survey》(2021)
方程式:① 数据移动减少 reduction=data_moved_withdata_moved_without​;② 加速比 speedup=Tcsp​Thost​​;③ 能耗节省 power_saving

Samsung SmartSSD、阿里云(研究)

D2360

硬件:近数据处理

Near-Data Processing(NDP、将计算移至数据所在位置、PIM(Processing-in-Memory)、与冯诺依曼架构对比)

云内存计算的硬件架构;突破内存墙

教材:《Near-Data Processing: A Practical Guide》
论文:《Near-Data Processing: A Survey》(2020)
方程式:① 内存带宽利用 util=data_movementcomputation​;② 加速比 speedup=Tndp​Tvon_neumann​​;③ 能效比 energy_eff

UPMEM、Samsung HBM-PIM、阿里云(研究)

D2361

算法:哈希表

哈希函数(MD5/SHA/xxHash)、冲突解决(链地址法/开放地址法/二次探查/双重哈希)、负载因子、rehash、与一致性哈希对比

云数据库和缓存的索引基础;支撑快速键值查找

教材:《Introduction to Algorithms》(续)
论文:《Hash Tables: A Survey》(2019)
方程式:① 期望查找时间 Tfind​=O(1+α),α=n/m;② 冲突概率 Pcollision​≈1−e−n/m;③ rehash代价 O(n)

Redis、Memcached、阿里云Redis

D2362

算法:跳表(Skip List)

跳表(多层链表、概率平衡、插入/删除/查找O(log n))、与平衡树(AVL/红黑树)对比

云数据库的有序集合实现;Redis Sorted Set的底层之一

教材:《Skip Lists: A Probabilistic Alternative to Balanced Trees》(1989)
论文:《Skip Lists: A Survey》(2020)
方程式:① 层级概率 p=0.5;② 期望高度 h=log1/p​n;③ 查找步数 steps≈log1/p​n

Redis ZSET、LevelDB MemTable、阿里云Redis

D2363

算法:布隆过滤器(Bloom Filter)

Bloom Filter(位数组+k个哈希函数、存在性判断、假阳性、不支持删除)、Counting Bloom Filter、与Cuckoo Filter对比

云数据库和缓存的去重与加速;减少不必要的磁盘/网络访问

教材:《Bloom Filters: A Survey》(2019)
论文:《Space/Time Trade-offs in Hash Coding with Allowable Errors》(1970)
方程式:① 假阳性率 Pfp​=(1−e−kn/m)k;② 最优哈希数 kopt​=nm​ln2;③ 位数组大小 m=−(ln2)2nlnPfp​​

Redis Bloom模块、Cassandra、阿里云(缓存)

D2364

算法:一致性哈希(Consistent Hashing)

Consistent Hashing(哈希环、虚拟节点、最小化rehash)、与普通哈希对比

云分布式缓存和负载均衡的关键算法;支撑动态扩缩容

教材:《Consistent Hashing: A Survey》(2020)
论文:《Consistent Hashing and Random Trees》(1997)
方程式:① 迁移比例 migration=N1​(vs 普通哈希 ≈NN−1​);② 虚拟节点数 vnodes;③ 负载均衡标准差 std_dev

Redis Cluster、Amazon Dynamo、阿里云Redis

D2365

算法:Raft成员变更

Raft成员变更(joint consensus、single-server变更、与Paxos对比)、安全性证明

云分布式共识算法的集群变更;支撑在线扩缩容

教材:《In Search of an Understandable Consensus Algorithm》(2014)
论文:《Raft Membership Changes: A Practical Guide》(2019)
方程式:① Joint consensus阶段 Cold​∪Cnew​;② 单节点变更 change_one_node;③ 安全性 safety=majority_intersection

etcd、TiKV、阿里云(分布式系统)

D2366

协议:gRPC

gRPC(HTTP/2、Protobuf、四种通信模式(Unary/Server Streaming/Client Streaming/Bidirectional Streaming)、拦截器、与REST对比)

云微服务间高性能通信协议;支撑服务网格和API网关

教材:《gRPC: A Practical Guide》
论文:《gRPC: A High Performance RPC Framework》(2016)
方程式:① 序列化速度 speedprotobuf​>speedjson​;② 消息大小 sizeprotobuf​<sizejson​;③ 延迟 Tgrpc​≈1ms

gRPC(CNCF)、阿里云(微服务)

D2367

协议:GraphQL

GraphQL(查询语言、schema、resolver、subscription、与REST对比)

云API的数据查询语言;灵活获取所需数据

教材:《GraphQL: A Practical Guide》
论文:《GraphQL: A Data Query Language》(2015)
方程式:① 查询深度 depth;② 字段选择 fields;③ 响应大小 response=f(query)

Apollo GraphQL、阿里云(API网关)

D2368

协议:WebSocket

WebSocket(全双工、ws://、帧格式、与HTTP长轮询对比)

云实时通信协议;支撑推送、聊天、协作

教材:《WebSocket: A Practical Guide》
论文:《WebSocket: A Real-Time Communication Protocol》(2011)
方程式:① 握手延迟 Thandshake​=1RTT;② 帧开销 overhead=2−14 bytes;③ 消息吞吐 msg/s

WebSocket API、阿里云(实时通信)

D2369

协议:RSocket

RSocket(反应式、多路复用、背压、四种交互模式(fire-and-forget/request-response/request-stream/channel)、与WebSocket对比)

云微服务反应式通信协议;支撑异步、背压和流式交互

教材:《RSocket: A Practical Guide》
论文:《RSocket: A Reactive Application Protocol》(2018)
方程式:① 多路复用 multiplex=stream_id;② 背压信号 demand=request(n);③ 协议开销 overhead≈12 bytes

RSocket-Java、阿里云(反应式)

D2370

实践:云迁移策略

6R策略(Rehost/Replatform/Refactor/Repurchase/Retire/Retain)、迁移评估(TCO、依赖分析、风险)、与lift-and-shift对比

云迁移的方法论;指导企业上云路径

教材:《Cloud Migration: A Practical Guide》
论文:《Cloud Migration Strategies: A Survey》(2020)
方程式:① 迁移总成本 TCOcloud​=compute+storage+network+services;② 迁移时间 Tmigrate​=f(workloads);③ ROI ROI=costsbenefits−costs​

AWS Migration Hub、阿里云迁云

D2371

实践:TCO分析

Total Cost of Ownership(基础设施、软件许可、运维人力、电力、网络)、与on-premises对比

云成本决策的依据;量化上云收益

教材:《Cloud TCO: A Practical Guide》
论文:《TCO Analysis for Cloud Migration》(2019)
方程式:① TCO TCO=CapEx+OpEx;② 三年TCO TCO3yr​=∑t=02​(CapExt​+OpExt​);③ 盈亏平衡点 break_even=OpExonprem​−OpExcloud​Capexcloud​−Capexonprem​​

AWS TCO Calculator、阿里云TCO

D2372

实践:容量规划

容量规划(需求预测、峰值/均值、预留/按需/Spot组合、弹性伸缩策略)、与过度/不足供给对比

云资源规划的实践;平衡成本和性能

教材:《Capacity Planning: A Practical Guide》
论文:《Cloud Capacity Planning: A Survey》(2020)
方程式:① 需求预测 demand(t)=baseline+trend+seasonality;② 预留比例 reservation_ratio=peak_loadbase_load​;③ 不足供给概率 Punder​=f(buffer)

AWS Compute Optimizer、阿里云弹性伸缩

D2373

实践:弹性伸缩

水平伸缩(增加/减少实例)、垂直伸缩(升降规格)、预测性伸缩(ML-based)、与定时伸缩对比

云资源自动伸缩的实践;应对负载变化

教材:《Auto Scaling: A Practical Guide》
论文:《Auto Scaling in Cloud: A Survey》(2019)
方程式:① 冷却时间 cooldown=seconds;② 扩容阈值 thresholdscale_up​=CPU>70%;③ 缩容阈值 thresholdscale_down​=CPU<30%

AWS Auto Scaling、阿里云弹性伸缩

D2374

实践:蓝绿部署/金丝雀发布

蓝绿部署(两套环境、流量切换)、金丝雀发布(逐步放量、监控、回滚)、与滚动更新对比

云应用发布的策略;降低发布风险

教材:《Deployment Strategies: A Practical Guide》
论文:《Blue-Green vs Canary Deployment》(2020)
方程式:① 金丝雀比例 canary_%=10%;② 回滚时间 Trollback​=seconds;③ 错误率容忍 error_tolerance=threshold

Kubernetes、阿里云EDAS

D2375

实践:可观测性三大支柱

Metrics(Prometheus)、Traces(Jaeger/Zipkin)、Logs(ELK/Loki)、与OpenTelemetry统一

云应用可观测性的实践;快速定位问题

教材:《Observability: A Practical Guide》
论文:《The Three Pillars of Observability》(2018)
方程式:① 指标维度 dimensions;② 追踪采样率 sampling_rate;③ 日志查询延迟 Tquery​

Prometheus、Jaeger、ELK、阿里云ARMS

D2376

实践:故障注入测试

故障注入(网络延迟/丢包、CPU压力、磁盘IO hang、进程kill)、与混沌工程结合

云系统韧性验证的实践;提前暴露弱点

教材:《Fault Injection Testing: A Practical Guide》
论文:《Fault Injection in Cloud Systems》(2019)
方程式:① 故障类型数 types;② 注入持续时间 duration;③ 系统恢复时间 Trecovery​

Chaos Mesh、Litmus、阿里云AHAS

D2377

实践:成本优化策略

成本优化(Right-sizing、Spot实例、预留实例、Savings Plans、存储分层、数据压缩)、与FinOps结合

云成本控制的实践;最大化资源利用率

教材:《Cloud Cost Optimization: A Practical Guide》
论文:《Cloud Cost Optimization Strategies》(2020)
方程式:① 节省率 savings=original_costoriginal_cost−optimized_cost​;② Spot折扣 discountspot​≈60−90%;③ 预留覆盖率 coverage=total_hoursreserved_hours​

AWS Cost Explorer、阿里云成本管家

D2378

实践:安全基线加固

CIS Benchmarks(Center for Internet Security)、操作系统/数据库/中间件加固、最小权限、与自动化扫描

云安全基线的实践;满足合规要求

教材:《CIS Benchmarks: A Practical Guide》
论文:《Security Baseline Hardening》(2019)
方程式:① 检查项数 checks;② 合规评分 score=totalpassed​;③ 修复时间 MTTR

CIS Benchmarks、阿里云安全基线

D2379

实践:备份与恢复策略

备份策略(全量/增量/差异)、RPO/RTO、异地备份、与3-2-1规则

云数据保护的实践;应对数据丢失和灾难

教材:《Backup and Recovery: A Practical Guide》
论文:《Cloud Backup Strategies》(2020)
方程式:① RPO RPO=backup_interval;② RTO RTO=restore_time;③ 备份成本 cost=storage+transfer

AWS Backup、阿里云备份

D2380

实践:灾难恢复(DR)

DR策略(备份/冷备/温备/热备/多活)、RPO/RTO目标、与故障转移测试

云业务连续性的实践;应对区域级故障

教材:《Disaster Recovery: A Practical Guide》
论文:《Cloud Disaster Recovery Strategies》(2019)
方程式:① 可用性 availability=1−total_timedowntime​;② 故障转移时间 Tfailover​;③ 数据丢失量 data_loss=RPO×write_rate

AWS DR、阿里云容灾

D2381

实践:多活架构

Active-Active(多区域同时提供服务、数据冲突解决、全局负载均衡)、与Active-Passive对比

云高可用架构的实践;实现零RPO和接近零RTO

教材:《Multi-Region Active-Active Architecture》(2021)
论文:《Active-Active Geo-Distributed Architecture》(2020)
方程式:① 写入延迟 Twrite​=f(geo_distance);② 冲突率 conflict_rate=f(write_frequency);③ 最终一致性窗口 window=replication_lag

AWS Global Tables、阿里云全球数据库

D2382

实践:Serverless架构设计

Serverless(FaaS+BaaS、事件驱动、冷启动优化、与单体/微服务对比)

云Serverless应用的实践;降低运维成本

教材:《Serverless Architectures: A Practical Guide》
论文:《Serverless Computing: A Survey》(2020)
方程式:① 冷启动延迟 Tcold​≈100ms−1s;② 并发限制 concurrency=1000(per function);③ 成本 cost=invocations×duration×memory

AWS Lambda、阿里云函数计算

D2383

实践:事件驱动架构

Event-Driven Architecture(事件总线、EventBridge、Kafka、与请求驱动对比)、事件溯源(Event Sourcing)

云事件驱动应用的实践;解耦和异步处理

教材:《Event-Driven Architecture: A Practical Guide》
论文:《Event-Driven Architecture: A Survey》(2021)
方程式:① 事件吞吐 events/s;② 事件延迟 Tevent​=produce+transport+consume;③ 事件大小 size

AWS EventBridge、阿里云事件总线

D2384

实践:领域驱动设计(DDD)

Domain-Driven Design(限界上下文、聚合、实体/值对象、领域事件、与微服务拆分)

云微服务设计的建模方法;指导服务边界划分

教材:《Domain-Driven Design: Tackling Complexity in the Heart of Software》(2003)
论文:《DDD and Microservices》(2019)
方程式:① 聚合大小 agg_size=entities+value_objects;② 上下文映射 context_map=relationships;③ 服务粒度 granularity=bounded_context

阿里云(微服务设计)

D2385

实践:API设计规范

RESTful API(资源命名、HTTP动词、状态码、版本控制)、OpenAPI/Swagger、与GraphQL对比

云API设计的实践;保证接口的一致性和可维护性

教材:《API Design: A Practical Guide》
论文:《RESTful API Design Best Practices》(2020)
方程式:① 端点数 endpoints;② 响应时间 Tapi​≤200ms;③ 版本号 version=v1,v2

OpenAPI、阿里云API网关

D2386

实践:DevOps文化与实践

DevOps(CI/CD、自动化、监控、反馈循环、与敏捷开发结合)、CALMS(Culture/Automation/Lean/Measurement/Sharing)

云软件开发的文化和实践;加速交付

教材:《The DevOps Handbook》(2016)
论文:《DevOps: A Survey》(2019)
方程式:① 部署频率 deployments/day;② 变更前置时间 lead_time;③ 变更失败率 change_fail_rate

Jenkins、GitLab、阿里云云效

D2387

实践:GitOps

GitOps(Git作为单一事实来源、声明式、自动同步、与CI/CD对比)

云Kubernetes部署的实践;提高可靠性和审计能力

教材:《GitOps: A Practical Guide》
论文:《GitOps: A Survey》(2020)
方程式:① 同步延迟 Tsync​=seconds;② 漂移检测 drift=desired−actual;③ 回滚时间 Trollback​=gitrevert

Argo CD、Flux、阿里云(类似)

D2388

实践:平台工程

Platform Engineering(内部开发者平台、黄金路径、自助服务、与DevOps对比)

云企业平台化建设的实践;提升开发者体验

教材:《Platform Engineering: A Practical Guide》
论文:《Platform Engineering: A Survey》(2022)
方程式:① 开发者满意度 satisfaction;② 黄金路径覆盖率 coverage=total_servicesplatform_services​;③ 自助服务请求数 requests

Backstage、阿里云(平台工程)

D2389

实践:FinOps文化与实践

FinOps(Collaboration/Visibility/Optimization/Continuous Improvement)、与成本治理结合

云财务管理的文化和实践;推动成本责任

教材:《FinOps: A Practical Guide》(续)
论文:《FinOps Culture and Practice》(2021)
方程式:① 成本可见性 visibility=tagged_cost/total;② 优化行动数 actions;③ 成本节省 savings

Kubecost、阿里云成本管家

D2390

实践:合规自动化

Compliance as Code(OPA/Rego、Cloud Custodian、AWS Config Rules、与手动审计对比)

云合规自动化的实践;持续监控和修复

教材:《Compliance as Code: A Practical Guide》
论文:《Automating Cloud Compliance》(2020)
方程式:① 合规规则数 rules;② 自动修复率 auto_fix_rate;③ 审计准备时间 Taudit_prep​

OPA、Cloud Custodian、阿里云合规

D2391

实践:零信任网络

Zero Trust Network(微隔离、身份验证、最小权限、与VPN对比)、Google BeyondCorp实现

云网络安全架构的实践;消除隐式信任

教材:《Zero Trust Networks: A Practical Guide》
论文:《Zero Trust Architecture》(2020)
方程式:① 微隔离策略数 policies;② 身份验证延迟 Tauth​;③ 横向移动抑制 lateral_movement_reduction

Google BeyondCorp、阿里云零信任

D2392

实践:数据网格

Data Mesh(领域数据所有权、数据产品、自助数据基础设施、联邦治理)、与数据湖对比

云数据架构的演进;解决数据湖的治理难题

教材:《Data Mesh: A Practical Guide》
论文:《Data Mesh: A New Paradigm for Data Management》(2020)
方程式:① 数据产品数 products;② 域数 domains;③ 数据消费延迟 Tconsume​

阿里云DataWorks(类似)

D2393

实践:湖仓一体

Lakehouse(数据湖+数据仓库、Delta Lake/Iceberg/Hudi、ACID on lake、与单独湖/仓对比)

云数据架构的融合趋势;统一批流分析和BI

教材:《Lakehouse: A Practical Guide》
论文:《Lakehouse: A New Generation of Open Platforms that Unify Data Warehousing and Advanced Analytics》(2020)
方程式:① 查询延迟 Tlakehouse​<Tlake​;② 数据新鲜度 freshness=real−time;③ 存储成本 costlakehouse​<costwarehouse​

Databricks Lakehouse、阿里云MaxCompute+OSS

D2394

实践:AI辅助开发

AI Pair Programming(GitHub Copilot、CodeWhisperer、通义灵码)、与手动编码对比

云软件开发的生产力提升;加速编码和调试

教材:《AI-Assisted Development: A Practical Guide》
论文:《GitHub Copilot: A Survey》(2023)
方程式:① 代码接受率 acceptance_rate;② 开发速度提升 speedup=Tai​Tmanual​​;③ 缺陷率 bug_rate

GitHub Copilot、阿里云通义灵码

D2395

实践:低代码/无代码

Low-Code/No-Code(可视化开发、拖拽组件、与专业开发对比)、典型平台(OutSystems、Mendix、钉钉宜搭)

云应用开发的平民化;降低开发门槛

教材:《Low-Code: A Practical Guide》
论文:《Low-Code Development Platforms: A Survey》(2021)
方程式:① 开发时间 Tlowcode​≪Tprocode​;② 可定制性 customizabilitylowcode​<customizabilityprocode​;③ 维护成本 maintenancelowcode​<maintenanceprocode​

OutSystems、阿里云宜搭

D2396

实践:数字孪生

云计算系统集成型解决方案 · 学科知识续表(第六十一轮:D2456~D2515,新增60个编号,聚焦虚拟化、MIG、多租户、虚拟机、容器、裸金属、内存管理、操作系统、云管理系统和云运维系统中的数学)


📋 续表(D2456 ~ D2515)

编号

学科(课程)

核心知识点

在云计算/云存储/云网络/云安全/云MaaS中的作用

代表教材/资料/论文 + 数学方程式列表

工业界应用

D2456

虚拟化:CPU虚拟化(VT-x/AMD-V)

VMX root/non-root operation、VMCS、EPT(Extended Page Table)、VPID、硬件辅助虚拟化

云服务器CPU虚拟化的基础;实现高性能虚拟机

教材:《Intel® 64 and IA-32 Architectures Software Developer’s Manual》
论文:《A Comparison of Software and Hardware Techniques for x86 Virtualization》(2006)
方程式:① VM-entry延迟 Tentry​≈1μs;② EPT缺页处理 Tept_miss​≈100ns;③ 虚拟化开销 overhead≈5%

VMware ESXi、KVM、阿里云ECS

D2457

虚拟化:内存虚拟化(影子页表/EPT)

Shadow Page Table(软件维护、慢)、EPT(硬件、两级地址转换)、TLB shootdown、与内存超分

云虚拟机内存管理的核心;支持内存超分和迁移

教材:《Virtual Machines: Versatile Platforms for Systems and Processes》(2005)
论文:《Memory Resource Management in VMware ESX Server》(2002)
方程式:① 影子页表内存开销 memshadow​=n_guest_pages×sizeof(pte);② EPT转换次数 walks=2×(guest_walk+host_walk);③ 内存超分比 overcommit=physical_memorytotal_allocated​

KVM、VMware、阿里云ECS

D2458

虚拟化:I/O虚拟化(VT-d/SR-IOV)

VT-d(DMA重映射、中断重映射)、SR-IOV(Physical Function/Virtual Function、直通)、virtio(半虚拟化)

云虚拟机I/O性能的关键;实现近原生网络/存储性能

教材:《PCI Express Base Specification》
论文:《SR-IOV: A Scalable I/O Virtualization》(2009)
方程式:① SR-IOV延迟 Tsr−iov​≈1μs;② virtio延迟 Tvirtio​≈10μs;③ 直通吞吐 BWpassthrough​≈native

Intel VT-d、Mellanox ConnectX、阿里云ECS

D2459

虚拟化:MIG(Multi-Instance GPU)调度

NVIDIA MIG(GPU分区为多个独立实例、计算/显存/带宽隔离、与vGPU对比)、MIG配置策略

云GPU实例的细粒度切分;提高GPU利用率和多租户隔离

教材:《NVIDIA Multi-Instance GPU User Guide》
论文:《MIG: Multi-Instance GPU for Cloud》(2020)
方程式:① 实例数 instancesA100​=7;② 每个实例显存 memi​=740GB​;③ 性能隔离度 isolation=1−interference

NVIDIA A100/H100、阿里云GPU实例

D2460

多租户:性能隔离(CPU/内存/网络)

CPU份额(CFS quota/period)、内存限制(cgroup memory.limit_in_bytes)、网络带宽限制(TC/tbf)、与干扰检测

云多租户环境下保障服务质量;防止“吵闹邻居”效应

教材:《Linux Kernel cgroup Documentation》
论文:《Borg: The Next Generation》(2015)
方程式:① CPU份额 cpu_share=∑weightj​weighti​​;② 内存硬限制 limit=bytes;③ 网络带宽 rate=token_bucket(r,b)

Kubernetes、阿里云ECS

D2461

多租户:安全隔离(侧信道/缓存隔离)

Cache Partitioning(CAT/Intel RDT)、Cache Coloring、与侧信道攻击防御

云多租户安全的关键;防止跨VM/跨容器信息泄露

教材:《Intel Resource Director Technology (RDT) White Paper》
论文:《Cache Attacks and Countermeasures: A Survey》(2018)
方程式:① CAT掩码 mask=bitmask;② 缓存污染概率 Pcontamination​=total_setsshared_sets​;③ 侧信道信噪比 SNR=noisesignal​

Intel RDT、阿里云(安全隔离)

D2462

虚拟机监控器:Type 1 vs Type 2

Type 1(Bare-metal hypervisor、VMware ESXi/Xen/KVM)、Type 2(Hosted、VirtualBox/VMware Workstation)、与性能/功能对比

云虚拟化平台选型;Type 1用于数据中心,Type 2用于桌面

教材:《Virtualization: From the Desktop to the Enterprise》(2008)
论文:《A Comparison of Type 1 and Type 2 Hypervisors》(2019)
方程式:① 性能损耗 losstype1​≈2%,losstype2​≈10%;② 功能丰富度 featuretype2​>featuretype1​;③ 隔离性 isolationtype1​>isolationtype2​

VMware ESXi、KVM、VirtualBox

D2463

容器运行时:runc/crun/gVisor/Kata

runc(OCI规范、runc/libcontainer)、crun(C语言、更快)、gVisor(用户态内核、沙箱)、Kata Containers(轻量VM、硬件虚拟化)

云容器运行时的安全与性能选型;runc默认,gVisor/Kata安全

教材:《Container Runtimes: A Comparison》(续)
论文:《gVisor: A Sandboxed Container Runtime》(2019)
方程式:① 启动时间 Trunc​≈100ms,Tgvisor​≈500ms,Tkata​≈2s;② 隔离性 isolkata​>isolgvisor​>isolrunc​;③ 性能开销 overheadrunc​≈0%,overheadgvisor​≈20%,overheadkata​≈10%

Docker、containerd、阿里云容器服务

D2464

裸金属管理:IPMI/Redfish/OpenBMC

IPMI(Intelligent Platform Management Interface、带外管理)、Redfish(RESTful、JSON Schema)、OpenBMC(开源BMC)

云裸金属服务器的远程管理;支撑自动化运维

教材:《IPMI Specification v2.0》
论文:《OpenBMC: An Open-Source BMC》(2019)
方程式:① 管理网络延迟 Tmgmt​≈100ms;② 传感器采样频率 freq=1Hz;③ 电源状态切换时间 Tpower_toggle​≈5s

Dell iDRAC、HP iLO、阿里云BMC

D2465

裸金属调度:OpenStack Ironic

Ironic(裸金属 provisioning、PXE/iPXE、conductor、cleaning/deploying)、与VM调度对比

云裸金属资源的自动化调度;支撑高性能计算和数据库

教材:《OpenStack Ironic Documentation》
论文:《Ironic: Bare Metal Provisioning for OpenStack》(2015)
方程式:① 部署时间 Tdeploy​=PXE+OS_install+config≈10min;② 节点数 nodes;③ 并发部署数 parallel_deploys

OpenStack Ironic、阿里云裸金属

D2466

内存管理:NUMA

NUMA(Non-Uniform Memory Access、本地/远端内存访问延迟不同)、NUMA node、numactl、与UMA对比

云服务器内存访问性能优化;避免跨NUMA节点访问

教材:《Linux NUMA Documentation》
论文:《NUMA-Aware Memory Management for Cloud》(2019)
方程式:① 本地访问延迟 Tlocal​≈100ns;② 远端访问延迟 Tremote​≈300ns;③ 带宽比 BWremote​/BWlocal​≈0.5

Linux内核、阿里云(NUMA优化)

D2467

内存管理:大页(Huge Pages)

2MB/1GB大页、TLB覆盖范围、hugetlbfs、透明大页(THP)、与4KB页对比

云数据库和AI应用的性能优化;减少TLB miss

教材:《Linux Kernel Huge Pages Documentation》
论文:《Huge Pages for Database Workloads》(2020)
方程式:① TLB覆盖范围 range4KB​=2MB,range2MB​=1GB,range1GB​=512GB;② TLB miss率降低 reduction=2MB_entries4KB_entries​;③ 内存浪费 waste=internal_fragmentation

Linux内核、阿里云ECS

D2468

内存管理:透明大页(THP)

THP(Transparent Huge Pages、自动合并、khugepaged)、与手动大页对比、碎片问题

云服务器自动大页管理;提升性能但可能引入延迟抖动

教材:《Linux Kernel THP Documentation》
论文:《Transparent Huge Pages: A Performance Analysis》(2018)
方程式:① 合并扫描间隔 scan_interval=10s;② 碎片率 fragmentation=total_pagesnon_huge_pages​;③ 性能波动 jitter=std(latency)

Linux内核、阿里云(THP调优)

D2469

内存管理:内存热插拔

Memory Hotplug(物理添加/移除内存、online/offline、与VM热添加对比)

云服务器在线扩容内存;支持弹性资源调整

教材:《Linux Kernel Memory Hotplug Documentation》
论文:《Memory Hotplug in Linux》(2017)
方程式:① 热添加时间 Thotadd​≈100ms;② 内存块大小 block_size=128MB;③ 在线状态切换 state∈{online,offline}

Linux内核、阿里云(内存热升级)

D2470

操作系统:cgroups v2

cgroups v2(统一层级、unified hierarchy、io.weight、memory.reclaim、与v1对比)

云容器资源限制和监控的底层机制;支撑Kubernetes QoS

教材:《Linux Kernel cgroup v2 Documentation》
论文:《cgroup v2: A Unified Resource Control Hierarchy》(2019)
方程式:① CPU权重 cpu.weight=[1,10000];② 内存回收 memory.reclaim=swappiness;③ IO带宽 io.weight=[1,10000]

Linux内核、Kubernetes、阿里云ACK

D2471

操作系统:namespaces

7种namespace(Mount/UTS/IPC/PID/Net/User/Cgroup)、clone() flags、与隔离级别

云容器隔离的基础;每个容器拥有独立的视图

教材:《Linux Kernel Namespaces Documentation》
论文:《Namespaces in Operation》(2015)
方程式:① 创建时间 Tcreate​≈10μs;② 隔离级别数 levels=7;③ 切换开销 overheadswitch​≈1μs

Docker、Kubernetes、阿里云容器

D2472

操作系统:capabilities

Linux Capabilities(CAP_NET_ADMIN、CAP_SYS_ADMIN等)、bounding set、ambient set、与root/非root对比

云容器最小权限原则;避免特权容器

教材:《Linux Kernel Capabilities Documentation》
论文:《Linux Capabilities: A Practical Guide》(2019)
方程式:① 能力数 caps=40+;② 能力集 effective/permitted/inheritable/bounding/ambient;③ 安全增益 gain=attack_surfacecaps​attack_surfaceroot​​

Docker、Kubernetes、阿里云容器安全

D2473

云管理系统:OpenStack架构

OpenStack(Nova/Neutron/Cinder/Glance/Keystone/Horizon)、组件间通信、与Kubernetes对比

云IaaS管理平台;管理计算/网络/存储资源

教材:《OpenStack Operations Guide》
论文:《OpenStack: A Cloud Operating System》(2015)
方程式:① API请求延迟 Tapi​≈100ms;② 调度时间 Tschedule​=f(filters,weights);③ 资源池规模 nodes

OpenStack、阿里云(早期)

D2474

云管理系统:Kubernetes调度器

Kubernetes Scheduler(predicates/priorities、调度框架、QueueSort/PreFilter/Filter/Score等扩展点、与自定义调度器)

云容器调度核心;影响集群资源利用率和应用性能

教材:《Kubernetes Scheduling: A Practical Guide》(续)
论文:《Kubernetes Scheduler: A Survey》(2020)
方程式:① 调度延迟 Tschedule​≈100ms;② 调度失败率 failure_rate=totalunscheduled_pods​;③ 资源利用率 utilization=capacityallocated​

Kubernetes、阿里云ACK

D2475

云管理系统:Mesos架构

Mesos(两级调度、resource offer、Framework、与Kubernetes对比)

云资源管理的另一种范式;适合大数据和长期运行任务

教材:《Mesos: A Platform for Fine-Grained Resource Sharing in the Data Center》(2011)
论文:《Mesos: A Survey》(2018)
方程式:① 资源offer延迟 Toffer​≈10ms;② 框架拒绝率 rejection_rate;③ 调度效率 efficiency=offeredallocated​

Apache Mesos、阿里云(早期)

D2476

云管理系统:YARN架构

YARN(ResourceManager/NodeManager/ApplicationMaster、容器、与MapReduce v1对比)

云大数据资源管理;支撑Hadoop/Spark等分布式计算

教材:《Apache Hadoop YARN: Yet Another Resource Negotiator》(2013)
论文:《YARN: A Survey》(2019)
方程式:① 应用提交延迟 Tsubmit​≈1s;② 资源分配延迟 Tallocate​≈100ms;③ 集群利用率 utilization

Apache Hadoop YARN、阿里云EMR

D2477

云运维系统:监控(Prometheus)

Prometheus(pull模型、metric、Alertmanager、PromQL、与push模型对比)

云监控的事实标准;收集和查询指标数据

教材:《Prometheus: Up & Running》(2018)
论文:《Prometheus: A Survey》(2020)
方程式:① 抓取间隔 scrape_interval=15s;② 数据保留 retention=15d;③ 查询延迟 Tquery​=f(time_range)

Prometheus、阿里云ARMS

D2478

云运维系统:告警(Alertmanager)

Alertmanager(分组、抑制、静默、路由、与通知渠道)、告警疲劳、告警风暴

云告警管理的核心;减少噪音,提高响应效率

教材:《Alertmanager Documentation》
论文:《Alert Fatigue in Cloud Operations》(2020)
方程式:① 告警分组 group_by=labels;② 抑制规则 inhibition=source→target;③ 告警收敛率 convergence=raw_alertsunique_alerts​

Alertmanager、阿里云云监控

D2479

云运维系统:日志(ELK/Loki)

ELK(Elasticsearch+Logstash+Kibana)、Loki(Grafana、label-based)、与日志查询优化

云日志集中管理;支撑故障排查和审计

教材:《Elasticsearch: The Definitive Guide》(2015)
论文:《Log Management in Cloud: A Survey》(2020)
方程式:① 索引吞吐 docs/s;② 查询延迟 Tquery​=f(shards);③ 存储压缩比 compression≈5x

Elasticsearch、Loki、阿里云日志服务

D2480

云运维系统:混沌工程(Chaos Mesh)

Chaos Mesh(故障注入、workflow、dashboard、与Litmus对比)、实验设计

云系统韧性验证;主动发现系统弱点

教材:《Chaos Mesh Documentation》
论文:《Chaos Mesh: A Chaos Engineering Platform for Kubernetes》(2020)
方程式:① 实验持续时间 duration;② 爆炸半径 radius=namespace/labels;③ 恢复时间 Trecovery​

Chaos Mesh、阿里云AHAS

D2481

云运维系统:AIOps

AIOps(Artificial Intelligence for IT Operations、异常检测、根因分析、预测、与手动运维对比)

云智能运维;利用ML自动化故障处理

教材:《AIOps: A Practical Guide》
论文:《AIOps: A Survey》(2020)
方程式:① 异常检测准确率 precision/recall;② 根因定位准确率 RCA_accuracy;③ MTTR降低率 reduction=MTTRmanual​MTTRmanual​−MTTRai​​

Datadog、阿里云AIOps

D2482

排队论:M/M/1队列

M/M/1(泊松到达、指数服务时间、单服务器)、利用率ρ、平均队列长度、Little's Law

云系统性能建模的基础;分析请求延迟和吞吐

教材:《Queueing Systems Volume 1: Theory》(Leonard Kleinrock, 1975)
论文:《Queueing Theory for Cloud Computing: A Survey》(2019)
方程式:① 利用率 ρ=λ/μ;② 平均队列长度 Lq​=1−ρρ2​;③ Little's Law L=λW

AWS Auto Scaling、阿里云(容量规划)

D2483

排队论:M/M/c队列

M/M/c(多服务器、泊松到达、指数服务)、Erlang C公式、等待概率

云多实例服务的性能模型;支撑弹性伸缩决策

教材:《Fundamentals of Queueing Theory》(5th ed. 2018)
论文:《M/M/c Queueing Model for Cloud Services》(2020)
方程式:① Erlang C公式 C(c,ρ)=∑k=0c−1​k!(cρ)k​+c!(cρ)c​c!(cρ)c​​⋅1−ρ1​;② 平均等待时间 Wq​=μ(c−λ/μ)C(c,ρ)​;③ 服务器利用率 ρ=cμλ​

AWS ELB、阿里云SLB

D2484

排队论:M/G/1队列

M/G/1(一般服务时间分布)、Pollaczek-Khinchine公式、服务时间方差的影响

云存储和网络服务的延迟分析;考虑服务时间变异性

教材:《Queueing Systems》(续)
论文:《M/G/1 Queueing Model for Cloud Storage》(2019)
方程式:① 平均队列长度 Lq​=2(1−ρ)ρ2(1+Cs2​)​,其中 Cs2​=E[S]2Var[S]​;② 平均等待时间 Wq​=2μ(1−ρ)ρ(1+Cs2​)​;③ 服务时间变异系数 Cs​

阿里云OSS、AWS S3

D2485

控制论:PID控制器

PID(比例-积分-微分控制器)、P/I/D参数整定、与自适应控制

云自动弹性伸缩的控制算法;维持目标指标(如CPU利用率)

教材:《Feedback Control of Dynamic Systems》(8th ed. 2019)
论文:《PID Control for Cloud Auto-Scaling》(2020)
方程式:① 控制输出 u(t)=Kp​e(t)+Ki​∫0t​e(τ)dτ+Kd​dtde(t)​;② 误差 e(t)=target−actual;③ 稳定性条件 phase_margin>45∘

AWS Auto Scaling、阿里云弹性伸缩

D2486

控制论:模型预测控制(MPC)

MPC(基于系统模型预测未来、滚动优化、约束处理)、与PID对比

云资源分配的先进控制;考虑未来负载变化和约束

教材:《Model Predictive Control: Theory and Design》(2017)
论文:《MPC for Cloud Resource Allocation》(2021)
方程式:① 优化问题 minu​∑k=0N−1​(xkT​Qxk​+ukT​Ruk​) subject to xk+1​=Axk​+Buk​;② 预测时域 N;③ 控制时域 M≤N

Google Borg、阿里云(资源调度)

D2487

博弈论:纳什均衡

Nash Equilibrium(策略组合、无人可通过单方面改变策略获益)、纯策略/混合策略、与帕累托最优

云多租户资源竞争的博弈分析;理解自私行为和公平性

教材:《Game Theory: An Introduction》(2013)
论文:《Game Theory for Cloud Resource Allocation: A Survey》(2020)
方程式:① 纳什均衡条件 ui​(si∗​,s−i∗​)≥ui​(si​,s−i∗​);② 混合策略均衡 ∑pj​ui​(ai​,aj​)=const;③ 价格竞争伯川德模型 p1​=p2​=c

AWS Spot Market、阿里云竞价实例

D2488

博弈论:拍卖理论

Auction(英式、荷式、密封投标、VCG机制)、第二价格拍卖、与云资源定价

云竞价实例和预留实例的定价机制;实现市场效率和收入最大化

教材:《Auction Theory》(2009)
论文:《Auction-Based Cloud Resource Allocation: A Survey》(2019)
方程式:① 第二价格拍卖支付 pay=second_highest_bid;② VCG支付 payi​=V−i​−V−i∗​;③ 社会总福利 SW=∑vi​xi​

AWS Spot Instance、阿里云竞价

D2489

运筹优化:线性规划

Linear Programming(单纯形法、对偶、灵敏度分析)、与整数规划

云资源分配和成本优化的数学基础;支撑调度和容量规划

教材:《Introduction to Linear Optimization》(1997)
论文:《Linear Programming for Cloud Resource Management》(2020)
方程式:① 标准形式 mincTx subject to Ax=b,x≥0;② 对偶问题 maxbTy subject to ATy≤c;③ 互补松弛 xj​(cj​−AjT​y)=0

AWS Compute Optimizer、阿里云(优化)

D2490

运筹优化:整数规划

Integer Programming(分支定界、割平面、与线性规划对比)、0-1背包问题

云虚拟机放置和实例选择的组合优化;NP-hard问题

教材:《Integer Programming》(1998)
论文:《Integer Programming for VM Placement》(2019)
方程式:① 0-1背包 max∑vi​xi​ subject to ∑wi​xi​≤W,xi​∈{0,1};② 分支定界下界 LB=LP_relaxation;③ 割平面 aTx≤b

Kubernetes Scheduler、阿里云(调度)

D2491

运筹优化:凸优化

Convex Optimization(凸集、凸函数、KKT条件、梯度下降、与全局最优)

云机器学习模型训练和资源分配的理论基础

教材:《Convex Optimization》(Boyd & Vandenberghe, 2004)
论文:《Convex Optimization for Cloud》(2020)
方程式:① KKT条件 ∇f(x∗)+∑λi​∇gi​(x∗)+∑μj​∇hj​(x∗)=0;② 强对偶 p∗=d∗;③ 梯度下降 xk+1=xk−α∇f(xk)

TensorFlow、阿里云PAI

D2492

统计学:假设检验

Null/Alternative Hypothesis、p-value、Type I/II error、t-test/chi-square test

云A/B测试和实验分析;验证变更效果

教材:《Statistical Inference》(2nd ed. 2002)
论文:《A/B Testing in Cloud》(2020)
方程式:① t统计量 t=sp​1/n1​+1/n2​​xˉ1​−xˉ2​​;② p-value $p = P(T > t

H_0);③置信区间\bar{x} \pm z_{\alpha/2} \frac{\sigma}{\sqrt{n}}$

D2493

统计学:贝叶斯推断

Bayesian Inference(先验、似然、后验、共轭先验、MCMC)、与频率学派对比

云异常检测和预测的不确定性量化

教材:《Bayesian Data Analysis》(3rd ed. 2013)
论文:《Bayesian Methods for Cloud Monitoring》(2021)
方程式:① 贝叶斯定理 $P(\theta

D) = \frac{P(D

D2494

时间序列分析

ARIMA(自回归积分滑动平均)、季节性分解、Prophet、与深度学习预测

云负载预测和容量规划;支撑弹性伸缩

教材:《Time Series Analysis》(2015)
论文:《Time Series Forecasting for Cloud Workloads》(2020)
方程式:① ARIMA(p,d,q) ϕ(B)(1−B)dyt​=θ(B)ϵt​;② ACF/PACF;③ 预测误差 RMSE=n1​∑(yi​−y^​i​)2​

AWS Forecast、阿里云(预测)

D2495

机器学习:异常检测(Isolation Forest/LOF)

Isolation Forest(随机分割、孤立点更容易被隔离)、Local Outlier Factor(局部密度)、与阈值设定

云运维指标的异常检测;发现系统故障和性能退化

教材:《Outlier Analysis》(2nd ed. 2017)
论文:《Isolation Forest》(2008)
方程式:① Isolation Forest异常得分 s(x,n)=2−c(n)E[h(x)]​;② LOF LOFk​(A)=k⋅lrd(A)∑lrd(O)​;③ 阈值 θ=percentile(scores)

Prometheus、阿里云AIOps

D2496

机器学习:聚类(K-Means/DBSCAN)

K-Means(迭代、欧氏距离、K值选择)、DBSCAN(密度、噪声)、与轮廓系数

云资源画像和异常模式发现;支撑容量规划和成本优化

教材:《Machine Learning: A Probabilistic Perspective》(续)
论文:《Clustering for Cloud Workload Characterization》(2020)
方程式:① K-Means目标 $\min \sum{i=1}^k \sum{x\in C_i}

D2497

机器学习:分类(决策树/随机森林/XGBoost)

Decision Tree(信息增益/基尼系数)、Random Forest(Bagging)、XGBoost(Boosting、正则化)

云故障预测、容量预测、安全检测的分类模型

教材:《The Elements of Statistical Learning》(2nd ed. 2009)
论文:《XGBoost: A Scalable Tree Boosting System》(2016)
方程式:① 信息增益 $IG(D,A) = H(D) - \sum \frac{

D_v

D2498

机器学习:回归(线性/岭/Lasso)

Linear Regression(最小二乘)、Ridge(L2正则)、Lasso(L1正则、特征选择)

云性能预测和成本估算的回归模型

教材:《An Introduction to Statistical Learning》(2013)
论文:《Regularized Regression for Cloud Performance Modeling》(2020)
方程式:① Ridge $\min

D2499

图论:最小生成树(Prim/Kruskal)

Prim(加点)、Kruskal(加边)、与网络设计

云网络拓扑设计和数据中心布线优化

教材:《Introduction to Algorithms》(续)
论文:《Minimum Spanning Tree for Data Center Network》(2019)
方程式:① Prim复杂度 O(ElogV);② Kruskal复杂度 O(ElogV);③ 树的总权重 W=∑w(e)

阿里云(网络设计)

D2500

图论:最大流(Ford-Fulkerson/Dinic)

Ford-Fulkerson(增广路径)、Dinic(分层图、阻塞流)、与最小割

云网络带宽分配和数据中心流量工程

教材:《Network Flow: Theory, Algorithms, and Applications》(1993)
论文:《Max Flow for Cloud Traffic Engineering》(2020)
方程式:① 最大流等于最小割 max_flow=min_cut;② Dinic复杂度 O(EV2);③ 残余网络 Gf​

Google B4、阿里云(流量调度)

D2501

图论:二分图匹配(匈牙利算法)

Hungarian Algorithm(指派问题、O(n³))、与KM算法

云资源与任务的匹配问题;如VM到物理机的分配

教材:《Combinatorial Optimization: Algorithms and Complexity》(1982)
论文:《Hungarian Algorithm for VM Assignment》(2019)
方程式:① 指派问题 min∑cij​xij​ subject to ∑xij​=1;② 匈牙利算法步骤 reduce rows and columns;③ 时间复杂度 O(n3)

Kubernetes Scheduler、阿里云(调度)

D2502

信息论:熵/互信息

Entropy H(X)=−∑p(x)logp(x)、Mutual Information $I(X;Y) = H(X)-H(X

Y)$、KL散度

云异常检测的特征选择和度量;量化不确定性

教材:《Elements of Information Theory》(2nd ed. 2006)
论文:《Information Theory for Cloud Monitoring》(2020)
方程式:① 熵 H(X)=−∑pi​logpi​;② 互信息 I(X;Y)=∑∑p(x,y)logp(x)p(y)p(x,y)​;③ KL散度 DKL​(P∥Q)=∑p(x)logq(x)p(x)​

D2503

随机过程:马尔可夫链

Markov Chain(状态转移矩阵、平稳分布、吸收态)、与连续时间马尔可夫链(CTMC)

云系统状态的随机建模;分析可用性和可靠性

教材:《Introduction to Probability Models》(11th ed. 2014)
论文:《Markov Chains for Cloud Availability Modeling》(2020)
方程式:① 转移概率 $P{ij} = P(X{n+1}=j

X_n=i);②平稳分布\pi = \pi P;③CTMC转移速率Q$ matrix

D2504

随机过程:泊松过程

Poisson Process(计数过程、独立增量、指数间隔)、与非齐次泊松过程

云请求到达和故障事件的建模;支撑容量规划

教材:《Stochastic Processes》(Sheldon Ross, 1996)
论文:《Poisson Process for Cloud Request Modeling》(2019)
方程式:① 泊松分布 P(N(t)=k)=k!(λt)ke−λt​;② 间隔时间 T∼Exp(λ);③ 非齐次强度 λ(t)

AWS CloudWatch、阿里云(请求建模)

D2505

可靠性工程:MTBF/MTTR/可用性

Mean Time Between Failures (MTBF)、Mean Time To Repair (MTTR)、Availability A=MTBF+MTTRMTBF​、与冗余

云系统可靠性的度量;指导SLA设计

教材:《Reliability Engineering》(2017)
论文:《Cloud Reliability Modeling》(2020)
方程式:① 串联系统 Aseries​=∏Ai​;② 并联系统 Aparallel​=1−∏(1−Ai​);③ 年度停机时间 downtime=(1−A)×8760 hours

AWS SLA、阿里云SLA

D2506

可靠性工程:故障树分析

Fault Tree Analysis(AND/OR门、基本事件、顶事件、最小割集)

云系统故障原因分析;识别单点故障

教材:《Fault Tree Analysis: A Practical Guide》(2018)
论文:《Fault Tree Analysis for Cloud Systems》(2020)
方程式:① 顶事件概率 P(T)=P(AND)=∏Pi​;② 最小割集 MCS;③ 重要度 importance=∂Pi​∂P(T)​

阿里云(故障分析)

D2507

运维:告警关联分析(Apriori/FP-Growth)

Association Rule Mining(支持度、置信度、提升度)、Apriori/FP-Growth

云告警关联挖掘;发现频繁共现的告警模式

教材:《Data Mining: Concepts and Techniques》(3rd ed. 2011)
论文:《Alarm Correlation in Cloud Operations》(2020)
方程式:① 支持度 support(X)=Ncount(X)​;② 置信度 confidence(X⇒Y)=support(X)support(X∪Y)​;③ 提升度 lift=support(Y)confidence​

阿里云AIOps

D2508

运维:根因分析(因果图/贝叶斯网络)

Bayesian Network(DAG、条件概率表、因果推断)、与因果图

云故障根因定位的概率推理;缩小排查范围

教材:《Probabilistic Graphical Models: Principles and Techniques》(2009)
论文:《Root Cause Analysis in Cloud Using Bayesian Networks》(2021)
方程式:① 联合概率 $P(X_1,...,X_n) = \prod P(X_i

Parents(X_i));②后验概率P(Cause

D2509

运维:容量规划(线性规划/模拟)

Capacity Planning(需求预测、资源建模、what-if分析、与离散事件模拟)

云资源规划的决策支持;避免过度或不足供给

教材:《The Art of Computer Systems Performance Analysis》(1991)
论文:《Cloud Capacity Planning Using Simulation》(2020)
方程式:① 线性规划模型 mincTx subject to Ax≥b;② 模拟置信区间 xˉ±zα/2​n​s​;③ 服务水平 SL=P(response_time<threshold)

AWS Compute Optimizer、阿里云(规划)

D2510

运维:成本优化(线性规划/启发式)

Cost Optimization(资源选择、购买选项组合、预留/按需/Spot比例、与启发式算法)

云成本控制的核心;最小化总支出

教材:《Cloud Cost Optimization: A Practical Guide》(续)
论文:《Cost Optimization for Cloud Using Mixed-Integer Programming》(2021)
方程式:① 混合整数规划 min∑(cres​xres​+cod​xod​+cspot​xspot​);② 预留覆盖率 cov=total_hoursreserved_hours​;③ 启发式 greedy/GA

AWS Cost Explorer、阿里云成本管家

D2511

运维:安全态势评分(CVSS)

Common Vulnerability Scoring System(Base/Temporal/Environmental metrics、漏洞严重性分级)

云漏洞管理;优先修复高危漏洞

教材:《CVSS v3.1 Specification Document》
论文:《CVSS for Cloud Vulnerability Prioritization》(2020)
方程式:① Base Score BS=round(min(10,(1−(1−Impact)∗(1−Exploitability))));② Impact =1−(1−Conf)∗(1−Integ)∗(1−Avail);③ Exploitability =8.22×AV×AC×PR×UI

Qualys、阿里云漏洞扫描

D2512

运维:合规评分(CIS Benchmark)

CIS Benchmark(安全配置基线、评分规则、与自动化检查)

云安全合规的量化评估;持续监控和修复

教材:《CIS Controls and Benchmarks Documentation》
论文:《Automated CIS Benchmark Compliance Checking》(2021)
方程式:① 合规得分 score=total_checkspassed_checks​×100

云计算系统集成型解决方案 · 学科知识续表(第六十二轮:D2512~D2571,新增60个编号,聚焦虚拟化、多租户、容器、裸金属、内存管理、操作系统、云管理系统和云运维系统中的数学)

本轮从 D2512​ 接续,一次性新增 60 个编号(D2512~D2571),深入探讨虚拟化、多租户、容器、裸金属、内存管理、操作系统、云管理平台及运维系统中的数学模型与算法。所有教材、论文、标准均锚定权威来源。


📋 续表(D2512 ~ D2571)

编号

学科(课程)

核心知识点

在云计算/云存储/云网络/云安全/云MaaS中的作用

代表教材/资料/论文 + 数学方程式列表

工业界应用

D2512

运维:合规评分(CIS Benchmark)

CIS Benchmark(安全配置基线、评分规则、与自动化检查)

云安全合规的量化评估;持续监控和修复

教材:《CIS Controls and Benchmarks Documentation》
论文:《Automated CIS Benchmark Compliance Checking》(2021)
方程式:① 合规得分 score=total_checkspassed_checks​×100;② 严重违规数 critical_failures;③ 修复优先级 priority=f(severity,exploitability)

CIS Benchmarks、阿里云安全基线

D2513

运维:SLA违约概率(泊松过程)

SLA违约概率计算(基于泊松到达和服务时间分布)、与蒙特卡洛模拟

云服务SLA承诺的风险评估;指导冗余设计

教材:《Cloud Service Level Agreements: A Practical Guide》
论文:《SLA Violation Probability Modeling》(2020)
方程式:① 违约概率 Pviolation​=P(response_time>threshold);② 泊松到达 P(N=k)=k!(λt)ke−λt​;③ 蒙特卡洛估计 P^=M1​∑I(violation)

AWS SLA、阿里云SLA

D2514

运维:故障预测(生存分析)

Survival Analysis(Kaplan-Meier、Cox比例风险模型)、与时间至故障预测

云硬件故障预测;提前替换降低宕机风险

教材:《Survival Analysis: A Self-Learning Text》(3rd ed. 2012)
论文:《Disk Failure Prediction in Cloud Using Survival Analysis》(2020)
方程式:① Kaplan-Meier估计 S^(t)=∏ti​≤t​(1−ni​di​​);② Cox模型 $h(t

X) = h_0(t) \exp(\beta X);③风险比HR = \exp(\beta)$

D2515

运维:容量规划(排队网络)

Queueing Network(开放/封闭网络、Jackson定理、BCMP定理)、与性能评估

云多层服务(Web/APP/DB)的容量建模

教材:《Queueing Networks: A Fundamental Approach》(2011)
论文:《Queueing Network Models for Cloud Applications》(2020)
方程式:① Jackson网络积形式 P(n1​,...,nK​)=∏Gρini​​​;② 吞吐量 X=RN​(封闭网络);③ 响应时间 R=∑Ri​

AWS(性能建模)、阿里云(容量规划)

D2516

运维:弹性伸缩(控制理论)

Auto-scaling(反应式、预测式、控制理论PID/MPC)、与稳定裕度

云资源自动伸缩的控制算法;维持目标利用率

教材:《Cloud Auto-Scaling: A Survey》(2021)
论文:《Reinforcement Learning for Auto-Scaling》(2020)
方程式:① PID控制 u(t)=Kp​e(t)+Ki​∫e+Kd​e˙;② 稳定裕度 GM>6dB,PM>45∘;③ 缩放延迟 Tscale​=cooldown+startup

AWS Auto Scaling、阿里云弹性伸缩

D2517

运维:负载均衡(一致性哈希)

Consistent Hashing(虚拟节点、环、最小重映射)、与加权轮询对比

云负载均衡的请求分发;支撑动态扩缩容

教材:《Consistent Hashing: A Survey》(续)
论文:《Consistent Hashing with Bounded Loads》(2017)
方程式:① 虚拟节点数 vnodes;② 负载标准差 σ=n1​∑(li​−lˉ)2​;③ 重映射比例 remap=N1​

Redis Cluster、阿里云SLB

D2518

运维:资源碎片整理(背包问题)

Bin Packing(First Fit/Next Fit/Best Fit)、与多维背包

云VM/容器到物理机的放置优化;减少资源碎片

教材:《Bin Packing: A Survey》(2019)
论文:《VM Placement Using Bin Packing Heuristics》(2020)
方程式:① First Fit复杂度 O(nlogn);② 利用率 util=total_capacity∑resource_used​;③ 碎片率 fragmentation=totalunused_but_not_usable​

Kubernetes Scheduler、阿里云(调度)

D2519

运维:能耗优化(DVFS/休眠)

Dynamic Voltage and Frequency Scaling(DVFS)、Power Capping、与能耗模型

云数据中心节能;降低PUE和运营成本

教材:《Energy-Efficient Cloud Computing: A Survey》(2020)
论文:《Power-Aware VM Consolidation》(2019)
方程式:① 功耗模型 P=Pstatic​+k⋅f3;② 节能率 savings=Porig​Porig​−Popt​​;③ 性能-功耗权衡 tradeoff=powerperformance​

Google(节能)、阿里云(绿色计算)

D2520

运维:热迁移(预拷贝/后拷贝)

Live Migration(Pre-copy、Post-copy、迭代预拷贝、脏页率)、与停机时间

云虚拟机在线迁移;支撑负载均衡和硬件维护

教材:《Live Migration of Virtual Machines》(2010)
论文:《Pre-copy and Post-copy VM Migration: A Comparison》(2019)
方程式:① 总迁移时间 Tmig​=RV​⋅1−ρ1​(预拷贝);② 停机时间 Tdowntime​=RVlast​​;③ 脏页率 dirty_rate=pages/s

VMware vMotion、阿里云ECS迁移

D2521

运维:容器调度(亲和性/反亲和性)

Affinity/Anti-affinity(节点/拓扑域)、软/硬约束、与拓扑分布约束

云容器调度策略;保障高可用和性能

教材:《Kubernetes Scheduling: A Practical Guide》(续)
论文:《Affinity Scheduling in Kubernetes》(2020)
方程式:① 亲和性得分 score=∑wi​⋅matchi​;② 反亲和性惩罚 penalty=∑wi​⋅anti_matchi​;③ 拓扑域分布 spread=min_podsmax_pods​

Kubernetes、阿里云ACK

D2522

运维:GPU共享调度(时间片/MPS)

GPU Sharing(时间片切片、MPS(Multi-Process Service)、MIG)、与独占对比

云GPU利用率提升;支持多任务并发

教材:《NVIDIA GPU Sharing: A Practical Guide》
论文:《GPU Sharing in Cloud: A Survey》(2021)
方程式:① 时间片切换延迟 Tswitch​≈10μs;② MPS利用率 utilmps​>utilexclusive​;③ 性能隔离度 isolation=1−interference

NVIDIA MPS、阿里云GPU共享

D2523

运维:存储分层(热度/冷热数据)

Storage Tiering(Hot/Warm/Cold/Archive)、访问频率、与自动分层策略

云存储成本优化;降低总体拥有成本

教材:《Storage Tiering: A Practical Guide》
论文:《Automated Storage Tiering in Cloud》(2020)
方程式:① 访问热度 heat=timeaccesses​;② 分层阈值 threshold=heat_percentile;③ 成本节省 savings=costsingle​costsingle​−costtiered​​

AWS S3 Intelligent-Tiering、阿里云OSS

D2524

运维:数据去重(哈希/布隆过滤器)

Data Deduplication(块级/文件级、SHA-1哈希、布隆过滤器、与压缩对比)

云存储空间节省;减少重复数据存储

教材:《Data Deduplication: A Survey》(2020)
论文:《Deduplication in Cloud Storage》(2019)
方程式:① 去重率 dedup_ratio=unique_sizeoriginal_size​;② 布隆过滤器假阳性率 Pfp​=(1−e−kn/m)k;③ 哈希碰撞概率 Pcollision​≈2−160

ZFS、阿里云OSS

D2525

运维:纠删码(Erasure Coding)

Reed-Solomon(k+m、任意m个故障可恢复)、与三副本对比

云存储的冗余策略;降低存储开销

教材:《Erasure Codes for Storage: A Survey》(2020)
论文:《Erasure Coding in Cloud Storage Systems》(2019)
方程式:① 存储效率 efficiency=k+mk​;② 修复带宽 repair_BW=k+mk​×original;③ 故障容忍 tolerate=m failures

Ceph、阿里云OSS

D2526

运维:网络流量工程(TE)

Traffic Engineering(MPLS-TE、Segment Routing、负载均衡、与ECMP)

云网络流量优化;避免拥塞,提高吞吐

教材:《Network Traffic Engineering: A Survey》(2020)
论文:《Traffic Engineering in Data Center Networks》(2019)
方程式:① 链路利用率 util=capacitytraffic​;② 最大链路利用率 maxutil;③ 流完成时间 FCT

Google B4、阿里云(网络优化)

D2527

运维:拥塞控制(TCP BBR/CUBIC)

TCP Congestion Control(CUBIC、BBR(Bottleneck Bandwidth RTT)、与丢包检测对比)

云网络传输性能;提升吞吐和降低延迟

教材:《TCP/IP Illustrated》(续)
论文:《BBR: Congestion-Based Congestion Control》(2016)
方程式:① BBR pacing rate rate=BWmax​×1.25;② CUBIC窗口增长 W=C(t−K)3+Wmax​;③ 吞吐量 throughput=RTTp​MSS​

Linux内核、阿里云(网络优化)

D2528

运维:DNS解析(加权轮询/地理位置)

DNS Load Balancing(Weighted Round Robin、GeoDNS、Latency-based)、与TTL

云域名解析的流量调度;支撑全球负载均衡

教材:《DNS and BIND》(5th ed. 2006)
论文:《DNS Load Balancing in Cloud》(2020)
方程式:① 权重分配 weighti​=∑capacitycapacityi​​;② TTL缓存 cache_time=TTL;③ 地理位置距离 distance=haversine(lat,lon)

AWS Route 53、阿里云DNS

D2529

运维:CDN缓存(LRU/LFU/TTL)

Cache Replacement(LRU、LFU、ARC)、缓存命中率、与预热策略

云CDN的内容加速;降低源站负载

教材:《Content Delivery Networks: A Survey》(2020)
论文:《Cache Replacement Policies for CDN》(2019)
方程式:① LRU命中率 hit_rate=totalhits​;② 缓存容量 capacity=GB;③ 字节命中率 BHR=total_bytesbytes_from_cache​

Cloudflare、阿里云CDN

D2530

运维:数据库连接池(HikariCP/Druid)

Connection Pool(最小/最大连接数、空闲超时、泄漏检测)、与无连接池对比

云数据库连接管理;提高性能和稳定性

教材:《Database Connection Pooling: A Practical Guide》
论文:《Connection Pooling in Cloud Applications》(2020)
方程式:① 活跃连接数 active=current_using;② 等待队列长度 wait_queue;③ 获取连接延迟 Tacquire​=pool_hit?0:create_time

HikariCP、阿里云Druid

D2531

运维:消息队列背压(Backpressure)

Backpressure(Reactive Streams、背压信号、与丢弃/阻塞对比)

云消息队列的流量控制;防止消费者过载

教材:《Reactive Streams Specification》
论文:《Backpressure in Distributed Systems》(2020)
方程式:① 背压信号 demand=request(n);② 缓冲区大小 buffer=n;③ 丢弃率 drop_rate=totaldropped​

Kafka、阿里云RocketMQ

D2532

运维:熔断/降级(Hystrix/Sentinel)

Circuit Breaker(Closed/Open/Half-Open)、Fallback、与舱壁隔离

云微服务容错;防止级联故障

教材:《Microservices Resilience Patterns》(2020)
论文:《Circuit Breaker Pattern in Cloud》(2019)
方程式:① 错误率阈值 threshold=50%;② 熔断时间窗口 window=10s;③ 半开探测请求数 probes=1

Hystrix、阿里云Sentinel

D2533

运维:限流(令牌桶/漏桶)

Rate Limiting(Token Bucket、Leaky Bucket、滑动窗口)、与QoS

云API和服务的流量整形;防止过载和滥用

教材:《Rate Limiting: A Practical Guide》
论文:《Token Bucket Algorithm for Cloud API》(2020)
方程式:① 令牌桶速率 r tokens/s;② 桶容量 b tokens;③ 突发流量 burst=b

Kong、阿里云API网关

D2534

运维:分布式追踪(采样策略)

Distributed Tracing(Head-based sampling、Tail-based sampling、Probability sampling)、与Span

云微服务调用链的采样;控制存储成本

教材:《Distributed Tracing: A Practical Guide》(续)
论文:《Sampling Strategies for Distributed Tracing》(2020)
方程式:① 采样率 p=totaltraced​;② 存储成本 cost=sampled_spans×size;③ 尾采样决策 decision=f(error,latency)

Jaeger、阿里云ARMS

D2535

运维:日志压缩(gzip/zstd)

Log Compression(gzip、zstd、LZ4)、压缩比、与CPU开销

云日志存储成本优化;减少磁盘和网络占用

教材:《Data Compression: A Practical Guide》
论文:《Log Compression in Cloud》(2020)
方程式:① 压缩比 ratio=compresseduncompressed​;② 压缩速度 speed=MB/s;③ CPU开销 overhead=saved_spaceCPU_time​

Elasticsearch、阿里云日志服务

D2536

运维:指标降采样(Downsampling)

Downsampling(Last、Avg、Max、Min、Count)、与保留策略

云监控指标的长周期存储;减少数据量

教材:《Time Series Data Management: A Survey》(2020)
论文:《Downsampling Strategies for Monitoring Data》(2019)
方程式:① 降采样间隔 interval=5min→1h;② 数据点减少率 reduction=downsampled_pointsoriginal_points​;③ 精度损失 loss=f(aggregation)

Prometheus、阿里云云监控

D2537

运维:告警风暴抑制(分组/抑制)

Alert Storm Suppression(分组、抑制、静默、与降噪)

云告警管理;减少运维人员疲劳

教材:《Alert Management: A Practical Guide》
论文:《Alert Storm Mitigation in Cloud》(2020)
方程式:① 告警收敛率 convergence=raw_alertsunique_alerts​;② 抑制规则数 rules;③ 平均告警处理时间 MTTA

Alertmanager、阿里云云监控

D2538

运维:变更管理(风险评估)

Change Management(风险评估、回滚计划、灰度发布、与变更窗口)

云变更操作的规范化;降低变更风险

教材:《ITIL Change Management: A Practical Guide》
论文:《Change Risk Assessment in Cloud》(2020)
方程式:① 变更风险得分 risk=impact×probability;② 灰度比例 canary_%=10%;③ 回滚时间 Trollback​≤5min

阿里云(变更管理)

D2539

运维:容量规划(时间序列预测)

Time Series Forecasting(ARIMA、Prophet、LSTM)、与预测误差

云资源需求的预测;支撑弹性伸缩

教材:《Forecasting: Principles and Practice》(3rd ed. 2021)
论文:《Cloud Workload Forecasting: A Survey》(2020)
方程式:① ARIMA(p,d,q) ϕ(B)(1−B)dyt​=θ(B)ϵt​;② MAPE $MAPE = \frac{1}{n}\sum \frac{

y_i - \hat{y}_i

D2540

运维:成本异常检测(统计/ML)

Cost Anomaly Detection(Z-score、Moving Average、Isolation Forest)、与阈值

云成本异常预警;及时发现费用激增

教材:《Cloud Cost Anomaly Detection: A Survey》(2021)
论文:《Anomaly Detection in Cloud Billing Data》(2020)
方程式:① Z-score z=σx−μ​;② 移动平均 MAt​=k1​∑i=t−k+1t​xi​;③ 异常得分 score=f(model)

Vantage、阿里云成本管家

D2541

运维:资源标签管理(成本分摊)

Tagging Strategy(成本中心/环境/应用)、与成本分摊模型

云成本归属和分摊;支撑FinOps

教材:《Cloud Tagging: A Practical Guide》
论文:《Tag-Based Cost Allocation in Cloud》(2020)
方程式:① 标签覆盖率 coverage=totaltagged_resources​;② 分摊成本 costteam​=∑tagged_resource_cost;③ 未标记成本 untagged_cost

AWS Cost Explorer、阿里云成本标签

D2542

运维:安全合规自动化(Policy as Code)

Policy as Code(OPA/Rego、Kyverno、Cloud Custodian)、与合规检查

云安全合规的自动化;持续合规

教材:《Policy as Code: A Practical Guide》
论文:《Automating Cloud Compliance with Policy as Code》(2021)
方程式:① 策略数 policies;② 合规评分 score=totalpassed​;③ 自动修复率 auto_fix_rate

OPA、阿里云合规

D2543

运维:混沌工程实验设计(DOE)

Design of Experiments(Factorial Design、正交实验、与假设检验)

云混沌工程实验的科学设计;量化系统韧性

教材:《Design and Analysis of Experiments》(9th ed. 2017)
论文:《Experimental Design for Chaos Engineering》(2020)
方程式:① 因子数 factors;② 实验次数 runs=2k;③ 主效应 effect=yˉ​+​−yˉ​−​

Chaos Mesh、阿里云AHAS

D2544

运维:故障注入覆盖率

Fault Coverage(注入的故障类型数、与实际故障的映射、与测试充分性)

云混沌工程的覆盖度量;确保关键路径被测试

教材:《Fault Injection Testing: A Survey》(2020)
论文:《Measuring Fault Injection Coverage in Cloud》(2021)
方程式:① 覆盖率 coverage=known_faultsinjected_faults​;② 关键路径覆盖 critical_coverage;③ 未覆盖风险 risk=f(coverage)

Chaos Mesh、阿里云AHAS

D2545

运维:SLO燃尽率(Burn Rate)

Burn Rate(错误率相对于SLO的消耗速度)、多窗口告警(1h/5m等)

云SLO监控的核心指标;快速响应SLO违规

教材:《SRE: A Practical Guide》(续)
论文:《Burn Rate Alerts for SLOs》(2020)
方程式:① Burn Rate burn=1−SLOerror_rate​;② 预算消耗时间 Texhaust​=burn_rateerror_budget​;③ 告警窗口 window=1h,5m

Google SRE、阿里云SRE

D2546

运维:错误预算(Error Budget)

Error Budget(1 - SLO)、消耗/剩余、与发布决策

云可靠性管理的核心杠杆;平衡创新与稳定

教材:《Site Reliability Engineering》(续)
论文:《Error Budget Policy in Practice》(2019)
方程式:① 错误预算 EB=(1−SLO)×total_requests;② 剩余预算 remaining=EB−errors;③ 发布门禁 gate=remaining>0

Google SRE、阿里云SRE

D2547

运维:容量规划(马尔可夫决策过程)

Markov Decision Process(状态、动作、奖励、转移概率、与动态规划)

云资源分配的序贯决策;优化长期回报

教材:《Reinforcement Learning: An Introduction》(续)
论文:《MDP for Cloud Resource Allocation》(2020)
方程式:① 贝尔曼方程 $V(s) = \max_a [R(s,a) + \gamma \sum P(s'

s,a)V(s')];②策略\pi(s) = \arg\max_a Q(s,a);③折扣因子\gamma \in [0,1]$

D2548

运维:强化学习调度(DQN/PPO)

Deep Reinforcement Learning(DQN、PPO、Actor-Critic)、与启发式调度对比

云资源调度的智能化;适应动态变化

教材:《Deep Reinforcement Learning for Cloud Scheduling: A Survey》(2021)
论文:《DRL for VM Consolidation》(2020)
方程式:① Q-learning更新 Q(s,a)←Q(s,a)+α(r+γmaxQ(s′,a′)−Q(s,a));② PPO裁剪目标 LCLIP(θ)=E[min(rt​(θ)At​,clip(rt​(θ),1−ϵ,1+ϵ)At​)];③ 累积奖励 R=∑γtrt​

Google(数据中心冷却)、阿里云(调度)

D2549

运维:联邦学习(隐私保护调度)

Federated Learning for Scheduling(多数据中心协同、梯度聚合、与差分隐私)

云跨数据中心调度中的隐私保护;避免数据泄露

教材:《Federated Learning: A Survey》(续)
论文:《Federated Learning for Cloud Resource Scheduling》(2021)
方程式:① 联邦平均 wt+1​=∑nnk​​wt+1k​;② 差分隐私噪声 g~​=g+N(0,σ2C2);③ 通信轮数 rounds

阿里云(研究)

D2550

运维:图神经网络(故障定位)

GNN for Root Cause Analysis(图表示学习、消息传递、与因果图)

云故障根因定位的图方法;利用拓扑信息

教材:《Graph Neural Networks: A Survey》(续)
论文:《GNN for Root Cause Localization in Cloud》(2021)
方程式:① 节点嵌入 hv(k)​=σ(Wk​∑u∈N(v)​hu(k−1)​);② 图分类 y=softmax(∑hv​);③ 因果得分 score=f(hv​)

阿里云AIOps

D2551

运维:自然语言处理(日志分析)

NLP for Log Analysis(日志模板提取、异常检测、与关键词匹配对比)

云日志的智能分析;自动发现异常模式

教材:《Natural Language Processing for Log Analysis: A Survey》(2020)
论文:《DeepLog: Anomaly Detection and Diagnosis from System Logs through Deep Learning》(2017)
方程式:① 模板提取 template=Drain/Spell;② 异常得分 score=LSTM/Transformer;③ 检测率 detection_rate

阿里云AIOps

D2552

运维:计算机视觉(数据中心巡检)

Computer Vision for Data Center(巡检机器人、仪表盘识别、异常检测)

云数据中心物理安全的智能化;减少人工巡检

教材:《Computer Vision for Data Centers: A Survey》(2021)
论文:《Automated Data Center Inspection Using CV》(2020)
方程式:① 检测精度 mAP;② 识别速度 FPS;③ 误报率 false_positive_rate

阿里云(数据中心巡检)

D2553

运维:知识图谱(运维知识库)

Knowledge Graph for Operations(实体关系、推理、与FAQ对比)

云运维知识的组织;支撑智能问答和故障排查

教材:《Knowledge Graphs: A Survey》(2020)
论文:《Building a Knowledge Graph for Cloud Operations》(2021)
方程式:① 实体数 entities;② 关系数 relations;③ 推理准确率 reasoning_accuracy

阿里云AIOps

D2554

运维:数字孪生(数据中心)

Digital Twin for Data Center(3D可视化、实时仿真、与物理孪生对比)

云数据中心的虚拟副本;支撑规划和运维

教材:《Digital Twin for Data Centers: A Survey》(2021)
论文:《Data Center Digital Twin》(2020)
方程式:① 同步延迟 Tsync​≤100ms;② 仿真精度 accuracy=95%;③ 能效优化 savings=10−15%

阿里云(数据中心孪生)

D2555

运维:因果推断(A/B测试)

Causal Inference for A/B Tests(ATE、CATE、与混淆变量控制)

云变更效果的因果评估;区分相关和因果

教材:《Causal Inference: A Practical Guide》(续)
论文:《Causal Inference for Cloud Experiments》(2020)
方程式:① ATE ATE=E[Y(1)−Y(0)];② 倾向得分匹配 $e(x) = P(T=1

X);③双重差分DID = (Y{treat,post}-Y{treat,pre}) - (Y{control,post}-Y{control,pre})$

D2556

运维:贝叶斯优化(超参数调优)

Bayesian Optimization(高斯过程、采集函数EI/UCB、与网格搜索对比)

云系统参数自动调优;如缓存大小、连接池配置

教材:《Bayesian Optimization: A Survey》(2020)
论文:《Bayesian Optimization for Cloud Configuration》(2021)
方程式:① 高斯过程后验 f(x)∼GP(m(x),k(x,x′));② EI采集函数 EI(x)=E[max(f(x)−f∗,0)];③ 迭代次数 iterations

阿里云(参数调优)

D2557

运维:多目标优化(NSGA-II)

Multi-Objective Optimization(Pareto前沿、NSGA-II、与单目标对比)

云资源配置的多目标权衡(成本/性能/功耗)

教材:《Multi-Objective Optimization: A Survey》(2020)
论文:《NSGA-II for Cloud Resource Allocation》(2021)
方程式:① Pareto支配 x≻y if ∀i:fi​(x)≤fi​(y) and ∃j:fj​(x)<fj​(y);② 拥挤度距离 crowding_distance;③ 非支配排序 rank

阿里云(资源配置)

D2558

运维:模拟退火(调度优化)

Simulated Annealing(Metropolis准则、冷却调度、与局部搜索对比)

云资源调度的近似优化;跳出局部最优

教材:《Metaheuristics: A Survey》(2019)
论文:《Simulated Annealing for VM Placement》(2020)
方程式:① 接受概率 P=exp(−TΔE​);② 冷却调度 Tk+1​=αTk​;③ 初始温度 T0​

阿里云(调度优化)

D2559

运维:遗传算法(调度优化)

Genetic Algorithm(选择、交叉、变异、适应度函数、与种群进化)

云资源调度的进化算法;适用于大规模组合优化

教材:《Genetic Algorithms: A Survey》(2020)
论文:《GA for Cloud Workflow Scheduling》(2021)
方程式:① 适应度 fitness=objective_function;② 选择概率 pi​=∑fj​fi​​;③ 交叉率 crossover_rate

阿里云(调度优化)

D2560

运维:蚁群算法(路径优化)

Ant Colony Optimization(信息素、启发式信息、与旅行商问题)

云网络路由和任务调度优化;模拟蚂蚁觅食

教材:《Ant Colony Optimization: A Survey》(2019)
论文:《ACO for Cloud Task Scheduling》(2020)
方程式:① 转移概率 pijk​=∑τilα​ηilβ​τijα​ηijβ​​;② 信息素更新 τij​=(1−ρ)τij​+∑Δτijk​;③ 蒸发率 ρ

阿里云(路径优化)

D2561

运维:粒子群优化(PSO)

Particle Swarm Optimization(速度更新、位置更新、个体/全局最优)

云资源调度的群体智能算法;简单高效

教材:《Particle Swarm Optimization: A Survey》(2020)
论文:《PSO for Cloud Resource Provisioning》(2021)
方程式:① 速度更新 vit+1​=wvit​+c1​r1​(pbesti​−xit​)+c2​r2​(gbest−xit​);② 位置更新 xit+1​=xit​+vit+1​;③ 惯性权重 w

阿里云(资源调度)

D2562

运维:模糊逻辑(QoS评估)

Fuzzy Logic(隶属度函数、模糊规则、去模糊化、与精确逻辑对比)

云服务质量的多维评估;处理不确定性和模糊性

教材:《Fuzzy Logic: A Survey》(2020)
论文:《Fuzzy Logic for Cloud QoS Assessment》(2021)
方程式:① 隶属度 μA​(x)∈[0,1];② 模糊规则 IF x is A THEN y is B;③ 重心去模糊化 y∗=∫μ(y)dy∫μ(y)ydy​

阿里云(QoS评估)

D2563

运维:粗糙集(特征选择)

Rough Set(上/下近似、属性约简、决策表、与特征选择)

云运维数据的特征降维;提取关键告警属性

教材:《Rough Sets: A Survey》(2019)
论文:《Rough Set Based Feature Selection for Cloud Alarm Data》(2020)
方程式:① 下近似 R​(X)={x:[x]R​⊆X};② 上近似 R(X)={x:[x]R​∩X=∅};③ 属性重要度 sig(a)=γR∪{a}​(D)−γR​(D)

阿里云AIOps

D2564

运维:证据理论(不确定性推理)

Dempster-Shafer Theory(基本概率赋值、信任函数、似然函数、与贝叶斯对比)

云故障诊断中的不确定性融合;多证据组合

教材:《Dempster-Shafer Theory: A Survey》(2020)
论文:《Evidence Theory for Cloud Fault Diagnosis》(2021)
方程式:① 基本概率赋值 m(A)∈[0,1],∑m(A)=1;② 信任函数 Bel(A)=∑B⊆A​m(B);③ Dempster组合规则 (m1​⊕m2​)(A)=1−K∑B∩C=A​m1​(B)m2​(C)​

阿里云(故障诊断)

D2565

运维:灰色系统理论(预测)

Grey System Theory(GM(1,1)模型、灰色关联度、与小样本预测)

云资源需求的小样本预测;适用于数据不足场景

教材:《Grey System Theory: A Survey》(2019)
论文:《Grey Model for Cloud Workload Prediction》(2020)
方程式:① GM(1,1) x(0)(k)+az(1)(k)=b;② 发展系数 a;③ 灰色关联度 $\gamma(x_0, x_i) = \frac{\min\min

x_0-x_i

D2566

运维:马尔可夫链蒙特卡洛(MCMC)

MCMC(Metropolis-Hastings、Gibbs采样、与贝叶斯推断)

云系统参数的贝叶斯估计;不确定性量化

教材:《Markov Chain Monte Carlo: A Survey》(2020)
论文:《MCMC for Cloud Performance Modeling》(2021)
方程式:① Metropolis接受概率 $\alpha = \min(1, \frac{P(\theta')P(D

\theta')}{P(\theta)P(D

D2567

运维:隐马尔可夫模型(HMM)

Hidden Markov Model(状态序列、观测序列、Baum-Welch、Viterbi)

云系统状态估计;如故障状态推断

教材:《Hidden Markov Models: A Survey》(2020)
论文:《HMM for Cloud System State Estimation》(2021)
方程式:① 前向概率 $\alpha_t(i) = P(o_1,...,o_t, q_t=S_i

\lambda);②Viterbi路径\delta_t(j) = \max_i [\delta{t-1}(i)a{ij}] b_j(o_t);③Baum−Welch重估a_{ij} = \frac{\sum \xi_t(i,j)}{\sum \gamma_t(i)}$

D2568

运维:卡尔曼滤波(状态估计)

Kalman Filter(预测、更新、协方差矩阵、与线性系统)

云系统状态的实时估计;如CPU利用率平滑

教材:《Kalman Filter: A Survey》(2020)
论文:《Kalman Filter for Cloud Resource Monitoring》(2021)
方程式:① 预测 $\hat{x}_{k

k-1} = F_k \hat{x}_{k-1

D2569

运维:主成分分析(PCA)

Principal Component Analysis(协方差矩阵、特征值分解、降维、与异常检测)

云运维指标降维;提取主要特征,去除噪声

教材:《Principal Component Analysis: A Survey》(2020)
论文:《PCA for Cloud Metric Anomaly Detection》(2021)
方程式:① 协方差矩阵 Σ=n1​XXT;② 特征值分解 Σvi​=λi​vi​;③ 累计方差贡献率 cum_var=∑i=1p​λi​∑i=1k​λi​​

阿里云AIOps

D2570

运维:独立成分分析(ICA)

Independent Component Analysis(非高斯性、FastICA、与盲源分离)

云运维信号的源分离;分离不同故障源的叠加影响

教材:《Independent Component Analysis: A Survey》(2020)
论文:《ICA for Cloud Fault Source Separation》(2021)
方程式:① ICA模型 x=As;② 非高斯性度量 kurtosis=E[s4]−3(E[s2])2;③ FastICA迭代 wk+1​=E[xg(wkT​x)]−E[g′(wkT​x)]wk​

阿里云AIOps

D2571

运维:小波变换(信号去噪)

Wavelet Transform(连续/离散、多分辨率分析、阈值去噪)

云运维信号去噪和突变检测;如网络延迟波动分析

教材:《Wavelet Transform: A Survey》(2020)
论文:《Wavelet Denoising for Cloud Monitoring Signals》(2021)
方程式:① 小波系数 W(a,b)=∫x(t)ψa,b​(t)dt;② 阈值去噪 $\hat{W} = sign(W) \max(

W


评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值