1. 一些规则
线性代数的核心研究对象就是线性关系,它把复杂的对象简化为最容易处理的两种核心基本运算:相加(叠加性)和数乘(齐次性)。
所以:
- 相关系数为 0 仅代表变量间没有线性相关性,但不一定独立,因为还可能有非线性的相关性
- 反过来,若两个变量独立,则必不存在任何形式的相关性(无论是线性还是非线性)。
相加(叠加性):f(x+y)=f(x)+f(y)f(x+y)=f(x)+f(y)f(x+y)=f(x)+f(y)
数乘(齐次性):f(kx)=k⋅xf(kx)=k\cdot xf(kx)=k⋅x
2. 常用的条件概率公式
条件概率
条件概率的定义:
P(A∣B)=P(A,B)P(B)P(A|B)= \frac{P(A,B)}{P(B)}P(A∣B)=P(B)P(A,B)
由定义可以引申得到:
- P(A,B)=P(A∣B)⋅P(B)P(A,B)=P(A|B)\cdot P(B)P(A,B)=P(A∣B)⋅P(B)
- P(A,B∣C)=P(A∣B,C)⋅P(B∣C)P(A,B|C)=P(A|B,C)\cdot P(B|C)P(A,B∣C)=P(A∣B,C)⋅P(B∣C)
贝叶斯公式
由条件概率可得:
P(A,B)=P(A∣B)⋅P(B)=P(B∣A)⋅P(A)P(A,B)=P(A|B) \cdot P(B)=P(B|A)\cdot P(A)P(A,B)=P(A∣B)⋅P(B)=P(B∣A)⋅P(A)
由此得到贝叶斯公式的常规形式:
P(A∣B)=P(B∣A)P(A)P(B)P(A|B)=\frac{P(B|A)P(A)}{P(B)}P(A∣B)=P(B)P(B∣A)P(A)
全概率公式
若事件 B1,B2,⋯ ,BnB_1, B_2, \cdots, B_nB1,B2,⋯,Bn 是样本空间 Ω\OmegaΩ 的一个划分,则:
P(A)=∑i=1nP(A∣Bi)P(Bi)P(A)=\sum_{i=1}^nP(A|B_i)P(B_i)P(A)=i=1∑nP(A∣Bi)P(Bi)
又因为条件概率公式,可进一步得:
P(A)=∑i=1nP(A∣Bi)P(Bi)P(A)=\sum_{i=1}^nP(A|B_i)P(B_i)P(A)=i=1∑nP(A∣Bi)P(Bi)
可以使用图1帮助理解,整个大圆为样本空间,中间阴影面积为事件 AAA 。大圆的每一个切分代表每一个 BiB_iBi

全概率公式的意义在于,当某一事件的概率难以求得时,可转化为在一系列条件下发生概率的和。
全概率公式和贝叶斯公式的结合
P(A∣B)=P(B∣A)P(A)∑i=1nP(B∣Ai)P(Ai)P(A|B)=\frac{P(B|A)P(A)}{\sum_{i=1}^nP(B|A_i)P(A_i)}P(A∣B)=∑i=1nP(B∣Ai)P(Ai)P(B∣A)P(A)
3. 既然只研究线性,线性代数为什么还这么有用?
现实世界绝大多数规律都是非线性的(比如天气变化、股票走势、人口增长)。线性代数之所以成为现代科学的基石,是因为它学会了“偷梁换柱”:
- 局部线性化(以直代曲)。 在高等数学和微积分中,曲线在微观上可以看作是无数段极其微小的“直线”(导数/微分)。对于多元函数,我们在某一点附近对其进行切面近似,这个切面就是一个线性系统。通过这种方式,非线性问题在局部被转化成了线性代数问题。
- 基底变换与空间映射。 线性代数可以将高维、复杂的非线性数据,投影到合适的“基底”(坐标系)上。例如在傅里叶变换或主成分分析(PCA)中,复杂的信号或数据可以通过线性的基底组合来拆解,从而抓取核心特征。
- 机器学习与神经网络。 现代大模型(如 ChatGPT)本质上是海量的非线性系统。但在底层实现上,它们是由无数个线性变换(矩阵乘法)再套上一个简单的非线性激活函数(如 ReLU)拼装而成的。没有线性代数提供的超大规模矩阵并行计算,深度学习根本无法实现。

1229

被折叠的 条评论
为什么被折叠?



