09 Generalized linear models and the exponential family

本文为博客 VIP 文章,开通 VIP 后可阅读全文

开通 VIP

9.3 广义线性模型(Generalized linear models,缩写为GLMs)

线性回归和逻辑回归都属于广义线性模型的特例(McCullagh and Nelder 1989).
这些模型中输出密度都是指数族分布(参考本书9.2),而均值参数都是输入的线性组合,经过可能是非线性的函数,比如逻辑函数等等.下面就要详细讲一下广义线性模型(GLMs).为了记号简单,先看标量输出的情况.(这就排除了多远逻辑回归,不过这只是为表述简单而已.)

9.3.1 基础知识

要理解广义线性模型,首先要考虑一个标量响应变量的无条件分布(unconditional dstribution)的情况:

p(yi∣θ,σ2)=exp⁡[yiθ−A(θ)σ2+c(yi,σ2)]p(y_i|\theta,\sigma^2)=\exp[\frac{y_i\theta - A(\theta)}{\sigma^2}+c(y_i,\sigma^2)]p(yiθ,σ2)=exp[σ2yiθA(θ)+c(yi,σ2)](9.77)

上式中的σ2\sigma^2σ2叫做色散参数(dispersion parameter),通常设为1.θ\thetaθ是自然参数,A是配分函数,c是归一化常数.例如,在逻辑回归的情况下,θ\thetaθ就是对数比值比(log-odds ratio),θ=log⁡(μ1−μ)\theta =\log ( \frac{\mu}{1-\mu} )θ=log(1μμ),其中μ=E[y]=p(y=1)\mu=\mathrm{E}[y]=p(y=1)μ=E[y]=p(y=1)是均值参数(mean parameter),参考本书9.2.2.1.要从均值参数转成自然参数(natural parameter),可以使用一个函数ϕ\phiϕ,也就是θ=Ψ(μ)\theta=\Psi(\mu)θ=Ψ(μ).这个函数由指数族分布的形式唯一确定(uniquely determined).实际上这是一个可逆映射(invertible mapping),所以也就有μ=Ψ−1(θ)\mu=\Psi^{-1}(\theta)μ=Ψ1(θ).另外通过本书9.2.3可以知道这个均值可以通过对配分函数(partition function)求导而得到,也就是有μ=Ψ−1(θ)=A′(θ)\mu=\Psi^{-1}(\theta)=A'(\theta)μ=Ψ1(θ)=A(θ).

然后加上输入/协变量(covariates).先定义一个输入特征的线性函数:

ηi=wTxi\eta_i =w^T x_iηi=wTxi(9.78)

分布 Link g(μ)g(\mu)g(μ) θ=ψ(μ)\theta=\psi(\mu)θ=ψ(μ) μ=ψ−1(θ)=E[y]\mu =\psi^{-1}(\theta)=\mathrm{E}[y]μ=ψ1(θ)=E[y]
N(μ,σ2)N(\mu,\sigma^2)N(μ,σ2) indentity θ=μ\theta=\muθ=μ μ=θ\mu=\thetaμ=θ
Bin(N,μ)Bin(N,\mu)Bin(N,μ) logit θ=log⁡μ1−μ\theta=\log\frac{\mu}{1-\mu}θ=log1μμ μ=sigm(θ)\mu=sigm(\theta)μ=sigm(θ)
Poi(μ)Poi(\mu)Poi(μ) log θ=log⁡(μ)\theta =\log(\mu)θ=log(μ) μ=eθ\mu=e^\thetaμ=eθ

表 9.1 常见广义线性模型(GLMs)的连接函数(link function)ψ\psiψ.

然后使这个分布的均值为这个线性组合的某个可逆单调函数.通过转换,得到这个函数就叫做均值函数(mean function),记作g−1g^{-1}g1,所以:
μi=g−1(ηi)=g−1(wTxi)\mu_i =g^{-1}(\eta_i) =g^{-1}(w^Tx_i)μi=g1(ηi)=g1(wTxi)(9.79)

如图9.1所示为这个简单模型的总结.

均值函数(mean function)的逆函数,记作g()g()g(),就叫做连接函数(link function).我们可以随意选择任意函数来作为连接函数,只要是可逆的,以及均值函数g()g()g()有适当的范围.例如在逻辑回归里面,就设置μi=g−1(ηi)=sigm(ηi)\mu_i =g^{-1}(\eta_i)=sigm(\eta_i)μi=g1(ηi)=sigm(ηi).

连接函数有一个特别简单的形式,就是g=ϕg=\phig=ϕ,这也叫做规范连接函数(canonical link function).这种情况下则有θi=ηi=wTxi\theta_i=\eta_i=w^Tx_iθi=ηi=wTxi,所以模型就成了:

p(yi∣xi,w,σ2)=exp⁡[yiwTxi−A(wTxi)σ2+c(yi,σ2)]p(y_i|x_i,w,\sigma^2)=\exp [\frac{y_iw^Tx_i -A(w^Tx_i)}{\sigma^2}+c(y_i,\sigma^2)]p(yixi,w,σ2)=exp[σ2yiwTxiA(wTxi)+c(yi,σ2)](9.80)

表格9.1中所示的是一些分布和规范连接函数.可见伯努利分布或者二项分布的规范连接函数是g(μ)=log⁡(η/(1−η))g(\mu)=\log (\eta/(1-\eta))g(μ)=log(η/(1η)),而你函数是逻辑函数(logistic function)μ=sigm(η)\mu =sigm(\eta)μ=sigm(η).

基于本书9.2.3的结果,可以得到响应变量的均值和方差:

E[y∣xi,w,σ2]=μi=A′(θi)(9.81)var[y∣xi,w,σ2]=σi2=A′′(θi)σ2(9.82) \begin{aligned} \mathrm{E}[y|x_i,w,\sigma^2]&= \mu_i =A'(\theta_i) &\text{(9.81)}\\ var[y|x_i,w,\sigma^2]&= \sigma_i^2 =A''(\theta_i)\sigma^2 &\text{(9.82)}\\ \end{aligned} E[yxi,w,σ2]var[yxi,w,σ2]=μi=A(θi)=σi2=A′′(θi)σ2(9.81)(9.82)

为了记好清楚,接下来就看一些简单样例.

对于线性回归,则有:

log⁡p(yi∣xi,w,σ2)=yiμi−μi2/2σ2−12(yi2σ2+log⁡(2πσ2))\log p(y_i|x_i,w,\sigma^2)=\frac{y_i\mu_i-\mu_i^2/2}{\sigma^2}-\frac{1}{2}(\frac{y_i^2}{\sigma^2}+\log(2\pi\sigma^2))logp(yixi,w,σ2)=σ2yiμiμi2/221(σ2yi2+log(2πσ2))(9.83)

其中yi∈R,θi=μi=wTxiy_i\in R,\theta_i=\mu_i =w^Tx_iyiR,θi=μi=wTxi,而A(θ)=θ2/2A(\theta)=\theta^2/2A(θ)=θ2/2,所以E[yi]=μi,var[yi]=σ2\mathrm{E}[y_i]=\mu_i,var[y_i]=\sigma^2E[yi]=μi,var[yi]=σ2.

对于二项回归(binomial regression),则有:

log⁡p(yi∣xi,w)=yilog⁡(πi1−πi+Nilog⁡(1−πi)+log⁡Niyi\log p(y_i|x_i,w) =y_i \log(\frac{\pi_i}{1-\pi_i}+N_i\log(1-\pi_i)+\log\begin{aligned} N_i\\ y_i \end{aligned}logp(yixi,w)=yilog(1πiπi+Nilog(1πi)+logNiyi(9.84)

其中yi∈{ 0,1,...,Ni},πi=sigm(wTxi),θi=log⁡(πi/(1−πi))=wTxi,σ2=1y_i \in \{0,1,...,N_i\},\pi_i =sigm(w^Tx_i),\theta_i=\log (\pi_i/(1-\pi_i))=w^Tx_i,\sigma^2=1yi{ 0,1,...,Ni},πi=sigm(wTxi),θi=log(πi/(1πi))=wTxi,σ2=1. A(θ)=Nilog⁡(1+eθ)A(\theta)=N_i\log (1+e^\theta)A(θ)=Nilog(1+eθ),所以E[yi]=Niπi=μi,var[yi]=Niπi(1−πi)\mathrm{E}[y_i]=N_i\pi_i =\mu_i,var[y_i]= N_i\pi_i(1-\pi_i)E[yi]=Niπi=μi,var[yi]=Niπi(1πi)

对于泊松分布(poisson regression),则有:
log⁡p(yi∣xi,w)=yilog⁡μi−μi−log⁡(yi!)\log p(y_i|x_i,w)= y_i \log \mu_i -\mu_i -\log(y_i!)logp(yixi,w)=yilogμiμilog(yi!)(9.85)

其中yi∈{ 0,1,2,...},μi=exp⁡(wTxi),θ=log⁡(μi)=wTxi,σ2=1y_i\in \{0,1,2,...\},\mu_i =\exp (w^Tx_i),\theta=\log(\mu_i)=w^Tx_i,\sigma^2=1yi{ 0,1,2,...},μi=exp(wTxi),θ=log(μi)=wTxi,σ2=1.而A(θ)=eθA(\theta)=e^\thetaA(θ)=eθ,所以E[yi]=var[yi]=μi\mathrm{E}[y_i]=var[y_i]=\mu_iE[yi]=var[yi]=μi.泊松回归在生物统计中应用很广,其中的yiy_iyi可能代表着给定人群或者地点的病患数目,或者高通量测序背景下基因组位置的读数数量,参考(Kuan et al. 2009).

9.3.2 最大似然估计(MLE)和最大后验估计(MAP)

广义线性模型的最重要的一个性质就是可以用和逻辑回归拟合的同样方法来进行拟合.对数似然函数形式如下所示:

l(w)=log⁡p(D∣w)=1σ2∑i=1Nli(9.86)li=△θiyi−A(θi)(9.87) \begin{aligned} l(w) = \log p(D|w)&= \frac{1}{\sigma^2}\sum^N_{i=1}l_i &\text{(9.86)}\\ l_i&\overset{\triangle}{=} \theta_i y_i-A(\theta_i) &\text{(9.87)}\\ \end{aligned} l(w)=logp(Dw)li=

MLAPP 读书笔记 - 09-1广义线性模型(Generalized linear models)和指数族分布(exponential family) MLAPP 读书笔记 - 09 广义线性模型(Generalized linear models)和指数族分布(exponential family) A Chinese Notes of MLAPP,MLAPP 中文笔记项目 https://zhuanlan.zhihu.com/python-kivy 转载:cycleuser 侵权立删,本意是为广大学习爱好者提供中文资料,同时在这里补充了图片,方便阅读,如果有任何法律问题,我会立即删除。 9.1 概论 之前已经见到过很多概率分布了:正态(高斯)分布, 阅读详情

相关推荐

视觉特征-自监督-掩码特征预测【2024-10】:D-JEPA【生成模型:下一Token组自回归预测(组内并行去噪),自回归合成图像】【JEPA、Diffusion损失均针对Mask处Token计算】

Dengsheng Chen1 Jie Hu2 Xiaoming Wei1 Enhua Wu2∗1Meituan 2Key Laboratory of System Software (Chinese Academy of Sciences) and State Key Laboratory of Computer Science, Institute of Software, Chinese Academy of Sciences {chendengsheng, weixiaoming}@meituan.

u013250861的博客 141

Generalised Linear Models, McCullagh, Nelder, 2nd ED

McCullagh & Nelder, Generalised Linear Models, 2nd edition. Chapman & Hall, 1989.

视觉特征-自监督-掩码特征预测【2024-11】:D-JEPA·T2I(通过下一词元预测实现高分辨率图像合成)【相对于D-JEPA的优化:文本条件、流匹配损失、VoPE】

近年来,自回归模型在类别条件图像生成方面展现了卓越的性能。然而,将下一词元预测应用于高分辨率文本到图像生成仍未得到充分探索。在本文中,我们提出了基于连续词元的自回归模型D-JEPA·T2I,该模型在架构和训练策略上均进行了创新,能够在高达4K的任意分辨率下生成高质量、照片级真实感的图像。在架构方面,我们采用去噪联合嵌入预测架构(D-JEPA),同时利用多模态视觉Transformer有效融合文本和视觉特征。此外,我们引入流匹配损失以及所提出的视觉旋转位置编码(VoPE),以实现连续分辨率学习。

u013250861的博客 111

机器学习 | MATLAB实现GLM广义线性模型参数设定

机器学习 | MATLAB实现GLM广义线性模型参数设定

机器学习之心的博客,关注并私信文章链接,获取对应文章源码和数据。 1800

回归预测 | MATLAB实现GLM广义线性模型数据回归预测

回归预测 | MATLAB实现GLR广义线性模型数据回归预测

机器学习之心的博客,关注并私信文章链接,获取对应文章源码和数据。 2932

GLM(Generalized Linear Models)模型详解

GLM模型详解

Chandler_Liu的博客 9447

手搓一个广义线性模型(GLM)

广义线性模型(GLM)由Nelder 和 Wedderburn于 1972 年提出,并在McCullaghNelder1989 年的研究中得到了进一步发展。广义线性模型是对普通线性回归模型(Linear Regression Model)的扩展。它允许我们分析非正态分布的数据,比如二分类、计数或比例数据,而普通线性回归仅适用于连续、正态分布的响应变量。简单来说,GLM让我们可以灵...

lazysnake666的博客 1445

一文通透想颠覆Transformer的Mamba:从SSM、HiPPO、S4到Mamba(被誉为Mamba最佳解读)

如本文开头所说,mamba论文的一作Albert Gu多年来一直在推动SSM的发展他在SSM的基础上,通过此篇论文《》首次提出了结构化状态空间S4(这里有关于S4的更多论文),但这篇论文的可读性比较差当然,作者在YouTube上有一个关于这篇S4论文的精彩解读,比S4论文的可读性提高很多,且本文中也应用了其中的部分PPT截图,但还可以更加通俗易懂。

结构之法 算法之道 43万+

指数族和广义线性模型(The exponential family and Generalized Linear Models

指数族的概率密度形如:1 对所有的:2 所以:3 当T(x) =x,A(θ)是h(x)的Laplace变换的log形式。 下面我们给出常见的概率分布:4 之后,我们转向我们熟悉的形式:5 η被称为natural parameter或者canonical parameter,T (y)被称为sufficient statistic(a statistic is a function of

aaron的专栏 2008

人工智能机器学习和深度学习到底是什么关系?

人工智能(AI)、机器学习(ML)和深度学习(DL)是三个层级嵌套的概念:DL⊂ML⊂AI。AI是最广泛的研究领域,关注机器完成智能任务的能力;ML是实现AI的一类方法,通过数据训练模型;DL则是ML的一个分支,使用多层神经网络自动学习特征表示。 具体区别体现在: AI包含规则系统和数据驱动方法,ML专注于从数据中学习规律 传统ML依赖人工特征工程,DL能自动提取多层次特征 DL在图像/语音/文本等非结构化数据上表现突出,但需要更多数据和算力 项目选择应基于任务特性:规则明确用编程,结构化小数据用传统ML(

Michael_Jay的博客 365

机器学习复习Day2——逻辑回归

**为什么不用 MSE**:①MSE 在逻辑回归上是**非凸**的(丘陵多坑,梯度下降会卡局部最优),交叉熵是**凸**的(大碗单底,保证全局最优);②**log 放大惩罚**,错得越离谱罚得越狠、改正越用力。- **损失用交叉熵**:y=1 时 **-log(ŷ)**,y=0 时 **-log(1-ŷ)**,合起来 = **-[y·log(ŷ) + (1-y)·log(1-ŷ)]**。- 逻辑回归是做**分类**的(虽然名字带"回归",是历史命名问题),输出是 [0,1] 的概率,不是连续值。

2503_94114317的博客 696

AI机器学习资源包:学习曲线与核心知识点

AI机器学习的学习曲线看似陡峭,但只要掌握核心概念,入门其实没那么难。今天分享一份学习包,涵盖从基础到进阶的核心知识点。AI的核心目标是让机器表现出智能行为。从最初的图灵测试到现代的深度学习,AI经历了三次重大浪潮。第二次浪潮引入机器学习,让机器从数据中学习;第三次浪潮则通过深度学习实现了真正的突破,让机器能够自动提取特征并完成复杂任务。机器学习是AI的核心,主要分为三种范式: 1. 监督学习:需要标注数据,擅长分类和回归任务,如图像识别和房价预测。2. 无监督学习:无需标注,擅长发现数据中的隐藏模式。

2401_84458295的博客 219

武汉理工大学&华中科技大学联合 l 机器学习赋能金属增材制造

未来,随着标准化数据体系、物理信息学习、可解释人工智能、数字孪生、边缘计算和闭环控制持续发展,ML有望推动MAM由依赖经验和离线检验的工艺,逐步转向更可预测、更可靠、更可解释且能够实时调节的智能制造过程。然而,金属增材制造本质上是一个多物理场耦合、快速熔化与凝固并存的非平衡制造过程,激光功率、扫描速度、送粉或送丝速度、层厚及成形环境等因素会通过局部热历史影响凝固组织、相变行为、残余应力和最终性能,形成高度非线性的“工艺—组织—性能”(process–structure–property, PSP)关系;

3D科学谷 250

MLPACK 超完整实战|C++高性能机器学习、聚类分类、回归预测全能库

MLPACK是一款专注于高性能和轻量化的C++机器学习库,由佐治亚理工学院维护。其核心优势包括原生C++实现带来的极致推理速度、极低资源占用、全平台适配以及工业级算法完备性,特别适合嵌入式设备、边缘计算和高性能服务端场景。相比于Python框架,MLPACK无需解释器开销,仅依赖轻量级线性代数库,支持离线训练和本地推理。 本文详细介绍了MLPACK的编译配置方法、基础矩阵操作,并提供了KNN分类、K-Means聚类、线性回归和PCA降维等核心算法的实战代码。同时包含5个可直接商用的生产级Demo,涵盖工业设

踏板鞋的专栏 275

分位数预测提升销量不确定性量化

通过概率预测与分位数输出,可以将销量预测系统从单一的点估计升级为能够量化不确定性的决策支持工具。核心在于将预测输出从一个数值扩展为一个概率分布,并通过分位数(如P10、P50、P90)来表征该分布,从而为库存、定价、促销等决策提供风险边界。

wanghaiwen69的博客 221

微积分与线性代数在大模型中的作用与地位

这篇文章阐述了从微积分到线性代数的关键跨越,以及线性代数在理解大模型(如Transformer)中的核心作用。作者指出,微积分擅长描述单变量连续变化,而真实世界和大模型涉及多变量、高维空间的复杂交互,这正是线性代数的领域。文章重点解析了向量(代表状态)和矩阵(代表变换)在大模型中的核心应用:向量表征语义、特征和参数;矩阵实现空间变换、注意力匹配和参数优化。作者独创性地将微积分(梯度、海塞矩阵)与线性代数结合,揭示了大模型训练的数学本质——高维向量在矩阵规则下的迭代收敛。最后预告了后续学习路径,强调掌握线性代

2601_96546232的博客 专注数学与电子科学及工程技术分享交流。 418

基于 Python、计算机视觉 / 机器学习检测 与 PyQt5 构建的桌面端可视化系统——蘑菇种类识别与分类可视化大屏

基于与构建的桌面端可视化系统。支持图片与视频上传、多目标蘑菇检测与分割、识别前后对比、鼠标框选区域识别、操作日志、ECharts 图表统计、数据分析、界面主题定制、参数配置,以及按日期归档与 SQLite 持久化存储。界面采用、工业灰主题,全局紧凑排版,适配常见桌面分辨率。

weixin_66547608的博客 174

机器学习赋能复合材料细观力学:破解多尺度仿真困局|哈工大Composites Part A综述

引言复合材料凭借高比刚度、高比强度与优异的结构可设计性,广泛应用于航空航天等高端制造领域。但其非均质结构、复杂界面行为与多物理场耦合损伤机制,让传统细观力学建模长期陷入精度与效率的双重困境。传统解析方法理想化假设过多、精度不足,有限元数值仿真精度高但计算成本高昂,难以满足快速材料迭代与工程优化需求。为突破这一瓶颈,机器学习凭借强大的非线性拟合与数据挖掘能力,成为复合材料细观力学研究的全新技术手段。

y2715163545的博客 326
上一篇: MLAPP 读书笔记 - 08-1 逻辑回归(Logistic regression)
下一篇: MLAPP 读书笔记 - 09-1广义线性模型(Generalized linear models)和指数族分布(exponential family)
只鸥周
博客等级 码龄6年 7粉丝 93原创
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值