本文同样来自stanford 组,不过他研究的是分布式学习中的weight compression and estimation problem.
问题建模
分布式统计参数估计
首先,我们考虑 NN 有 ddd 个参数, 他们服从分布 pθp_\thetapθ. 总共有 nnn 个节点观测 pθp_\thetapθ 每个节点得到一个 realization XnX_nXn。 因此我们有
X1,X2,...,Xn∼i.i.d.pθX_1,X_2,...,X_n\overset{\text{i.i.d.}}{\sim} p_\thetaX1,X2,...,Xn∼i.i.d.pθ
Problem setup 是: 每个节点把自己的观测 XiX_iXi 独立的编码为 kkk-bits
Mi=Πi(Xi)M_i=\Pi_i(X_i)Mi=Πi(Xi)
并发送给PS。而PS的目标是从 nknknk-bits M=(M1,M2,...,Mn)M=(M_1,M_2,...,M_n)M=(M1,M2,...,Mn)中估计出 θ\thetaθ 使得 worst case squared ℓ2\ell^2ℓ2 risk 最小化:
inf{Πi},θ^supθ∈ΘEθ∥θ^(M)−θ∥2\inf_{\{\Pi_i\},\hat{\theta}}\sup_{\theta\in\Theta}\mathbb{E}_\theta\|\hat{\theta}(M)-\theta\|^2{Πi},θ^infθ∈ΘsupEθ∥θ^(M)−θ∥2
即,我们需要联合设计 {Πi}\{\Pi_i\}{Πi} and θ^\hat{\theta}θ^.
斯坦福团队探讨了分布式环境中深度学习参数高效压缩与估计的问题。研究模型关注NN参数的分布估计,每个节点通过kk比特编码发送观测,目标是设计编码策略与优化估计方法以最小化最差情况下的平方误差风险。

1852

被折叠的 条评论
为什么被折叠?



