
重参数化技巧的核心是把随机采样改写为“确定性变换 + 独立噪声”,使梯度能沿可导路径回传,从而将高方差的得分函数估计器转化为低方差估计器。它适用于连续分布,离散场景需借助 Gumbel-Softmax 等松弛方法。
在深度学习中,很多模型需要从概率分布中采样,再根据采样结果计算损失并反向传播。比如变分自编码器(VAE)中的隐变量、强化学习中的策略采样、贝叶斯神经网络中的权重采样,都涉及“随机节点”。问题在于:采样操作本身通常不可导,梯度无法直接穿过随机性回传。
早期做法是使用得分函数估计器(score function estimator),也叫 REINFORCE 或似然比技巧。它不要求采样过程可导,只需对概率密度求导,因此通用性很强。但代价是方差极高——因为梯度信号只来自标量奖励或似然比,缺少关于采样值本身的路径信息。训练时梯度像被随机噪声淹没,收敛慢且不稳定。
重参数化技巧(reparameterization trick)正是为解决这一痛点而生。它的核心思想并不复杂:把随机性从计算图中“搬出去”。
假设我们需要从正态分布 $z \sim \mathcal{N}(\mu, \sigma^2)$ 中采样。直接采样不可导,但可以改写为:
$$z = \mu + \sigma \cdot \epsilon, \quad \epsilon \sim \mathcal{N}(0, 1)$$
这里 $\epsilon$ 是标准正态噪声,与参数 $\mu$、$\sigma$ 无关。于是计算图变成:随机性只存在于 $\epsilon$ 这个叶子节点,而 $\mu$ 和 $\sigma$ 到 $z$ 的路径是确定性的、可导的。反向传播时,梯度可以顺畅地流过 $\mu$ 和 $\sigma$,而 $\epsilon$ 的随机性不再阻断梯度。
这个改写带来的方差降低是数量级的。直观理解:得分函数估计器只告诉模型“这次采样结果是好是坏”,而重参数化估计器还告诉模型“如果 $\mu$ 或 $\sigma$ 稍微变一点,采样结果会怎么变”。后者提供了更丰富的局部梯度信息,因此估计更稳定。
重参数化技巧最广为人知的应用是变分自编码器。Kingma 和 Welling 在 2013 年提出的 VAE 框架中,正是通过重参数化让隐变量的变分下界(ELBO)可以端到端训练。没有这个技巧,VAE 的训练会因方差过高而难以实用。
但重参数化并非万能。它要求分布本身可以写成“确定性变换 + 无参数噪声”的形式。连续分布如正态分布、均匀分布、指数分布、Gumbel 分布等通常可以做到;离散分布则不能直接重参数化,因为采样结果不可微。针对离散场景,研究者提出了 Gumbel-Softmax(也称 Concrete 分布)等松弛方法,用可微的软采样近似离散采样,在温度趋于零时逼近真实离散分布。
在强化学习中,重参数化也有用武之地,但主要限于连续动作空间。对于离散动作或环境奖励不可导的情况,仍然需要依赖得分函数估计器或 Actor-Critic 等策略梯度方法。换句话说,重参数化降低方差的前提是:随机性可以被“外生”为一个独立的噪声源,且目标函数对采样值可导。
重参数化技巧背后有一个更普适的视角:方差降低的本质是引入更多关于梯度的信息。除了重参数化,常见的方差降低手段还包括:
这些方法可以组合使用。例如在变分推断中,既可以用重参数化处理连续隐变量,又可以用控制变量进一步降低方差。理解这些工具的共同逻辑——把随机性隔离、把可导路径显式化——比死记某个具体公式更有价值。
在海外,重参数化技巧是 VAE、扩散模型、贝叶斯深度学习等方向的基石。国内团队同样在相关方向持续投入。例如,文心一言、通义千问、DeepSeek、豆包、Kimi、智谱 GLM 等大模型在训练中广泛使用变分推断与随机优化技术,虽然预训练阶段以确定性梯度为主,但在对齐、强化学习微调(如 RLHF/GRPO)中,方差降低仍是核心工程问题。DeepSeek 在 GRPO 等策略优化方法上的公开讨论,就涉及如何在不增加过多计算的前提下降低策略梯度方差。
与海外研究相比,国内团队更强调工程落地与算力效率:在有限 GPU 资源下,如何用更稳定的梯度估计减少训练崩溃、缩短收敛时间,往往比追求理论最优估计器更受关注。重参数化及其变体,正是这类工程优化中的重要工具。
如果你正在训练一个包含随机节点的模型,可以按以下思路判断:
重参数化技巧的价值不在于某个公式,而在于它提供了一种思考方式:把不可导的随机性转化为可导的确定性变换,让梯度估计从“猜”变成“算”。这正是 Towards Data Science 上许多概率建模教程反复强调的核心直觉。
如果你想深入了解变分自编码器的数学推导,可以参考 Kingma & Welling 的原始论文;关于 Gumbel-Softmax 的细节,可查阅 Jang 等人的论文;概率编程框架 Pyro 的文档也提供了重参数化估计器的实现说明。
因为它把随机性移出计算图,使梯度可以沿确定性路径回传,从而提供比得分函数估计器更丰富的局部梯度信息,减少估计噪声。
不能直接使用。离散采样不可微,需要用 Gumbel-Softmax 等松弛方法近似,或在部分场景下继续使用得分函数估计器。
可以。局部重参数化只对部分变量使用重参数化,其余变量仍用 REINFORCE,兼顾灵活性与方差降低。
不是绝对必须,但不用重参数化时梯度方差通常极高,训练会非常困难。重参数化是 VAE 实用化的关键技巧之一。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Put your brand in the reader feed
In-article ad slots: high-attention moments perfect for product launches and event recruitment.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

一线 AI 实验室为何把「人类灭绝」写进风险清单?本文拆解灭绝叙事的三根支柱与裂缝,把风险从物种层拉回可观测的个体、组织与社会层,并加入国内 AI 阵营的安全路径对比。

美国AI数据中心建设遭遇曾受重工业污染社区的强烈抵制。费城活动人士以炼油厂历史为鉴,推动暂停令。全美多城已实施禁令,纽约州签署行政令限制大型项目。能源消耗与环境污染成为核心争议。

OpenAI 在 ChatGPT Work 中推出 Data agent,让员工用自然语言连接企业数据、生成看板并直接行动。本文解析其数据源、语义层与权限设计,并对比国内同类进展。
Get the latest SEO & GEO insights.
We respect your privacy. You can unsubscribe at any time.