本文目录导读:

- 核心思想:用“能量”衡量配置的好坏
- 数学定义:玻尔兹曼分布
- 与传统模型的区别
- 如何训练EBM:对比散度(Contrastive Divergence)
- EBM在深度学习中的优势与挑战
- 现代发展与融合(截至2025年)
这是一个非常专业且核心的机器学习概念,基于能量的模型(Energy-Based Models, EBMs)是一种强大的概率模型框架,它在生成式AI、深度学习等领域具有重要地位。
我会为你提供一个系统性的、由浅入深的解释。
核心思想:用“能量”衡量配置的好坏
EBM的核心哲学非常直观:为一个系统的每一种可能状态(configuration)分配一个标量值,称为“能量”(Energy)。
- 低能量:代表该状态是“好的”、“合理的”、“符合规律的”,即模型认为这是真实、常见或应该出现的配置。
- 高能量:代表该状态是“差的”、“不合理的”、“不符合规律的”,即模型认为这是虚假、罕见或不应该出现的配置。
学习的目标:模型通过训练,学会如何为“好”的样本(比如训练集中的真实图片)赋予低能量,为“坏”的样本赋予高能量。
一个生动的类比:物理世界
- 想象一个由弹簧连接的球在凹凸不平的地面上。
- 状态:球的位置。
- 能量:球在该位置的势能。
- 低能量:球在谷底(稳定位置)。
- 高能量:球在山顶(不稳定位置)。
- 模型目标:通过学习地面的形状,使得真实存在的球的位置(数据)都落在谷底。
数学定义:玻尔兹曼分布
在数学上,EBM通过玻尔兹曼分布(也称吉布斯分布)将能量值转换成一个概率分布:
[ p(x) = \frac{e^{-E(x)}}{Z} ]
- ( p(x) ):是状态 ( x ) 的概率。
- ( E(x) ):是状态 ( x ) 的能量。
- ( e^{-E(x)} ):这是核心,能量越低,指数值越大(因为负号),使得概率越大。
- ( Z ):是配分函数(Partition Function),它是一个归一化常数,确保所有可能状态的概率之和为1,公式为 ( Z = \sum_{x} e^{-E(x)} )。
关键挑战:计算 ( Z ) 需要对所有可能的状态 ( ( x ) ) 进行求和,当数据空间高维且连续时(如图像、文本),这几乎是不可能的,找到有效的近似方法来绕过 ( Z ) 的计算,是EBM研究的核心。
与传统模型的区别
为了更清晰,可以对比一下:
- 判别式模型:学习 ( P(y|x) )(给定输入x,输出标签y的概率),SVM、Logistic Regression、标准CNN,它们关注的是边界。
- 生成式模型:学习数据本身的分布 ( P(x) ),EBM属于这一类,但不同于其他生成模型:
- 显式模型:如VAE、Normalizing Flows,它们直接定义并近似最大似然。
- 隐式模型:如GAN,它们不直接定义概率分布,而是通过博弈生成样本。
- EBM属于显式模型:它直接定义了一个未归一化的概率分布(即 ( e^{-E(x)} )),但需要处理棘手的归一化常数。
如何训练EBM:对比散度(Contrastive Divergence)
训练EBM的目标是降低真实数据的能量,同时提高其他所有可能状态的能量。
一种经典的训练方法是对比散度,由Geoffrey Hinton提出,步骤大致如下:
-
正向阶段(降低数据点能量):从训练数据中取一个真实样本 ( x^+ ),计算其能量 ( E(x^+) ),通过梯度下降来降低这个能量。
-
负向阶段(升高“幻觉”样本能量):从当前模型中采样出一个“幻觉”样本 ( x^- )(这个过程很关键,也很有挑战),计算其能量 ( E(x^-) ),通过梯度下降来升高这个能量。
-
梯度更新:参数的梯度由两部分组成: [ \frac{\partial \text{Loss}}{\partial \theta} = \frac{\partial E(x^+)}{\partial \theta} - \frac{\partial E(x^-)}{\partial \theta} ]
- 第一项:降低真实样本的能量。
- 第二项:升高“幻觉”样本的能量。
核心难点在于负向阶段的采样,为了得到有意义的“幻觉”样本,需要让马尔科夫链蒙特卡洛方法收敛,实际中常用的是有限步的吉布斯采样,这就是“对比散度”名称的由来。
EBM在深度学习中的优势与挑战
优势
- 灵活性:几乎任何函数都可以作为能量函数 ( E_\theta(x) ),这意味着只要能让能量函数足够强大(如深度神经网络),我们就能拟合极其复杂的分布。
- 生成与判别统一:可以同时用于生成任务(生成低能量样本)和判别任务(比较不同输入的能量)。
- 组合性:能量函数可以灵活组合,两个独立的能量函数可以相加,形成一个新的、更复杂的模型。
- 鲁棒性:由于模型需要区分“真实”和“虚假”状态,它对异常值(OOD,out-of-distribution)检测有天然的优势——陌生输入通常具有高能量。
挑战
- 训练不稳定:主要因为负向采样过程(需要从复杂的高维分布中采样)非常困难,容易导致模式崩塌或训练不收敛。
- 计算成本高:每次迭代都需要进行采样,计算量远大于其他生成模型(如VAE或GAN),特别是在高分辨率图像上。
- 评估困难:无法直接计算精确的似然值 ( p(x) ),因为配分函数 ( Z ) 未知,只能通过生成质量(如FID)或能量对比来间接评估。
现代发展与融合(截至2025年)
近年来,EBM经历了一次复兴,主要得益于与深度学习的融合:
- 基于分数的模型:这是当前最主流的生成式模型之一(如DDPM、Score SDE),它实际上是EBM的一个变体,它不直接学习能量 ( E(x) ),而是学习能量函数的梯度 ( \nabla_x E(x) ),即“分数”(score),这巧妙地绕过了配分函数 ( Z ) 的难题,因为对梯度求导时 ( Z ) 会消失,通过朗之万动力学沿着分数方向进行迭代,可以生成高质量样本。
- 自回归与EBM结合:将序列生成任务建模为条件EBM,例如在自然语言处理领域。
- 作为判别器的EBM:GAN中的判别器可以被视为一个EBM,对真实样本给低能量,对生成样本给高能量。
- 组合EBM:在药物发现、材料科学中,将不同的物理、化学约束编码为独立的能量项,然后组合起来进行分子设计。
| 特性 | 描述 |
|---|---|
| 核心思想 | 为每种状态分配一个“能量”,好状态能量低,坏状态能量高。 |
| 数学基础 | 玻尔兹曼分布 ( p(x) = \exp(-E(x)) / Z )。 |
| 核心挑战 | 计算配分函数 ( Z ) 和 负向采样。 |
| 训练方法 | 对比散度(CD)、噪声对比估计(NCE)。 |
| 现代地位 | 基于分数的模型(如扩散模型)是其最成功的现代形式。 |
| 常见应用 | 图像生成、3D形状生成、异常检测、组合优化、结构生物学。 |
一句话总结:基于能量的模型是一种通过能量函数来隐式定义概率分布的框架,强大灵活但训练困难,它的现代变体——基于分数的模型——已经成为生成式AI领域最前沿的技术基石之一。