区块链 区块链技术 比特币公众号手机端

视频模型蒸馏技术综述

图像

蒸馏的目标是将一个高质量的视频模型(“教师”)转化为采样速度更快的模型(“学生”)。虽然这可能会导致质量略有下降,但最先进的蒸馏方法可以将推理速度提升 10-50 倍,这对于机器人等应用场景往往至关重要。

在视频建模中,蒸馏可以沿两个轴向发挥作用:

  • 多步扩散 → 少步扩散
  • 双向扩散 → 自回归生成

我将讨论这两个轴向上的代表性方法,以及一些有趣且反直觉的技术现象。

为什么不直接训练一个快速模型?

乍一看,蒸馏似乎很浪费。为什么要投入资源先训练一个慢速的教师模型,然后再让它来监督快速模型的训练?为什么不直接用训练教师模型所用的相同数据,从头训练快速模型呢?其中的原因比人们最初想象的要微妙一些。

密集监督

第一个原因是,直接训练少步扩散模型是一个更困难的优化问题。以一步模型的极端情况为例。从头训练这样的模型,需要直接学习从噪声到数据的映射。相比之下,训练一个多步教师模型要容易得多(这与扩散建模本身之所以有效的道理相同)。一旦多步模型训练完成,我们就可以利用它,在连接噪声与数据的轨迹上为一步模型提供密集监督。例如,一致性蒸馏(Song '23)利用教师的轨迹施加约束:要求学生将同一条轨迹上的两个点映射到同一个干净数据点(见下图)。

图像

图 1:常见蒸馏方法的示意图。

On-policy 监督

第二个原因则更为微妙。训练教师模型让我们能够在学生生成的状态上提供监督(即 on-policy 监督)。例如,分布匹配蒸馏(DMD;Yin '23)会对学生进行 rollout,以让其状态分布与教师相匹配(见上图)。它通过为学生提供 on-policy 修正,缓解了经典的 DAgger 问题(Ross '10)。正如下文将进一步讨论的,对于视频模型,这些修正可以沿两个轴向发生:(1)沿从噪声到数据的去噪轨迹;(2)沿帧轴(即视频时间)。第二种 on-policy 修正对自回归模型尤其关键,因为自回归模型存在曝光偏差:将模型生成的帧作为后续自回归生成的输入,会导致误差迅速累积。

多步 → 少步蒸馏

视频模型蒸馏的第一个轴向沿去噪方向展开:从多步流匹配模型转变为一步/少步模型。最流行的几类方法如图 1 所示。

一致性蒸馏

一致性蒸馏(Song '23)训练模型将噪声到数据轨迹上的任意一点映射到其终点(即干净数据)。蒸馏损失试图强制实现这样的一致性:教师轨迹上的两个点应被映射到同一个终点(见图 1)。Wan 视频模型使用一致性蒸馏(Wan '25)训练了一个 4 步模型;配合一些额外技术,可以在质量损失极小的情况下实现 10-20 倍的推理加速。Fast-Hunyuan 模型也使用了一致性蒸馏(见下面的示例)。

Image

流映射方法

流映射方法(Geng '25,Sabour '25)学习的是比一致性模型学到的映射更为通用的形式:将时刻 t 的状态映射到同一条轨迹上时刻 r 的状态(图 1)。这解决了使用一致性模型进行多步推理(而非其原本训练所针对的一步推理)时会遇到的噪声累积挑战;参见 Sabour '25。论文《如何构建一致性模型》(Boffi '25)对一致性模型、流映射与渐进式蒸馏(Salimans '22)做了很好的综合阐述。

分布匹配

一致性蒸馏和流映射都是基于轨迹的蒸馏方法:它们训练学生沿着教师的轨迹向前跳跃。直观来看,这一要求过强且并无必要。一个好的学生并不需要与教师拥有完全相同的噪声到数据映射:我们只关心输出的分布是否相同。分布匹配方法(DMD:Yin '23;DMD2:Yin '24;MMD:Salimans '24)将这一直觉付诸实践。具体来说,DMD 旨在最小化学生输出分布与教师输出分布之间的 KL 散度(图 1 中的“分布匹配”,t = 1)。

轨迹分布匹配

最近,轨迹分布匹配(TDM;Luo '25)将基于轨迹与基于分布的蒸馏方法的优势结合了起来。其论点在于,纯粹匹配输出分布(即在 t = 1 处)会错失教师沿轨迹提供的潜在而丰富的监督。因此,TDM 提出在分布层面匹配学生生成的轨迹与教师生成的轨迹:

{i=0}^{K−1} KL(p{θ,tᵢ}(x_{tᵢ}) ‖ p_{ϕ,tᵢ}(x_{tᵢ})) (Eq. 1)

其中 pθ 是学生的分布,pϕ 是教师的分布。这相当于在多个时间步上对学生与教师的分布进行匹配(图 1,取多个 t 值)。

AnyFlow

AnyFlow(Gu '26)通过两个阶段的蒸馏,将基于轨迹和基于分布的蒸馏方法结合起来:首先学习一个流映射,然后以 DMD 目标进行 on-policy 蒸馏。

等等,学生能超越教师吗?

蒸馏方法中一个有趣的发现是,学生模型往往能超越教师模型。乍一看,这似乎是不可能的(根据数据处理不等式)。然而,这是多篇论文都观察到的稳健现象(例如 MMD 和 TDM)。虽然这些论文对此做了简要讨论并提出了一些假设,但我还没有看到能够将这一机制完全分离出来的严谨实验。

我对这一现象的最佳解释,来自 on-policy 监督所起的作用。在分布匹配方法中,学生会在其访问过的状态上获得来自教师的监督。从式 (1) 中可以直观地看出这一点;由于这是“反向”KL 散度,对数似然的期望是按学生所访问状态的分布来计算的。因此,学生会获得 DAgger 式的 on-policy 修正,从而缓解误差累积。

但为什么 on-policy 修正能让学生超越教师呢?一种理解方式是,教师实际上提供了两种东西。教师是一个“actor”,也就是一个我们可以从中采样的模型。但教师同时也是一个“critic”:其 score 函数提供局部监督,指示样本应向何处移动,以增加其在数据生成分布下的似然。当我们从 actor 中采样时,误差会随采样步骤不断累积。但当我们针对某一点查询教师时,并不存在累积误差。因此,在由学生生成的状态上查询教师的 score 函数,能够为学生提供强有力的 on-policy 监督。

on-policy 监督的益处已在 LLM 领域得到了更深入的研究。事实上,关于 LLM 的 on-policy 蒸馏,原始论文(Agarwal '23)就观察到蒸馏得到的学生模型超越了其教师模型。其他论文(Chen '25,Shenfeld '26)和博客文章(nrehiew '26)也研究了 on-policy 监督对 LLM 蒸馏的益处。如果能在扩散模型领域看到类似研究,那将会非常有趣。

双向 → 因果蒸馏

与图像生成模型不同,视频生成提供了另一个蒸馏轴向:从双向(全序列)的视频帧生成,转向因果(自回归)生成。这借助 KV 缓存显著加速了推理。如 CausVid(Yin 等人 '25)所示,将多步双向教师蒸馏为少步自回归学生(例如通过 DMD),可以让推理速度提升数个数量级。

为什么不直接训练一个自回归模型呢?CausVid 提出的流程似乎有些迂回:先训练一个多步双向教师,然后将其蒸馏为一个少步自回归模型。另一种做法是先训练一个自回归教师,再将其蒸馏为少步自回归学生。然而,正如 CausVid 所证明的,这样得到的少步模型会明显更弱,因为自回归教师比双向教师更弱。

曝光偏差与 self forcing

自回归生成面临的主要挑战是曝光偏差:不完美的生成帧被用作进一步生成的输入,从而导致误差累积(见下方 BAgger 的示例视频;Po '26)。为了解决这个问题,self forcing(Huang '25)在训练期间模拟推理过程,将生成的帧而非 ground-truth 帧(teacher forcing)作为模型输入。然后在视频级别使用基于 DMD 的蒸馏损失,即将自回归生成视频的分布与双向教师生成视频的分布进行匹配。

图像

使用 BAgger 缓解曝光偏差(Po '26)。

另一个缓解曝光偏差的有趣方法来自 BAgger(Po '26),见上图。顾名思义,BAgger 采用了一种 DAgger 式的 on-policy 修正方法:先生成一些带有曝光偏差的帧,再获取修正来消除这些伪影。为了获得修正轨迹,他们使用了一个巧妙的技巧:将已生成的视频直接倒放。倒放的视频提供了这样的示例:从带有曝光偏差伪影的帧过渡到没有伪影的帧。

结语

快速推理对许多应用领域都至关重要。上述技术正被迅速应用于机器人领域,以实现虚拟远程操作等应用——即与世界模型模拟器进行实时交互;例如,参见 RynnWorld(Zhao '26;见下文)和交互式世界模拟器(Wang '26)。我个人感觉,推理时间现在基本上已经不成问题了;我们已经能够获得能力很强、速度足以满足许多现实世界需求的视频模型。

图像

RynnWorld(Zhao '26)使用蒸馏技术,在世界模型中实现了实时远程操作。

在技术层面,我很期待看到视频模型两个后训练步骤的融合:强化学习(见上一篇博文)和蒸馏。有一些很好的新兴工作(Jiang '26)展示了将两者结合如何带来互补优势。

  • 原文链接: x.com/majumdar_ani/statu...
  • 鸿途知科网 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~
版权声明

本文仅代表作者观点,不代表区块链技术网立场。
本文系作者授权本站发表,未经许可,不得转载。

发表评论:

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。

热门