发布 VeRL-Omni:面向扩散模型与全模态模型的简易、快速且稳定的强化学习训练框架

7 分钟阅读
VeRL-Omni 团队

我们很高兴宣布 VeRL-Omni 的预发布版本。这是一个基于 verlvllm-omni 构建的通用强化学习 (RL) 后训练框架,专注于多模态生成模型

为什么选择 VeRL-Omni?

强化学习已成为将大型生成模型与人类偏好及下游任务奖励对齐的强大手段。虽然大型语言模型 (LLM) 的强化学习栈在过去一年中快速演进,但多模态生成式强化学习(涵盖用于图像/视频/音频理解与生成的扩散模型及全模态模型)仍面临严峻挑战:

  • 扩散模型与全模态扩展: 将 verl 出色的灵活性和性能扩展到多模态和非自回归强化学习训练领域,涵盖扩散 Transformer 主干 (Qwen-Image)、混合 AR-DiT 架构 (Qwen-Omni) 以及统一的理解与生成模型 (BAGEL, HunyuanImage3.0)。
  • 异构 Rollout 流水线: Rollout(采样过程)是在连续潜空间中的去噪轨迹,而非 token 序列。单次 Rollout 可能调用多个异构模型组件和多阶段流水线(例如:文本编码器 → DiT → VAE)。
  • 复杂工作负载调度: 编排复杂的多模态强化学习训练工作流,其中奖励函数本身也是多模态模型(VLM 判别器、OCR 评分器等),且相较于文本生成,多模态生成 Rollout 具有更高的内存峰值。

关键功能

  • 高效多模态 Rollout: 我们集成了 vLLM-Omni,以利用其针对多模态生成的高吞吐异步服务能力,同时保持与 diffusers 相媲美的精度。VeRL-Omni 通过分步持续批处理、Embedding 缓存等技术与 vLLM-Omni 协同,持续优化 Rollout 效率。
  • 灵活的奖励引擎: 涵盖基于规则的奖励和基于模型的奖励(如用于 OCR 的 VLM-as-judge)。集成了 vLLM 以实现高效的 VLM 和 LLM 奖励模型推理。奖励计算与正在进行的 Rollout 和训练过程重叠,以降低端到端延迟。
  • 模块化训练后端: 提供各种训练器 (DiffusersFSDP/Megatron/VeOmni),内置针对扩散和全模态模型的优化,支持轻松集成不同的并行策略 (FSDP/USP/TP)。
  • 广泛的硬件兼容性: 支持 NVIDIA GPU 和昇腾 NPU,实现跨不同硬件后端的灵活部署。
  • 端到端训练方案与基准: 提供参考性能结果,得益于上述功能,能够实现极高的训练吞吐量。

算法与模型支持

模型架构模态算法状态
Qwen-ImageDiT文本 → 图像FlowGRPO, MixGRPO, GRPO-Guard已发布
BAGEL统一理解 + 生成文本 + 图像FlowGRPOPR 就绪
Qwen3-Omni-ThinkerAR文本 / 图像 / 视频 / 音频GSPOPR 就绪
Wan2.2DiT文本 → 视频DanceGRPO开发中
SD3.5DiT文本 → 图像DPO开发中
HunyuanImage-3.0统一理解 + 生成文本 + 图像MixGRPO, SRPO计划中

入门指南

安装

请参阅我们的安装文档了解详情。

扩散模型训练

请查看我们的示例目录,获取启动针对图像/音频/视频理解与生成任务的各种强化学习算法训练器的具体脚本。你可以通过 wandb 追踪训练性能和结果。

演示:Qwen-Image FlowGRPO 后训练

flowgrpo 示例中,我们使用 OCR 奖励任务训练 Qwen-Image。奖励模型为 Qwen3-VL-8B-Instruct,通过读取生成的图像中的文本并将其与数据集真值对比来对图像进行评分。

算法回顾

FlowGRPO Algorithm
FlowGRPO 算法

FlowGRPO 演示

FlowGRPO 是一种针对流匹配模型的在线策略方法。它利用扩散策略模型进行多步 SDE 采样以实现有效的强化学习探索,并采用基于模型的奖励来评估生成质量。训练工作流主要包含四个关键阶段:

  1. Rollout 生成: 扩散策略模型生成样本 Rollout,收集对数概率和生成图像的轨迹。
  2. 奖励模型评分: 奖励模型对每个生成的样本进行评分,从而计算轨迹优势 (Advantage)。
  3. 策略优化: 策略使用 FlowGRPO CLIP 风格的损失函数进行更新,利用计算出的优势优化奖励。
  4. 权重同步: 定期将来自训练器的最新策略权重同步到 Rollout 工作进程,确保生成的样本反映最新的策略。

LoRA 微调

NVIDIA H800 GPU 上的训练吞吐量如下。

模式# GPU 数量ActorRollout异步奖励吞吐量 (图像/GPU/秒)单步耗时 (秒)
FlowGRPO 并置训练4440 (同步)0.305420
FlowGRPO (带异步奖励)5441 (异步)0.280360

将奖励模型移至专用的 GPU 上,通过将奖励评估与策略训练重叠,可使每步耗时减少约 14%

全模型微调

我们还在 4 × NVIDIA H200 GPU 上验证了非 CFG 全模型 Qwen-Image OCR 训练,达到了0.510 图像/GPU/秒(约 250 秒/步)。

如下所示,生成图像的文本渲染质量在 120 个训练步骤后得到了显著提升。

提示词 训练步骤 0 训练步骤 120
茂密森林中的一个木质步道标志,上面刻有"Hidden Trail",周围环绕着苔藓和叶子。
Hidden Trail — step 0
Hidden Trail — 第 0 步
Hidden Trail — step 120
Hidden Trail — 第 120 步
生日贺卡内页,写有草书"Make A Wish",周围环绕着闪烁的蜡烛和彩色纸屑。
Make A Wish — step 0
Make A Wish — 第 0 步
Make A Wish — step 120
Make A Wish — 第 120 步

以下是我们参考运行的奖励和训练曲线。在训练过程中,评论家(Critic)奖励和验证奖励均稳定收敛。

Validation reward rising from 0.7 to 0.95
验证奖励从 0.7 上升至 0.95

验证奖励稳定增加
Rollout reward mean rising from ~0.15 to ~0.9
Rollout 奖励均值从 ~0.15 上升至 ~0.9

Rollout 奖励均值增加(非 CFG Rollout 预期会有一个较低的起点)
critic/rewards/zero_std_ratio rising only after reward saturates
critic/rewards/zero_std_ratio 仅在奖励饱和后上升

零标准差比例仅在奖励饱和后上升
actor/pg_clipfrac staying in healthy range
actor/pg_clipfrac 保持在健康范围内

裁剪比例保持在健康范围内

有关训练指标的详细概述,请参阅我们的训练指标文档。

未来规划

VeRL-Omni 正在积极演进中,目前处于预发布阶段,核心扩散强化学习栈已趋于稳定。我们的路线图专注于扩展模型和算法支持,并突破高效多模态强化学习训练的边界。

  • 模型支持扩展: 支持广泛的开源扩散和全模态模型,涵盖图像/视频/音频生成任务以及统一理解与生成任务。
  • 算法支持扩展: 集成已提出的稳定且先进的强化学习算法,例如 DiffusionNFT。
  • 全异步强化学习: 在 Actor、Rollout 和奖励模型之间实现端到端异步流水线,超越当前的异步奖励设置,以提高训练吞吐量和 GPU/NPU 利用率。
  • 与 vLLM-Omni 协同优化: 生成式 Rollout 占据了训练时间的很大一部分。我们期望通过与 vLLM-Omni 的紧密集成进一步加速多模态 Rollout,利用并行、量化、批处理和优化的请求调度等先进技术。
  • 高效全模态训练器: 除了 DiffusersFSDPTrainer,我们期望基于 Megatron-core 和 VeOmni 发布更多针对全模态和扩散模型高度优化的训练器引擎。
  • 更广泛的硬件支持: 继续加强昇腾 NPU 的支持,并通过硬件插件系统欢迎更多的硬件后端。

加入社区

对于扩散模型和全模态强化学习的后训练而言,这仅仅是一个开始。我们正在积极开发对更多架构和算法的支持,并邀请社区共同塑造 VeRL-Omni 的未来。

让我们一起构建全模态强化学习的未来!