Github-verl:字节跳动Seed团队开源的高效大语言模型强化学习训练框架

https://github.com/volcengine/verl

1. 项目的主要功能和目的

verl 是一个专为大语言模型设计的灵活、高效且生产就绪的强化学习训练库。该项目由字节跳动Seed团队发起,并由verl社区共同维护。

核心目的

  • 为大语言模型提供高效的强化学习训练解决方案

  • 支持多种RL算法和模型架构

  • 实现生产环境下的可扩展性和高性能

2. 使用的主要技术或编程语言

核心技术栈

  • 编程语言:Python

  • 深度学习框架:PyTorch

  • 分布式训练:FSDP、FSDP2、Megatron-LM

  • 推理引擎:vLLM、SGLang、HF Transformers

  • 分布式计算:Ray框架

  • 模型支持:Hugging Face Transformers、Modelscope Hub

3. 项目的结构概览

verl/
├── .github/          # GitHub相关配置
├── docker/           # Docker容器配置
├── docs/            # 项目文档
├── examples/        # 使用示例
│   ├── ppo_trainer/     # PPO算法示例
│   ├── grpo_trainer/    # GRPO算法示例
│   └── sft/            # 监督微调示例
├── recipe/          # 算法配方和复现
│   ├── dapo/           # DAPO算法
│   ├── gspo/           # GSPO算法
│   └── sppo/           # SPPO算法
├── scripts/         # 工具脚本
├── tests/           # 测试代码
├── verl/            # 核心源代码
├── requirements.txt # Python依赖
└── pyproject.toml  # 项目配置

4. 项目核心代码及使用指南

快速开始

安装

pip install verl

核心特性配置

# 启用FSDP2配置
actor_rollout_ref.ref.strategy=fsdp2
actor_rollout_ref.actor.strategy=fsdp2
critic.strategy=fsdp2
reward_model.strategy=fsdp2

支持的算法

  • PPO(近端策略优化)

  • GRPO(分组策略优化)

  • GSPOReMaxRLOO

  • DAPOPRIMEDrGRPO

  • 多模态RL、工具调用RL

运行示例

项目提供了丰富的示例脚本:

# 运行Qwen3-8B的GRPO训练
./examples/grpo_trainer/run_qwen3-8b.sh

# 运行多模态RL训练
./examples/grpo_trainer/run_qwen2_5_vl-7b.sh

5. 潜在的用途或应用场景

主要应用领域:

  • 数学推理:在AIME等数学竞赛上取得优异成绩

  • 代码生成:支持编程任务的强化学习训练

  • 多模态任务:视觉语言模型的RL训练

  • 工具调用:支持多轮对话和工具使用的Agent训练

  • 科学研究:在STEM领域的推理任务

实际应用案例:

  • Seed-Thinking-v1.5:在AIME 2024上获得86.7分

  • DAPO算法:基于Qwen2.5-32B在AIME 2024上获得50分

  • 多模态Agent:支持GUI操作、搜索等复杂任务

6. 值得注意的特点或创新点

🎯 核心创新

1. HybridFlow编程模型

  • 灵活的混合控制器编程模型

  • 支持复杂后训练数据流的高效表示和执行

  • 几行代码即可构建GRPO、PPO等RL数据流

2. 3D-HybridEngine

  • 高效的Actor模型重分片技术

  • 消除内存冗余,显著减少通信开销

  • 在训练和生成阶段之间实现平滑过渡

3. 模块化架构

  • 计算和数据依赖的解耦

  • 与现有LLM框架(FSDP、Megatron-LM等)无缝集成

  • 支持灵活的GPU设备映射

4. 卓越的性能

  • 最先进的吞吐量表现

  • 支持高达671B参数的大模型

  • 支持数百个GPU的扩展训练

5. 广泛的生态系统

  • 与HuggingFace模型深度集成

  • 支持Flash Attention 2、序列打包等优化

  • 提供LoRA RL、专家并行等高级功能

🌟 社区影响力

项目已被众多知名机构采用,包括阿里巴巴Qwen团队、上海AI Lab、清华大学、UC Berkeley、微软研究院等,并在多个顶级学术会议(ICML、ICLR、EuroSys等)上展示。

verl代表了当前大语言模型强化学习训练的最前沿技术,为研究者和开发者提供了强大而灵活的工具,推动着AI模型能力的持续突破。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐