跳转至
verl 框架代码教程
__init__.py — 模块初始化文件
正在初始化搜索引擎
verl 框架代码教程
首页
阅读指南
背景知识
教程导览
核心模块
核心模块
__init__.py — 包初始化模块
protocol.py — 数据传输协议
base_config.py — 基础配置类
训练器
训练器
__init__.py — 这是 trainer 模块的包初始化文件
constants_ppo.py — 该文件定义了 PPO 训练中 Ray 运行时所需的环境变量常量
main_eval.py — 这是一个离线评估脚本
main_generation_server.py — 这是一个独立的文本生成服务器脚本
main_ppo.py — 这是 PPO 训练的主入口文件
sft_trainer.py — 这是 SFT (Supervised Fine-Tuning) 单机训练器
sft_trainer_ray.py — 这是 SFT 的 Ray 分布式版本训练器
Config
Config
__init__.py — 配置子模块的包初始化文件
algorithm.py — 该文件定义了 算法相关的配置数据类
config.py — 该文件定义了训练系统中的基础配置数据类
Ppo
Ppo
__init__.py — PPO 子模块的包初始化文件
core_algos.py — 这是 PPO 算法的核心算法实现文件
metric_utils.py — 该文件实现了 PPO 训练过程中的指标计算工具
prefix_grouper_utils.py — 该文件实现了 前缀共享优化(Prefix Sharing) 的工具函数
ray_trainer.py — 这是 整个 verl 框架最核心的文件
reward.py — 该文件负责奖励函数的加载和管理
rollout_corr_helper.py — 该文件实现了 Rollout 校正(Rollout Correction) 模块
utils.py — 该文件定义了 PPO 训练中的基础类型和辅助判断函数
执行层 Workers
执行层 Workers
__init__.py — 模块初始化文件
__init__.py — 模块初始化文件
目录
文件概述
background.py — RLHF 是让大语言模型(LLM)与人类偏好对齐的核心技术
engine_workers.py — 统一引擎 Workers
fsdp_workers.py — FSDP 后端 PPO Workers
megatron_workers.py — Megatron 后端 PPO Workers
Actor
Actor
__init__.py — Actor 模块初始化
base.py — Actor 抽象基类
dp_actor.py — FSDP 数据并行 Actor
megatron_actor.py — Megatron 并行 Actor
Config
Config
__init__.py — 配置模块初始化
actor.py — Actor 配置
critic.py — Critic 配置
engine.py — 训练引擎配置
megatron_peft.py — Megatron PEFT 配置
model.py — 模型配置
optimizer.py — 优化器配置
reward.py — 奖励配置
rollout.py — Rollout 配置
Critic
Critic
__init__.py — Critic 模块初始化
base.py — Critic 抽象基类
dp_critic.py — FSDP 数据并行 Critic
megatron_critic.py — Megatron 并行 Critic
Engine
Engine
__init__.py — 引擎模块初始化
base.py — 训练引擎基类与注册表
utils.py — 引擎通用工具
Fsdp
Fsdp
__init__.py — FSDP 引擎模块初始化
transformer_impl.py — FSDP 训练引擎实现
utils.py — FSDP 工具函数
Megatron
Megatron
__init__.py — Megatron 引擎模块初始化
transformer_impl.py — Megatron 训练引擎实现
utils.py — Megatron 工具函数
Mindspeed
Mindspeed
__init__.py — Mindspeed 引擎模块初始化
transformer_impl.py — Mindspeed(华为 NPU)引擎
Torchtitan
Torchtitan
__init__.py — TorchTitan 引擎模块初始化
transformer_impl.py — TorchTitan 训练引擎实现
utils.py — TorchTitan 工具函数
Veomni
Veomni
__init__.py — VeOmni 引擎模块初始化
transformer_impl.py — VeOmni 训练引擎实现
utils.py — VeOmni 工具函数
Reward manager
Reward manager
__init__.py — 奖励管理器模块初始化
abstract.py — 奖励管理器抽象基类
batch.py — Batch 奖励管理器
dapo.py — DAPO 奖励管理器
naive.py — Naive 奖励管理器
prime.py — PRIME 奖励管理器
registry.py — 奖励管理器注册表
Rollout
Rollout
__init__.py — Rollout 模块初始化
base.py — Rollout 抽象基类与注册表
hf_rollout.py — HuggingFace Rollout
replica.py — Rollout 副本管理
schemas.py — Rollout 数据结构
tokenizer.py — Rollout Tokenizer 接口
utils.py — Rollout 通用工具
Naive
Naive
__init__.py — Naive Rollout 模块初始化
naive_rollout.py — Naive Rollout
Sglang rollout
Sglang rollout
__init__.py — SGLang Rollout 模块初始化
async_sglang_server.py — SGLang 异步服务器
http_server_engine.py — SGLang HTTP 服务引擎
sglang_rollout.py — SGLang 推理适配器
utils.py — SGLang 工具函数
Trtllm rollout
Trtllm rollout
trtllm_async_server.py — TensorRT-LLM 异步服务器
trtllm_rollout.py — TensorRT-LLM 推理适配器
Vllm rollout
Vllm rollout
__init__.py — vLLM Rollout 模块初始化
bucketed_weight_transfer.py — 分桶权重传输
utils.py — vLLM Rollout 工具
vllm_async_server.py — vLLM HTTP 服务器
vllm_rollout.py — vLLM 推理适配器
Sharding manager
Sharding manager
__init__.py — 分片管理器模块初始化
base.py — 分片管理器基类
fsdp_ulysses.py — FSDP + Ulysses 分片管理器
Utils
Utils
__init__.py — 工具函数模块初始化
losses.py — 损失函数
padding.py — 填充格式转换工具
单控制器
单控制器
__init__.py — verl/single_controller/__init__.py
Base
Base
decorator.py — verl/single_controller/base/decorator.py
__init__.py — verl/single_controller/base/__init__.py
worker.py — verl/single_controller/base/worker.py
worker_group.py — verl/single_controller/base/worker_group.py
Ray
Ray
base.py — verl/single_controller/ray/base.py
__init__.py — verl/single_controller/ray/__init__.py
模型
模型
__init__.py — verl/models/__init__.py
registry.py — 旧版 Megatron 模型注册表
weight_loader_registry.py — 权重加载/保存注册表
Llama megatron
Llama megatron
__init__.py — LLaMA Megatron 模块导出
__init__.py — LLaMA 模块根初始化
modeling_llama_megatron.py — LLaMA Megatron 主模型
Checkpoint utils
Checkpoint utils
__init__.py — LLaMA 权重工具导出
llama_loader.py — LLaMA 权重加载(广播版)
llama_loader_depracated.py — LLaMA 权重加载(本地版)
llama_saver.py — LLaMA 权重合并保存
Layers
Layers
__init__.py — LLaMA 并行层导出
parallel_attention.py — LLaMA 并行注意力
parallel_decoder.py — LLaMA 并行解码层
parallel_linear.py — LLaMA 并行线性层
parallel_mlp.py — LLaMA 并行 MLP
parallel_rmsnorm.py — LLaMA 并行 RMSNorm
Mcore
Mcore
__init__.py — verl/models/mcore/__init__.py
bridge.py — Megatron-Bridge 集成
config_converter.py — HF 配置到 mcore 配置的转换
loader.py — HF 权重加载到 mcore 模型
mbridge.py — mbridge 轻量集成
model_forward.py — mcore 模型前向函数
model_forward_1f1b_overlap.py — 1F1B 流水线重叠前向
model_forward_fused.py — 融合 kernel 前向函数
model_initializer.py — mcore 模型初始化器
mtp_patch.py — MTP (Multi-Token Prediction) 补丁
patch.py — mcore 兼容性补丁
qwen2_5_vl.py — Qwen2.5-VL mcore 实现
registry.py — Megatron-Core 模型注册表
saver.py — mcore 权重保存/合并
util.py — 序列打包/解包工具
weight_converter.py — 权重名称转换器
Qwen2 megatron
Qwen2 megatron
__init__.py — Qwen2 Megatron 模块导出
modeling_qwen2_megatron.py — Qwen2 Megatron 主模型
__init__.py — Qwen2 模块根初始化
Checkpoint utils
Checkpoint utils
__init__.py — Qwen2 权重工具导出
qwen2_loader.py — Qwen2 权重加载(广播版)
qwen2_loader_depracated.py — Qwen2 权重加载(本地版)
qwen2_saver.py — Qwen2 权重合并保存
Layers
Layers
__init__.py — Qwen2 并行层导出
parallel_attention.py — Qwen2 并行注意力
parallel_decoder.py — Qwen2 并行解码层
parallel_linear.py — Qwen2 并行线性层
parallel_mlp.py — Qwen2 并行 MLP
parallel_rmsnorm.py — Qwen2 并行 RMSNorm
Transformers
Transformers
__init__.py — verl/models/transformers/__init__.py
apertus.py — Apertus 注意力层 Ulysses SP 适配
dense_common.py — 纯文本模型通用前向
glm4v.py — GLM-4V 视觉语言模型适配
kimi_vl.py — KimiVL (DeepSeek-V3 架构) 注意力适配
llama.py — LLaMA 注意力层 Ulysses SP 适配
monkey_patch.py — 统一 Monkey Patch 入口
npu_patch.py — 华为 NPU 优化补丁
qwen2.py — Qwen2 注意力层 Ulysses SP 适配
qwen2_vl.py — Qwen2-VL / Qwen2.5-VL 视觉语言模型适配
qwen3_vl.py — Qwen3-VL 视觉语言模型适配
tiled_mlp.py — 分片 MLP 显存优化
检查点引擎
检查点引擎
base.py — 这是整个 checkpoint_engine 模块最核心的文件
hccl_checkpoint_engine.py — 这是基于 **HCCL(Huawei Collective Communication Librar...
__init__.py — 这是 checkpoint_engine 模块的入口文件
kimi_checkpoint_engine.py — 这是基于 Kimi ParameterServer 的权重同步后端实现
mooncake_checkpoint_engine.py — 这是基于 Mooncake TransferEngine 的权重同步后端实现
nccl_checkpoint_engine.py — 这是基于 **NCCL(NVIDIA Collective Communications Libra...
nixl_checkpoint_engine.py — 这是基于 NIXL(NVIDIA Inference Xfer Library) 的权重同步...
工具库
工具库
device.py — 设备抽象层
config.py — 配置管理工具
import_utils.py — 动态导入与依赖检查
py_functional.py — Python 通用函数式工具
torch_dtypes.py — PyTorch 数据类型工具
distributed.py — 分布式训练工具
fsdp_utils.py — FSDP 分布式训练工具
ulysses.py — Ulysses 序列并行
tokenizer.py — Tokenizer 加载与处理
chat_template.py — 聊天模板处理
tensordict_utils.py — TensorDict 操作工具
torch_functional.py — 核心 Torch 计算函数
activation_offload.py — 激活值 CPU 卸载
tracking.py — 实验追踪
seqlen_balancing.py — 序列长度负载均衡
memory_utils.py — 显存管理与可视化
__init__.py — 模块入口
attention_utils.py — 注意力计算工具
flops_counter.py — 浮点运算量估算
fs.py — 文件系统工具
groupwise.py — 分组统计工具
hdfs_io.py — HDFS 文件 IO
logging_utils.py — 日志工具
megatron_peft_utils.py — Megatron + PEFT/LoRA 适配
megatron_utils.py — Megatron 模型转换工具
model.py — 模型创建工具
net_utils.py — 网络工具
npu_flash_attn_utils.py — NPU FlashAttention 适配
ray_utils.py — Ray 分布式计算工具
rollout_skip.py — Rollout 跳过策略
rollout_trace.py — Rollout 追踪日志
transformers_compat.py — Transformers 库版本兼容
Checkpoint
Checkpoint
__init__.py — 模块入口
checkpoint_manager.py — 基础检查点管理器
checkpoint_handler.py — 检查点保存/加载处理器
fsdp_checkpoint_manager.py — FSDP 检查点管理
megatron_checkpoint_manager.py — Megatron 检查点管理
Dataset
Dataset
__init__.py — 模块入口
rl_dataset.py — RLHF 数据集
rm_dataset.py — 奖励模型数据集
dataset_utils.py — 数据集工具
vision_utils.py — 多模态视觉处理
multiturn_sft_dataset.py — 多轮对话 SFT 数据集
Debug
Debug
__init__.py — 调试工具子包的入口文件
metrics.py — 这个文件实现了调试度量指标的计算
performance.py — 这是一个向后兼容的重导出文件
trajectory_tracker.py — 这个文件实现了轨迹追踪器(Trajectory Tracker)
Experimental
Experimental
__init__.py — 实验性功能子包的入口文件
torch_functional.py — 这个文件实现了 FusedLinearForPPO -- 一个为 PPO 训练优化的融合线性...
Kernel
Kernel
__init__.py — 模块入口
linear_cross_entropy.py — 融合线性交叉熵
kernels.py — Triton 内核实现
fp8_kernel.py — FP8 量化内核
Logger
Logger
__init__.py — 日志工具子包的入口文件
aggregate_logger.py — 这个文件提供了分布式训练环境中的日志工具
Megatron
Megatron
__init__.py — 模块入口
optimizer.py — Megatron 优化器
sequence_parallel.py — 序列并行
pipeline_parallel.py — 流水线并行
tensor_parallel.py — 张量并行
memory.py — 内存缓冲区管理
dist_checkpointing.py — 分布式检查点
router_replay_patch.py — MoE 路由重放补丁
router_replay_utils.py — MoE 路由重放工具
Metric
Metric
__init__.py — 度量指标工具子包的入口文件
utils.py — 这个文件提供了训练度量指标的收集和聚合工具
Profiler
Profiler
__init__.py — 模块入口
config.py — 分析器配置
profile.py — 分布式分析器核心
nvtx_profile.py — NVIDIA NVTX 分析
mstx_profile.py — 华为 NPU MSTX 分析
torch_profile.py — PyTorch Profiler
performance.py — 性能指标工具
empty_annotations.py — 空标记实现
Qat
Qat
__init__.py — 这是 **QAT(Quantization-Aware Training
core.py — 这是 QAT 模块的核心配置和应用逻辑
linear.py — 这个文件实现了 QATLinear -- 带有假量化(Fake Quantization)功...
quantizer.py — 这个文件实现了 QATQuantizer -- 用于将 QAT 训练后的 FP16/BF16...
vllm_patch.py — 这个文件为 vLLM 推理框架提供 NVFP4 量化权重的动态加载补丁
Rendezvous
Rendezvous
__init__.py — 汇合点(Rendezvous)子包的入口文件
ray_backend.py — 这个文件实现了基于 Ray 的 NCCL 通信器汇合(Rendezvous) 机制
Reward score
Reward score
__init__.py — 这是奖励评分模块的入口文件
geo3k.py — 这个文件实现了 Geometry3K 几何题数据集的奖励评分
gsm8k.py — 这个文件实现了 GSM8K 数据集的奖励评分逻辑
math_batch.py — 这个文件是一个批量评分的示范模块
math_dapo.py — 这个文件实现了 DAPO 风格数学题的奖励评分逻辑
math_reward.py — 这个文件实现了 MATH 数据集(Hendrycks' MATH)的奖励评分逻辑
math_verify.py — 这个文件使用第三方库 math-verify(HuggingFace 开发)来进行更精确的数...
search_r1_like_qa_em.py — 这个文件实现了 Search-R1 风格的 QA 精确匹配(Exact Match)评分
Prime code
Prime code
__init__.py — 这是 PRIME 代码评测子包的入口文件
testing_util.py — 这是代码评测的底层执行引擎
utils.py — 这个文件提供了代码正确性检查的进程隔离包装器
Prime math
Prime math
__init__.py — 这是 PRIME 数学评分子包的入口文件
grader.py — 这个文件是 PRIME 数学评分的核心评判器
math_normalize.py — 这个文件实现了 LaTeX 数学表达式的标准化处理
Sandbox fusion
Sandbox fusion
__init__.py — 这是 Sandbox Fusion 远程代码评测的入口文件
utils.py — 这个文件实现了与远程 Sandbox Fusion 服务的完整交互逻辑
Sglang
Sglang
sglang_fp8_utils.py — 这个文件实现了 SGLang 推理引擎的 FP8 量化支持
Vllm
Vllm
__init__.py — vLLM 工具子包的入口文件
patch.py — 这个文件为 vLLM 中的 MoE(Mixture of Experts)模型提供权重加载补...
utils.py — 这个文件提供了与 vLLM LoRA 功能集成的工具类
vllm_fp8_utils.py — 这个文件实现了 vLLM 推理引擎的 FP8 量化支持
工具
工具
__init__.py — verl/tools/__init__.py
base_tool.py — verl/tools/base_tool.py
geo3k_tool.py — verl/tools/geo3k_tool.py
gsm8k_tool.py — verl/tools/gsm8k_tool.py
image_zoom_in_tool.py — verl/tools/image_zoom_in_tool.py
mcp_base_tool.py — verl/tools/mcp_base_tool.py
mcp_search_tool.py — verl/tools/mcp_search_tool.py
sandbox_fusion_tools.py — verl/tools/sandbox_fusion_tools.py
schemas.py — verl/tools/schemas.py
search_tool.py — verl/tools/search_tool.py
Utils
Utils
__init__.py — verl/tools/utils/__init__.py
search_r1_like_utils.py — verl/tools/utils/search_r1_like_utils.py
tool_registry.py — verl/tools/utils/tool_registry.py
Mcp clients
Mcp clients
McpClientManager.py — verl/tools/utils/mcp_clients/McpClientManager.py
utils.py — verl/tools/utils/mcp_clients/utils.py
交互
交互
__init__.py — verl/interactions/__init__.py
base.py — verl/interactions/base.py
gsm8k_interaction.py — verl/interactions/gsm8k_interaction.py
weather_interaction.py — verl/interactions/weather_interaction.py
Utils
Utils
__init__.py — verl/interactions/utils/__init__.py
interaction_registry.py — verl/interactions/utils/interaction_registry.py
模型合并
模型合并
__init__.py — model_merger 包初始化
__main__.py — model_merger CLI 入口
base_model_merger.py — 抽象基类与配置
fsdp_model_merger.py — FSDP Checkpoint 合并器
megatron_model_merger.py — Megatron-LM Checkpoint 合并器
实验性功能
实验性功能
__init__.py — 这是 verl.experimental 包的初始化文件
Agent loop
Agent loop
__init__.py — 这是 agent_loop 子包的初始化文件
agent_loop.py — 这是 agent_loop 模块的核心文件
single_turn_agent_loop.py — 实现了最简单的 Agent 循环——单轮对话(Single Turn)
tool_agent_loop.py — 实现了支持工具调用的多轮 Agent 循环
tool_parser.py — 定义了工具调用解析器——从 LLM 生成的文本中提取函数调用信息
utils.py — 提供 Agent 循环的辅助工具函数
prometheus_utils.py — 提供 Prometheus 监控配置的自动更新功能
Dataset
Dataset
__init__.py — dataset 子包的初始化文件
sampler.py — 定义了两个抽象采样器接口
Dynamic dataset
Dynamic dataset
__init__.py — dynamic_dataset 子包的初始化文件
dynamicgen_dataset.py — 实现了动态数据生成数据集——支持在训练迭代之间动态生成新的训练数据
Fully async policy
Fully async policy
fully_async_main.py — 这是全异步 PPO 训练的主入口文件
fully_async_rollouter.py — 实现了全异步样本生成器(Rollouter)
fully_async_trainer.py — 实现了全异步 PPO 训练器——全异步架构中的"消费者"
message_queue.py — 实现了基于 Ray 的异步消息队列
param_sync.py — 实现了参数同步器——负责在训练器(Actor)和推理器(Rollout)之间同步模型参数
detach_utils.py — 提供全异步训练的数据处理工具
megatron_utils.py — 提供 Megatron-Core 模型的 CPU 参数备份和恢复功能
fsdp2_utils.py — 提供 FSDP2(Fully Sharded Data Parallelism v2) 模型...
Agent loop
Agent loop
__init__.py — 全异步策略的 Agent 循环子包初始化文件
agent_loop.py — 实现了全异步策略专用的 Agent 循环管理器和 Worker
partial_tool_agent_loop.py — 实现了支持部分回滚的工具调用 Agent 循环
partial_single_turn_agent_loop.py — 实现了支持部分回滚的单轮 Agent 循环
Sglang rollout
Sglang rollout
sglang_async_server.py — 实现了支持取消/恢复的 SGLang 推理服务器
__init__.py — 空的初始化文件
Unittest
Unittest
simple_streaming_demo.py — 一个独立的演示脚本
Vllm rollout
Vllm rollout
vllm_async_server.py — 实现了支持取消/恢复的 vLLM 推理服务器
__init__.py — 空的初始化文件
One step off policy
One step off policy
main_ppo.py — def create_resource_pool_manager(config, roles):
ray_trainer.py — 实现了一步离策略 PPO 训练器
utils.py — 提供一步离策略训练的工具函数
distributed_utils.py — 提供分布式通信工具
Agent loop
Agent loop
__init__.py — 一步离策略的 Agent 循环子包初始化文件
agent_loop.py — 实现了一步离策略专用的 Agent 循环管理器
Reward loop
Reward loop
__init__.py — 这是 reward_loop 模块的包初始化文件
reward_loop.py — 这是奖励循环系统的核心文件
reward_model.py — RewardModelManager 负责初始化和管理用于奖励计算的 LLM 推理服务
__init__.py — 奖励管理器子模块的包初始化文件
registry.py — 这个文件实现了奖励管理器的注册表模式(Registry Pattern)
base.py — 定义了所有奖励管理器的抽象基类 RewardManagerBase
naive.py — NaiveRewardManager 是最基础的奖励管理器实现
dapo.py — DAPORewardManager 是为 DAPO(Direct Alignment from ...
limited.py — 这个文件实现了带速率限制的奖励管理器 RateLimitedRewardManager
remote.py — RemoteRewardManager 将奖励计算分发到多个 Ray 远程 worker 上并行...
naive_router.py — 实现了一个基于 FastAPI 的简单负载均衡路由器 NaiveRouter
inner_sglang_router.py — 这个文件使用 sglang(一个高性能 LLM 推理框架)自带的路由器实现来做负载均衡
Separation
Separation
__init__.py — 这是 separation 模块的包初始化文件
engine_workers.py — DetachActorWorker 扩展了 ActorRolloutRefWorker
ray_trainer.py — SeparateRayPPOTrainer 扩展了标准的 RayPPOTrainer
Vla
Vla
main_ppo.py — 这是 VLA(Vision-Language-Action)模型使用 PPO 算法训练的入口脚本
main_sac.py — VLA 模型使用 SAC(Soft Actor-Critic)算法训练的入口脚本
rob_ray_trainer.py — RobRayPPOTrainer 是机器人 VLA 模型的 PPO 训练器
env_loop.py — EnvLoop 管理模型与向量化环境之间的交互
dp_rob.py — RobDataParallelPPOActor 是机器人 VLA 模型的 PPO Actor 实...
fsdp_workers.py — RobActorRolloutRefWorker 扩展了通用的 `ActorRolloutRef...
naive_rollout_rob.py — NaiveRolloutRob 实现了 OpenVLA 模型的推理逻辑
prepare_libero_dataset.py — 这是一个数据预处理脚本
__init__.py — 空的包初始化文件
action_utils.py — 动作和图像处理的工具函数集合
__init__.py — 空的包初始化文件
libero_env.py — LiberoEnv 是 LIBERO 仿真基准的 Gymnasium 环境封装
venv.py — ReconfigureSubprocEnv 扩展了 Gymnasium 的 `SubprocVe...
utils.py — LIBERO 环境专用的工具函数
__init__.py — Isaac 环境子模块的包初始化文件
isaac_env.py — IsaacEnv 是基于 NVIDIA Isaac Sim 仿真器的环境封装
__init__.py — 模型子模块的包初始化文件
register_vla_models.py — 将自定义 VLA 模型注册到 HuggingFace 的 Auto 类系统中
mlp.py — 通用的多层感知机(MLP)模块
__init__.py — 空的包初始化文件
constants.py — 定义了 OpenVLA-OFT 模型使用的常量
configuration_prismatic.py — 定义了 Prismatic 系列模型(包括 OpenVLA)的 HuggingFace 配置类
modeling_prismatic.py — 这是 OpenVLA-OFT 模型的核心实现文件(约 2000 行)
train_utils.py — 训练相关的工具函数
processing_prismatic.py — 定义了 OpenVLA 模型的图像处理器 PrismaticImageProcessor 和统一...
__init__.py — PI0 模型子模块的包初始化文件
configuration_pi0_torch.py — 定义 PI0 模型的 HuggingFace 配置类
modeling_pi0_torch.py — PI0ForActionPrediction 是 PI0/PI0.5 模型的顶层封装
pi0_utils.py — PI0 模型的数据变换工具集合
modeling_pi0.py — PI0Model 是 PI0 的核心推理模型
paligemma_with_expert.py — 实现了 PI0 的双流 Transformer 架构
__init__.py — 空的包初始化文件
base.py — 定义了 PI0 策略的输入/输出抽象基类 Pi0Input 和 Pi0Output
libero_policy.py — LIBERO 平台的 PI0 策略适配器
base.py — 定义了 SAC(Soft Actor-Critic)算法的接口
sac_actor.py — RobDataParallelSACActor 实现了完整的 SAC 训练逻辑
replay_pool.py — SACReplayPool 实现了 SAC 算法所需的经验回放缓冲区(Replay Bu...
sac_ray_trainer.py — RobRaySACTrainer 是机器人 VLA 模型的 SAC 训练器
naive_rollout_pi05.py — PI0RolloutRob 扩展了 NaiveRolloutRob
env_worker.py — EnvWorker 是运行在 Ray 上的环境工作器
env_manager.py — EnvManager 使用子进程模式管理仿真器的生命周期
env_loop_wg_test.py — 这是一个测试/调试脚本
第三方集成
第三方集成
__init__.py — third_party 包初始化
__init__.py — vLLM 版本兼容层
__init__.py — PyTorch 补丁包标识
_state_dict_utils.py — 分布式 state_dict 工具函数
state_dict.py — Checkpoint State Dict 管理
目录
文件概述
__init__.py
— 模块初始化文件
¶
文件概述
¶
模块初始化文件,仅包含 Apache 2.0 许可证声明,不导出任何内容。各子模块通过各自的
__init__.py
独立管理导出。
回到页面顶部