main_sac.py — VLA 模型使用 SAC(Soft Actor-Critic)算法训练的入口脚本¶
文件路径:
verl/experimental/vla/main_sac.py模块路径:verl.experimental.vla.main_sac
文件概述¶
VLA 模型使用 SAC(Soft Actor-Critic)算法训练的入口脚本。与 main_ppo.py 结构类似,但使用 SAC 训练器而非 PPO。
关键代码¶
@hydra.main(config_path="config", config_name="sac_config")
def main_task(config):
"""SAC 训练的主入口"""
# 创建 SAC 训练器
trainer = RobRaySACTrainer(config)
# 运行训练循环
trainer.fit()
PPO vs SAC 入口对比¶
| 特性 | main_ppo.py | main_sac.py |
|---|---|---|
| 算法 | PPO(在策略) | SAC(离策略) |
| 训练器 | RobRayPPOTrainer | RobRaySACTrainer |
| 配置文件 | ppo_config | sac_config |
| 回放缓冲区 | 不需要 | 需要(SACReplayPool) |
与其他模块的关系¶
- 使用
RobRaySACTrainer(sac/sac_ray_trainer.py) - SAC 需要额外的 Critic 网络和回放缓冲区
小结¶
SAC 训练的入口点,通过 Hydra 配置驱动 SAC 训练流程。