跳转至

main_sac.py — VLA 模型使用 SAC(Soft Actor-Critic)算法训练的入口脚本

文件路径: verl/experimental/vla/main_sac.py 模块路径: verl.experimental.vla.main_sac

文件概述

VLA 模型使用 SAC(Soft Actor-Critic)算法训练的入口脚本。与 main_ppo.py 结构类似,但使用 SAC 训练器而非 PPO。

关键代码

@hydra.main(config_path="config", config_name="sac_config")
def main_task(config):
    """SAC 训练的主入口"""
    # 创建 SAC 训练器
    trainer = RobRaySACTrainer(config)

    # 运行训练循环
    trainer.fit()

PPO vs SAC 入口对比

特性 main_ppo.py main_sac.py
算法 PPO(在策略) SAC(离策略)
训练器 RobRayPPOTrainer RobRaySACTrainer
配置文件 ppo_config sac_config
回放缓冲区 不需要 需要(SACReplayPool)

与其他模块的关系

  • 使用 RobRaySACTrainer(sac/sac_ray_trainer.py)
  • SAC 需要额外的 Critic 网络和回放缓冲区

小结

SAC 训练的入口点,通过 Hydra 配置驱动 SAC 训练流程。