跳转至

actor.py — Actor 配置

文件概述

定义 Actor(策略网络)相关的所有配置类。

核心配置类

ActorConfig

Actor 的通用配置:

@dataclass
class ActorConfig:
    ppo_mini_batch_size: int = 256        # PPO 更新的 mini-batch 大小
    ppo_micro_batch_size: int = None      # 微批次大小(控制显存)
    ppo_epochs: int = 1                   # PPO 更新轮数
    shuffle: bool = False                 # 是否打乱 mini-batch
    entropy_coeff: float = 0.001          # 熵正则化系数
    clip_ratio: float = 0.2              # PPO clip 比例
    use_kl_loss: bool = False            # 是否使用 KL 损失
    kl_loss_coef: float = 0.001          # KL 损失系数
    loss_agg_mode: str = "mean"          # 损失聚合方式

PolicyLossConfig

策略损失的细节配置:

@dataclass
class PolicyLossConfig:
    loss_mode: str = "vanilla"  # 损失模式: vanilla, dapo, dr_grpo 等

RouterReplayConfig

MoE 路由重放配置:

@dataclass
class RouterReplayConfig:
    mode: str = "disabled"  # disabled, R3 等

各后端特有配置

  • FSDPActorConfig: FSDP 后端的额外参数
  • McoreActorConfig: Megatron 后端的额外参数
  • VeOmniActorConfig: VeOmni 后端参数
  • TorchTitanActorConfig: TorchTitan 后端参数

小结

Actor 配置控制 PPO 训练的超参数(clip ratio、entropy 系数、KL 系数等),是调优 RLHF 训练最重要的配置之一。