actor.py — Actor 配置¶
文件概述¶
定义 Actor(策略网络)相关的所有配置类。
核心配置类¶
ActorConfig¶
Actor 的通用配置:
@dataclass
class ActorConfig:
ppo_mini_batch_size: int = 256 # PPO 更新的 mini-batch 大小
ppo_micro_batch_size: int = None # 微批次大小(控制显存)
ppo_epochs: int = 1 # PPO 更新轮数
shuffle: bool = False # 是否打乱 mini-batch
entropy_coeff: float = 0.001 # 熵正则化系数
clip_ratio: float = 0.2 # PPO clip 比例
use_kl_loss: bool = False # 是否使用 KL 损失
kl_loss_coef: float = 0.001 # KL 损失系数
loss_agg_mode: str = "mean" # 损失聚合方式
PolicyLossConfig¶
策略损失的细节配置:
RouterReplayConfig¶
MoE 路由重放配置:
各后端特有配置¶
FSDPActorConfig: FSDP 后端的额外参数McoreActorConfig: Megatron 后端的额外参数VeOmniActorConfig: VeOmni 后端参数TorchTitanActorConfig: TorchTitan 后端参数
小结¶
Actor 配置控制 PPO 训练的超参数(clip ratio、entropy 系数、KL 系数等),是调优 RLHF 训练最重要的配置之一。