reward.py — 奖励配置¶
文件概述¶
定义奖励模型和奖励管理器的配置类。
核心配置类¶
RewardConfig¶
@dataclass
class RewardConfig:
reward_manager: str = "naive" # naive/batch/dapo/prime
compute_score: str = None # 自定义奖励函数路径
num_examine: int = 1 # 打印样本数量(调试用)
RewardModelConfig¶
RewardManagerConfig¶
管理多种奖励来源的配置。
SandboxFusionConfig¶
沙箱融合奖励的配置(用于代码执行等需要安全沙箱的奖励计算)。
小结¶
奖励配置控制如何计算和管理训练奖励信号,支持从简单规则到复杂模型的多种方式。