跳转至

reward.py — 奖励配置

文件概述

定义奖励模型和奖励管理器的配置类。

核心配置类

RewardConfig

@dataclass
class RewardConfig:
    reward_manager: str = "naive"          # naive/batch/dapo/prime
    compute_score: str = None              # 自定义奖励函数路径
    num_examine: int = 1                   # 打印样本数量(调试用)

RewardModelConfig

@dataclass
class RewardModelConfig:
    enable: bool = False                   # 是否启用神经网络奖励模型
    path: str = ""                         # 奖励模型路径

RewardManagerConfig

管理多种奖励来源的配置。

SandboxFusionConfig

沙箱融合奖励的配置(用于代码执行等需要安全沙箱的奖励计算)。

小结

奖励配置控制如何计算和管理训练奖励信号,支持从简单规则到复杂模型的多种方式。