rm_dataset.py — 奖励模型数据集¶
文件路径: verl/utils/dataset/rm_dataset.py
文件概述¶
奖励模型 (Reward Model) 训练的数据集。奖励模型需要成对的数据——同一个 prompt 的"好"回答和"差"回答——来学习评分。
核心功能¶
- 加载成对偏好数据(chosen/rejected response pairs)
- 支持与 RL 数据集类似的 tokenization 和多模态处理
- 返回包含 chosen 和 rejected 两个序列的 batch
与其他模块的关系¶
- 与
rl_dataset.py共享大量逻辑 - 被奖励模型训练脚本使用
小结¶
奖励模型训练专用的数据集实现。