跳转至

rm_dataset.py — 奖励模型数据集

文件路径: verl/utils/dataset/rm_dataset.py

文件概述

奖励模型 (Reward Model) 训练的数据集。奖励模型需要成对的数据——同一个 prompt 的"好"回答和"差"回答——来学习评分。

核心功能

  • 加载成对偏好数据(chosen/rejected response pairs)
  • 支持与 RL 数据集类似的 tokenization 和多模态处理
  • 返回包含 chosen 和 rejected 两个序列的 batch

与其他模块的关系

  • 与 rl_dataset.py 共享大量逻辑
  • 被奖励模型训练脚本使用

小结

奖励模型训练专用的数据集实现。