[错误] RewardDataset 在截断后默默保留变成相同的偏好项对
作者: ai-yang创建于 2026年8月20日更新于 2026年8月21日
import torch import torch.nn.functional as F from datasets import Dataset from types import SimpleNamespace as NS from transformers import AutoTokenizer from openrlhf.datasets import RewardDataset MODEL_PATH = "/path/to/Qwen3.5-0.8B" tokenizer = AutoTokenizer.from_pretrained( MODEL_PATH, trust_remote_code=True, local_files_only=True, ) common = "shared token sequence " * 80 raw =
内容来源: OpenRLHF/OpenRLHF