HelpSteer2 nvidia

HelpSteer2: Open-source dataset for training top-performing reward models HelpSteer2 is an open-source Helpfulness Dataset (CC-BY-4.0) that supports aligning models to become more helpful, factually correct and coherent, while being adjustable in terms of the complexity and verbosity of its responses. This dataset has been created in partnership with Scale AI. When used to tune a Llama 3.1 70B Instruct Model, we achieve 94.1% on RewardBench, which makes it the best Reward Model as… See the full description on the dataset page: https://huggingface.co/datasets/nvidia/HelpSteer2.

类型
dataset
许可
cc-by-4.0
语言
en
下载量
47,653
点赞
454
访问
public
文件
0

标签

  • 数据集
  • 人类反馈
  • 指令微调
  • 对话数据
  • 大语言模型
  • 强化学习
  • NLP
  • 评测基准

摘要

HelpSteer2是NVIDIA与Scale AI联合发布的开源帮助度评估数据集(CC-BY-4.0),包含约21362个样本,每个样本包含提示、回复以及人工标注的五项属性(帮助度、正确性、连贯性、复杂度、详尽度)。该数据集专用于训练帮助度奖励模型(reward model),搭配Llama 3.1 70B在RewardBench上达到94.1%的成绩,也可通过帮助度评分构建偏好对用于DPO/SteerLM回归奖励模型训练及RLHF对齐。适用于模型对齐、奖励模型训练与人类反馈驱动的强化学习等场景。

README

--- license: cc-by-4.0 language: - en pretty_name: HelpSteer2 size_categories: - 10K<n<100K tags: - human-feedback --- # HelpSteer2:用于训练顶尖奖励模型的开源数据集 HelpSteer2 是一个开源的 Helpfulness 数据集(CC-BY-4.0),用于帮助模型对齐,使其更具帮助性、事实准确性和连贯性,同时其响应的复杂度和冗长程度可调节。 本数据集是与 [Scale AI](https://scale.com/) 合作创建的。 当使用该数据集微调 [Lla…

查看完整页面 · 查看原文