hh-rlhf Anthropic

Dataset Card for HH-RLHF Dataset Summary This repository provides access to two different kinds of data: Human preference data about helpfulness and harmlessness from Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. These data are meant to train preference (or reward) models for subsequent RLHF training. These data are not meant for supervised training of dialogue agents. Training dialogue agents on these data is likely… See the full description on the dataset page: https://huggingface.co/datasets/Anthropic/hh-rlhf.

类型
dataset
许可
mit
下载量
33,738
点赞
1,976
访问
public
文件
11

标签

  • 文本数据集
  • 预训练语料
  • 指令微调
  • 对话数据
  • NLP
  • 大语言模型

摘要

该数据集包含两类数据:一是人类对助手"有用性"与"无害性"的偏好选择数据(chosen/rejected 文本对),用于训练偏好模型以支持后续 RLHF 训练;二是红队对抗对话记录及相应无害性评分标注。适用于训练奖励/偏好模型及研究如何让大语言模型更无害,但明确不应用于对话代理的有监督训练。

README

--- license: mit tags: - human-feedback --- # HH-RLHF 数据集卡片 ## 数据集摘要 本仓库提供两种不同类型的数据: 1. 来自论文 [Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback](https://arxiv.org/abs/2204.05862) 的关于有用性和无害性的人类偏好数据。这些数据旨在训练偏好(或奖励)模型,以用于后续的 RLHF 训练。这些数据*不*适用于对话代理的监督训练。在这些数据上训练对…

查看完整页面 · 查看原文