oasst1 OpenAssistant

OpenAssistant Conversations Dataset (OASST1) Dataset Summary In an effort to democratize research on large-scale alignment, we release OpenAssistant Conversations (OASST1), a human-generated, human-annotated assistant-style conversation corpus consisting of 161,443 messages in 35 different languages, annotated with 461,292 quality ratings, resulting in over 10,000 fully annotated conversation trees. The corpus is a product of a worldwide crowd-sourcing effort… See the full description on the dataset page: https://huggingface.co/datasets/OpenAssistant/oasst1.

类型
dataset
许可
apache-2.0
语言
en
下载量
21,688
点赞
1,559
访问
public
文件
0

标签

  • 对话数据
  • 多语言语料
  • 指令微调
  • 大语言模型
  • 文本数据集
  • 人类反馈
  • 多语言

摘要

OASST1是OpenAssistant发布的众包人工生成与标注的助手式对话语料,包含35种语言超16万条消息、46万次质量评分及逾万棵完整对话树。该数据集主要用于大规模模型对齐研究,支持监督微调和奖励模型训练,是社区推动对齐研究民主化的代表性资源。适用于训练指令跟随、对话能力及基于人类反馈的对齐模型。

README

--- license: apache-2.0 dataset_info: features: - name: message_id dtype: string - name: parent_id dtype: string - name: user_id dtype: string - name: created_date dtype: string - name: text dtype: string - name: role dtype: string - name: lang dtype: string - name: review_count dtype: int32 - name…

查看完整页面 · 查看原文