oasst1 OpenAssistant
OpenAssistant Conversations Dataset (OASST1) Dataset Summary In an effort to democratize research on large-scale alignment, we release OpenAssistant Conversations (OASST1), a human-generated, human-annotated assistant-style conversation corpus consisting of 161,443 messages in 35 different languages, annotated with 461,292 quality ratings, resulting in over 10,000 fully annotated conversation trees. The corpus is a product of a worldwide crowd-sourcing effort… See the full description on the dataset page: https://huggingface.co/datasets/OpenAssistant/oasst1.
- 类型
- dataset
- 许可
- apache-2.0
- 语言
- en
- 下载量
- 21,688
- 点赞
- 1,559
- 访问
- public
- 文件
- 0
标签
- 对话数据
- 多语言语料
- 指令微调
- 大语言模型
- 文本数据集
- 人类反馈
- 多语言
摘要
OASST1是OpenAssistant发布的众包人工生成与标注的助手式对话语料,包含35种语言超16万条消息、46万次质量评分及逾万棵完整对话树。该数据集主要用于大规模模型对齐研究,支持监督微调和奖励模型训练,是社区推动对齐研究民主化的代表性资源。适用于训练指令跟随、对话能力及基于人类反馈的对齐模型。
README
--- license: apache-2.0 dataset_info: features: - name: message_id dtype: string - name: parent_id dtype: string - name: user_id dtype: string - name: created_date dtype: string - name: text dtype: string - name: role dtype: string - name: lang dtype: string - name: review_count dtype: int32 - name…