databricks-dolly-15k databricks
Summary databricks-dolly-15k is an open source dataset of instruction-following records generated by thousands of Databricks employees in several of the behavioral categories outlined in the InstructGPT paper, including brainstorming, classification, closed QA, generation, information extraction, open QA, and summarization. This dataset can be used for any purpose, whether academic or commercial, under the terms of the Creative Commons Attribution-ShareAlike 3.0 Unported… See the full description on the dataset page: https://huggingface.co/datasets/databricks/databricks-dolly-15k.
- 类型
- dataset
- 许可
- cc-by-sa-3.0
- 语言
- en
- 下载量
- 43,318
- 点赞
- 1,075
- 访问
- public
- 文件
- 0
标签
- 指令微调
- 对话数据
- 文本数据集
- 大语言模型
- 问答
- 摘要
- 文本分类
- NLP
摘要
databricks-dolly-15k 是 Databricks 员工人工生成的超过 1.5 万条指令遵循数据,覆盖 InstructGPT 论文中的头脑风暴、分类、封闭式问答、生成、信息抽取、开放式问答、摘要等八类任务。该数据集可用于学术和商业用途(CC BY-SA 3.0),主要用于大型语言模型的指令微调,也可用于合成数据生成和数据增强。
README
--- license: cc-by-sa-3.0 task_categories: - question-answering - summarization language: - en size_categories: - 10K<n<100K --- # 概述 `databricks-dolly-15k` 是一个开源数据集,包含数千名 Databricks 员工生成的指令跟随记录,涵盖 [InstructGPT](https://arxiv.org/abs/2203.02155) 论文中概述的多种行为类别,包括头脑风暴、分类、封闭问答、生成、信息抽取、开放问答和摘要。 该数据集可在 […