COIG-CQIA m-a-p

COIG-CQIA:Quality is All you need for Chinese Instruction Fine-tuning Dataset Details Dataset Description 欢迎来到COIG-CQIA,COIG-CQIA全称为Chinese Open Instruction Generalist - Quality is All You Need, 是一个开源的高质量指令微调数据集,旨在为中文NLP社区提供高质量且符合人类交互行为的指令微调数据。COIG-CQIA以中文互联网获取到的问答及文章作为原始数据,经过深度清洗、重构及人工审核构建而成。本项目受LIMA: Less Is More for Alignment等研究启发,使用少量高质量的数据即可让大语言模型学习到人类交互行为,因此在数据构建中我们十分注重数据的来源、质量与多样性,数据集详情请见数据介绍以及我们接下来的论文。 Welcome to the… See the full description on the dataset page: https://huggingface.co/datasets/m-a-p/COIG-CQIA.

类型
dataset
语言
zh
下载量
7,330
点赞
762
访问
public
文件
0

标签

  • 指令微调
  • 大语言模型
  • 对话数据
  • 多语言语料
  • 文本生成
  • 问答
  • NLP
  • 数据处理

摘要

COIG-CQIA是一个开源的高质量中文指令微调数据集,旨在为中文NLP社区提供高质量且符合人类交互行为的监督微调数据。数据来源于知乎、豆瓣、小红书、百科、考试试题、金融医疗等多个领域的中文互联网问答与文章,经过深度清洗、重构及人工审核构建而成,强调数据的来源、质量与多样性。适用于大语言模型的指令微调,帮助模型学习人类交互行为。

README

--- configs: - config_name: "chinese_traditional" data_files: - split: train path: chinese_traditional/* - config_name: "coig_pc" data_files: - split: train path: coig_pc/* - config_name: "exam" data_files: - split: train path: exam/* - config_name: "finance" - config_name: "douban" data_files: - s…

查看完整页面 · 查看原文