medical shibing624
纯文本数据,中文医疗数据集,包含预训练数据的百科数据,指令微调数据和奖励模型数据。
- 类型
- dataset
- 许可
- apache-2.0
- 语言
- zh
- 下载量
- 2,536
- 点赞
- 440
- 访问
- public
- 文件
- 0
标签
- 预训练语料
- 指令微调
- 人类反馈
- 医学推理
- 文本数据集
- 大语言模型
- 多语言语料
摘要
该数据集面向中文医疗领域大模型训练,整合了预训练(百科与医学教材)、指令微调(中英文医疗问诊对话)以及奖励模型(优质/低质回答对)三部分数据。可用于医疗大模型的全流程训练,包括领域预训练、SFT监督微调与RLHF强化学习,适用于医疗问答与医学知识注入等场景。数据总量约244万条,涵盖中文为主的医疗临床问诊、知识图谱与教材语料。
README
--- license: apache-2.0 language: - zh tags: - text-generation pretty_name: medical task_categories: - text-generation size_categories: - n<1K --- # Dataset Card for medical 中文医疗数据集 - LLM Supervised Finetuning repository: https://github.com/shibing624/textgen - MeidcalGPT repository: https://github…