MNBVC liwu

MNBVC: Massive Never-ending BT Vast Chinese corpus

类型
dataset
许可
mit
语言
zh
下载量
103,490
点赞
650
访问
public
文件
0

标签

  • 预训练语料
  • 文本数据集
  • 大语言模型
  • 多语言语料
  • 代码数据
  • 文本生成
  • NLP

摘要

MNBVC 是当前规模最大的中文互联网语料集之一,涵盖学术论文、博客、书籍、企业年报、代码、爬虫文本、论坛、游戏平行语料等数十个子集。该数据集主要用于中文大语言模型的预训练与语言建模,覆盖领域广泛、结构化良好,可按标签字典通过 streaming 方式便捷加载,适合自然语言处理研究者和模型训练团队使用。

README

--- annotations_creators: - other language: - zh language_creators: - other license: - mit multilinguality: - monolingual pretty_name: MNBVC size_categories: - unknown source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling…

查看完整页面 · 查看原文