pile EleutherAI
The Pile is a 825 GiB diverse, open source language modelling data set that consists of 22 smaller, high-quality datasets combined together.
- 类型
- dataset
- 许可
- other
- 语言
- en
- 下载量
- 2,877
- 点赞
- 502
- 访问
- public
- 文件
- 0
标签
- 预训练语料
- 文本数据集
- 语言建模
- 文本生成
- NLP
- 深度學習
摘要
The Pile 是由 EleutherAI 构建的大型开源英语预训练语料库,汇集22个子数据集,总规模达825GiB。它涵盖学术论文、法律文书、代码、论坛、新闻等多种来源,为语言模型预训练和掩码语言建模提供多样化高质量数据。该数据集广泛用于训练大型语言模型,也是模型评测和学术研究的常用基准。
README
--- annotations_creators: - no-annotation language_creators: - found language: - en license: other multilinguality: - monolingual pretty_name: the Pile size_categories: - 100B<n<1T source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-lang…