dolma allenai
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
- Type
- dataset
- License
- odc-by
- Language
- en
- Downloads
- 2,870
- Likes
- 1,070
- Access
- public
- Files
- 0
Tags
- 预训练语料
- 文本数据集
- 大语言模型
- 代码数据
- 多语言语料
- 深度学习
- 预训练
- 数据处理
README
--- license: odc-by viewer: false task_categories: - text-generation language: - en tags: - language-modeling - casual-lm - llm pretty_name: Dolma size_categories: - n>1T --- # Dolma <img alt="Dolma's official logo. It's dolma written in yellow, round lowercase letters over a blue background." src=…