dolma allenai

Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research

Type
dataset
License
odc-by
Language
en
Downloads
2,870
Likes
1,070
Access
public
Files
0

Tags

  • 预训练语料
  • 文本数据集
  • 大语言模型
  • 代码数据
  • 多语言语料
  • 深度学习
  • 预训练
  • 数据处理

README

--- license: odc-by viewer: false task_categories: - text-generation language: - en tags: - language-modeling - casual-lm - llm pretty_name: Dolma size_categories: - n>1T --- # Dolma <img alt="Dolma's official logo. It's dolma written in yellow, round lowercase letters over a blue background." src=…

查看完整页面 · 查看原文