RedPajama-Data-1T togethercomputer
RedPajama is a clean-room, fully open-source implementation of the LLaMa dataset.
- 类型
- dataset
- 语言
- en
- 下载量
- 1,939
- 点赞
- 1,187
- 访问
- public
- 文件
- 0
标签
- 预训练语料
- 文本数据集
- 多语言语料
- 大语言模型
- 代码数据
- NLP
- 深度学习
- 数据处理
摘要
RedPajama 是一个 clean-room 式完全开源实现 LLaMA 数据配方的超大规模英文预训练语料,总规模约1.2万亿token,由 Commoncrawl、C4、GitHub、ArXiv、Wikipedia 与 StackExchange 等子集构成。它解决了大模型预训练语料的透明度与可复现性问题,提供数据集划分、去重与质量过滤的完整流程及脚本。适用于训练和继续预训练大语言模型,也可拆分为各子集用于不同场景的数据研究。
README
--- task_categories: - text-generation language: - en pretty_name: Red Pajama 1T --- ### 快速开始 该数据集包含 2084 个 jsonl 文件。 你可以通过 HuggingFace 下载数据集: ```python from datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T") ``` 或者,你可以使用以下命令直接下载文件: ``` wget 'https://data.together.…