RedPajama-Data-1T togethercomputer

RedPajama is a clean-room, fully open-source implementation of the LLaMa dataset.

类型
dataset
语言
en
下载量
1,939
点赞
1,187
访问
public
文件
0

标签

  • 预训练语料
  • 文本数据集
  • 多语言语料
  • 大语言模型
  • 代码数据
  • NLP
  • 深度学习
  • 数据处理

摘要

RedPajama 是一个 clean-room 式完全开源实现 LLaMA 数据配方的超大规模英文预训练语料,总规模约1.2万亿token,由 Commoncrawl、C4、GitHub、ArXiv、Wikipedia 与 StackExchange 等子集构成。它解决了大模型预训练语料的透明度与可复现性问题,提供数据集划分、去重与质量过滤的完整流程及脚本。适用于训练和继续预训练大语言模型,也可拆分为各子集用于不同场景的数据研究。

README

--- task_categories: - text-generation language: - en pretty_name: Red Pajama 1T --- ### 快速开始 该数据集包含 2084 个 jsonl 文件。 你可以通过 HuggingFace 下载数据集: ```python from datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T") ``` 或者,你可以使用以下命令直接下载文件: ``` wget 'https://data.together.…

查看完整页面 · 查看原文