RedPajama-Data-1T togethercomputer

RedPajama is a clean-room, fully open-source implementation of the LLaMa dataset.

種別
dataset
言語
en
ダウンロード
1,939
いいね
1,187
アクセス
public
ファイル
0

タグ

  • 事前学習コーパス
  • 大規模データセット
  • テキストデータセット
  • 英語コーパス
  • テキスト生成
  • コードデータ
  • 大規模言語モデル
  • テキストデータ

概要

RedPajamaはLLaMA論文のデータレシピをクリーンルームで再現した、完全オープンソースの大規模テキスト事前学習コーパスです。CommonCrawl、C4、GitHub、ArXiv、Wikipedia、StackExchangeを統合し、合計約1.2兆トークンを提供します。主に英語中心で、大規模言語モデルの事前学習やベースモデルの構築を目的としたデータセットです。

README

--- task_categories: - text-generation language: - en pretty_name: Red Pajama 1T --- ### はじめに このデータセットは2084個のjsonlファイルで構成されています。 HuggingFaceを使用してデータセットをダウンロードできます: ```python from datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T") ``` または、以下のコマンドで直接ファイルをダウンロードすることもで…

查看完整页面 · 查看原文