pretraining_v1-omega_books applied-ai-018

種別
dataset
ダウンロード
708,254
いいね
24
アクセス
public
ファイル
0

タグ

  • テキストデータ
  • 事前学習コーパス
  • 英語コーパス
  • データセット
  • 大言語モデル

概要

Common Crawl(CC-MAIN-2013-20)由来の大規模英語Webクロールテキストデータセットで、事前学習用コーパスとして設計されています。テキスト、ID、URL、言語スコア、トークン数などのメタデータを備え、約5,190万サンプルを収録しています。大規模言語モデルの学習素材として適しています。

README

--- dataset_info: config_name: CC-MAIN-2013-20 features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype: string - name: file_path dtype: string - name: language dtype: string - name: language_score dtype: float64 - name: token_count dtype: int64 - n…

查看完整页面 · 查看原文