pretraining_v1-omega_books applied-ai-018
- 種別
- dataset
- ダウンロード
- 708,254
- いいね
- 24
- アクセス
- public
- ファイル
- 0
タグ
- テキストデータ
- 事前学習コーパス
- 英語コーパス
- データセット
- 大言語モデル
概要
Common Crawl(CC-MAIN-2013-20)由来の大規模英語Webクロールテキストデータセットで、事前学習用コーパスとして設計されています。テキスト、ID、URL、言語スコア、トークン数などのメタデータを備え、約5,190万サンプルを収録しています。大規模言語モデルの学習素材として適しています。
README
--- dataset_info: config_name: CC-MAIN-2013-20 features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype: string - name: file_path dtype: string - name: language dtype: string - name: language_score dtype: float64 - name: token_count dtype: int64 - n…