wikipedia wikimedia
Dataset Card for Wikimedia Wikipedia Dataset Summary Wikipedia dataset containing cleaned articles of all languages. The dataset is built from the Wikipedia dumps (https://dumps.wikimedia.org/) with one subset per language, each containing a single train split. Each example contains the content of one full Wikipedia article with cleaning to strip markdown and unwanted sections (references, etc.). All language subsets have already been processed for recent dump… See the full description on the dataset page: https://huggingface.co/datasets/wikimedia/wikipedia.
- 種別
- dataset
- ライセンス
- cc-by-sa-3.0
- 言語
- ab
- ダウンロード
- 228,662
- いいね
- 1,369
- アクセス
- public
- ファイル
- 0
タグ
- 事前学習コーパス
- 多言語コーパス
- テキストデータ
- 言語モデリング
- 大規模データセット
- マスク言語モデリング
概要
ウィキペディアのダンプから抽出・クリーニングされた全言語の記事データセットで、言語ごとにサブセットが用意されている。マークダウンや参考文献などの不要セクションを除去した完全な記事テキストが含まれ、言語モデルの事前学習やマスク言語モデリングに最適。対応言語数が非常に多く、多言語コーパスとして汎用性が高い。
README
--- language: - ab - ace - ady - af - alt - am - ami - an - ang - anp - ar - arc - ary - arz - as - ast - atj - av - avk - awa - ay - az - azb - ba - ban - bar - bbc - bcl - be - bg - bh - bi - bjn - blk - bm - bn - bo - bpy - br - bs - bug - bxr - ca - cbk - cdo - ce - ceb - ch - chr - chy - ckb -…