pretraining_v1-omega applied-ai-018

类型
dataset
下载量
531,436
点赞
5
访问
public
文件
0

标签

  • 预训练语料
  • 文本数据集
  • 多语言语料
  • 大语言模型
  • 预训练
  • NLP

摘要

该数据集是 Common Crawl 2013-20 版本的网络爬虫文本数据,包含大规模多语言网页文本,每个样本带有文本、URL、日期、语言及语言置信度、token数等字段。它适用于大语言模型的预训练语料,帮助模型学习广泛的语言知识和世界信息。数据规模庞大(约72亿字节、217万样本),可按 dump 分块加载用于大规模预训练。

README

--- dataset_info: - config_name: CC-MAIN-2013-20 features: - name: text dtype: string - name: id dtype: string - name: dump dtype: string - name: url dtype: string - name: date dtype: string - name: file_path dtype: string - name: language dtype: string - name: language_score dtype: float64 - name:…

查看完整页面 · 查看原文