TinyStories roneneldan

Dataset containing synthetically generated (by GPT-3.5 and GPT-4) short stories that only use a small vocabulary. Described in the following paper: https://arxiv.org/abs/2305.07759. The models referred to in the paper were trained on TinyStories-train.txt (the file tinystories-valid.txt can be used for validation loss). These models can be found on Huggingface, at roneneldan/TinyStories-1M/3M/8M/28M/33M/1Layer-21M. Additional resources: tinystories_all_data.tar.gz - contains a superset of… See the full description on the dataset page: https://huggingface.co/datasets/roneneldan/TinyStories.

类型
dataset
许可
cdla-sharing-1.0
语言
en
下载量
94,684
点赞
1,114
访问
public
文件
0

标签

  • 合成数据
  • 文本数据集
  • 文本生成
  • 预训练语料
  • 大语言模型

摘要

TinyStories 是由 GPT-3.5 和 GPT-4 合成生成的英文短篇故事数据集,仅使用较小词汇量,专为训练和评测小型语言模型而设计。该数据集解决了小模型在受限数据集上训练的问题,可评估小模型的生成与推理能力,适合用于语言模型研究、教学和小型模型训练场景。

README

--- license: cdla-sharing-1.0 task_categories: - text-generation language: - en --- 包含由 GPT-3.5 和 GPT-4 合成生成的短篇故事的数据集,仅使用少量词汇。 在以下论文中描述:https://arxiv.org/abs/2305.07759。 论文中提到的模型是在 TinyStories-train.txt 上训练的(文件 tinystories-valid.txt 可用于验证损失)。这些模型可以在 Huggingface 上找到,位于 roneneldan/TinyStories-1M/3M/8…

查看完整页面 · 查看原文