jat-dataset jat-project
JAT Dataset Dataset Description The Jack of All Trades (JAT) dataset combines a wide range of individual datasets. It includes expert demonstrations by expert RL agents, image and caption pairs, textual data and more. The JAT dataset is part of the JAT project, which aims to build a multimodal generalist agent. Paper: https://huggingface.co/papers/2402.09844 Usage >>> from datasets import load_dataset >>> dataset =… See the full description on the dataset page: https://huggingface.co/datasets/jat-project/jat-dataset.
- 类型
- dataset
- 许可
- apache-2.0
- 下载量
- 378,554
- 点赞
- 78
- 访问
- public
- 文件
- 0
标签
- 多模态数据集
- 预训练语料
- 强化学习
- 对话数据
- Agent
- 机器人数据
- 文本数据集
- 图像数据集
摘要
JAT数据集是Jack of All Trades项目的一部分,旨在构建多模态通才智能体。它整合了多个来源的异构数据,包括强化学习专家演示(如Atari游戏)、图像与描述配对以及文本数据等。该数据集可作为训练多模态通用智能体的基础语料,涵盖强化学习、文本生成和问答等任务场景,来源于Conceptual Captions、OK-VQA、Oscar等多个公开数据集。
README
--- annotations_creators: - found - machine-generated license: apache-2.0 source_datasets: - conceptual-captions - ok-vqa - oscar task_categories: - reinforcement-learning - text-generation - question-answering pretty_name: JAT-dataset configs: - config_name: atari-alien data_files: - split: train …