preprocessed_commoncatalog-cc-by SwayStar123
I also seperately provide just the prompts in prompts.json keys are the image_id, and the values are the captions generated Captions generated by moondream: vikhyatk/moondream2 Latents generated by SDXL VAE: madebyollin/sdxl-vae-fp16-fix Embeddings generated by SigLIP: hf-hub:timm/ViT-SO400M-14-SigLIP-384 Original dataset: common-canvas/commoncatalog-cc-by Latents f32 and embeddings are f16 bytes Compute cost: 16x3090 for 3 day. Approximately.
- 类型
- dataset
- 许可
- cc-by-4.0
- 语言
- en
- 下载量
- 215,724
- 点赞
- 2
- 访问
- public
- 文件
- 0
标签
- 图像数据集
- 多模态数据集
- 文生图
- 图像特征提取
- 预训练语料
- 深度学习
- 视觉模型
- 扩散模型
摘要
本数据集对commoncatalog-cc-by图像语料进行预处理,为每张图像提供由moondream2生成的文字描述、SDXL VAE生成的潜在向量以及SigLIP生成的图像嵌入,可直接用于扩散模型训练与图像理解。采用f32潜在向量和f16嵌入压缩存储,并单独提供prompts.json便于提示词使用。适合用于文生图任务的训练数据准备和多模态特征提取。
README
--- license: cc-by-4.0 language: - en --- 我另外在 prompts.json 中单独提供了提示词。 键是 image_id,值是对应的生成说明文字。 由 moondream 生成的说明文字:vikhyatk/moondream2 由 SDXL VAE 生成的潜变量:madebyollin/sdxl-vae-fp16-fix 由 SigLIP 生成的嵌入向量:hf-hub:timm/ViT-SO400M-14-SigLIP-384 原始数据集:common-canvas/commoncatalog-cc-by 潜变量为 f32 格式,嵌入向量为 f16…