preprocessed_commoncatalog-cc-by SwayStar123

I also seperately provide just the prompts in prompts.json keys are the image_id, and the values are the captions generated Captions generated by moondream: vikhyatk/moondream2 Latents generated by SDXL VAE: madebyollin/sdxl-vae-fp16-fix Embeddings generated by SigLIP: hf-hub:timm/ViT-SO400M-14-SigLIP-384 Original dataset: common-canvas/commoncatalog-cc-by Latents f32 and embeddings are f16 bytes Compute cost: 16x3090 for 3 day. Approximately.

类型
dataset
许可
cc-by-4.0
语言
en
下载量
215,724
点赞
2
访问
public
文件
0

标签

  • 图像数据集
  • 多模态数据集
  • 文生图
  • 图像特征提取
  • 预训练语料
  • 深度学习
  • 视觉模型
  • 扩散模型

摘要

本数据集对commoncatalog-cc-by图像语料进行预处理,为每张图像提供由moondream2生成的文字描述、SDXL VAE生成的潜在向量以及SigLIP生成的图像嵌入,可直接用于扩散模型训练与图像理解。采用f32潜在向量和f16嵌入压缩存储,并单独提供prompts.json便于提示词使用。适合用于文生图任务的训练数据准备和多模态特征提取。

README

--- license: cc-by-4.0 language: - en --- 我另外在 prompts.json 中单独提供了提示词。 键是 image_id,值是对应的生成说明文字。 由 moondream 生成的说明文字:vikhyatk/moondream2 由 SDXL VAE 生成的潜变量:madebyollin/sdxl-vae-fp16-fix 由 SigLIP 生成的嵌入向量:hf-hub:timm/ViT-SO400M-14-SigLIP-384 原始数据集:common-canvas/commoncatalog-cc-by 潜变量为 f32 格式,嵌入向量为 f16…

查看完整页面 · 查看原文