Janus-Pro-7B deepseek-ai

类型
model
任务
any-to-any
框架
transformers
下载量
14,624
点赞
3,646
访问
public
文件
0

标签

  • 多模态
  • 文生图
  • 图像生成
  • 视觉语言模型
  • 大语言模型
  • 生成式AI
  • transformers
  • 深度学习

摘要

Janus-Pro-7B 是一个统一的多模态理解与生成模型,通过解耦视觉编码路径,在单一 Transformer 架构下同时支持图像理解(SigLIP 视觉编码器)与文生图(LlamaGen 分词器)任务。它基于 DeepSeek-LLM-7b-base 构建,解决了以往统一模型中视觉编码器在理解与生成间的冲突问题,性能超越此前的统一模型并匹敌专用模型。适用于需要同时处理图像理解与图像生成的统一多模态应用场景。

README

--- license: mit license_name: deepseek license_link: LICENSE pipeline_tag: any-to-any library_name: transformers tags: - muiltimodal - text-to-image - unified-model --- ## 1. 简介 Janus-Pro 是一种新颖的自回归框架,统一了多模态理解与生成。 它通过将视觉编码解耦为独立的路径,同时仍然使用单一的、统一的 transformer 架构进行处理,解决了此前方法的局限性。这种解耦不仅缓解了视觉编码器在理解与生成角色之…

查看完整页面 · 查看原文