Janus-Pro-7B deepseek-ai
- 类型
- model
- 任务
- any-to-any
- 框架
- transformers
- 下载量
- 14,624
- 点赞
- 3,646
- 访问
- public
- 文件
- 0
标签
- 多模态
- 文生图
- 图像生成
- 视觉语言模型
- 大语言模型
- 生成式AI
- transformers
- 深度学习
摘要
Janus-Pro-7B 是一个统一的多模态理解与生成模型,通过解耦视觉编码路径,在单一 Transformer 架构下同时支持图像理解(SigLIP 视觉编码器)与文生图(LlamaGen 分词器)任务。它基于 DeepSeek-LLM-7b-base 构建,解决了以往统一模型中视觉编码器在理解与生成间的冲突问题,性能超越此前的统一模型并匹敌专用模型。适用于需要同时处理图像理解与图像生成的统一多模态应用场景。
README
--- license: mit license_name: deepseek license_link: LICENSE pipeline_tag: any-to-any library_name: transformers tags: - muiltimodal - text-to-image - unified-model --- ## 1. 简介 Janus-Pro 是一种新颖的自回归框架,统一了多模态理解与生成。 它通过将视觉编码解耦为独立的路径,同时仍然使用单一的、统一的 transformer 架构进行处理,解决了此前方法的局限性。这种解耦不仅缓解了视觉编码器在理解与生成角色之…