Qwen2.5-VL-3B-Instruct Qwen

类型
model
任务
image-text-to-text
框架
transformers
下载量
7,129,922
点赞
685
访问
public
文件
0

标签

  • 多模态
  • 视觉语言模型
  • 视觉问答
  • 文档解析
  • 文生视频
  • 文本生成
  • Agent
  • transformers

摘要

Qwen2.5-VL-3B-Instruct 是通义千问系列的多模态视觉语言模型,能够识别常见物体并深入分析图像中的文字、图表、图标和版面布局。该模型兼具视觉智能体能力,可动态调度工具实现计算机/手机操作,同时支持超1小时长视频理解、物体定位(边界框/点)、结构化JSON输出等功能。适用于文档解析、图表问答、视频内容分析、视觉Agent及金融商业等场景。

README

--- license_name: qwen-research license_link: https://huggingface.co/Qwen/Qwen2.5-VL-3B-Instruct/blob/main/LICENSE language: - en pipeline_tag: image-text-to-text tags: - multimodal library_name: transformers --- # Qwen2.5-VL-3B-Instruct <a href="https://chat.qwenlm.ai/" target="_blank" style="marg…

查看完整页面 · 查看原文