Qwen2.5-VL-7B-Instruct Qwen

类型
model
任务
image-text-to-text
框架
transformers
下载量
9,373,502
点赞
1,677
访问
public
文件
0

标签

  • 多模态
  • 视觉语言模型
  • 大语言模型
  • 视觉问答
  • OCR
  • 文档解析
  • Agent
  • transformers

摘要

Qwen2.5-VL-7B-Instruct 是阿里通义千问团队推出的7B参数视觉语言模型,能识别图像中的物体、文本、图表与版面,并理解长达1小时以上的视频。该模型具备视觉智能体能力,可推理并调用工具完成计算机与手机操作,支持以边界框或点进行目标定位,并输出结构化JSON结果,适用于文档解析、表格发票识别及金融商业等场景。

README

--- license: apache-2.0 language: - en pipeline_tag: image-text-to-text tags: - multimodal library_name: transformers --- # Qwen2.5-VL-7B-Instruct <a href="https://chat.qwenlm.ai/" target="_blank" style="margin: 2px;"> <img alt="Chat" src="https://img.shields.io/badge/%F0%9F%92%9C%EF%B8%8F%20Qwen%2…

查看完整页面 · 查看原文