Qwen3-VL-8B-Instruct Qwen

类型
model
任务
image-text-to-text
框架
transformers
下载量
5,033,841
点赞
1,047
访问
public
文件
0

标签

  • 多模态
  • 视觉语言模型
  • 视觉问答
  • 文本生成
  • Agent
  • 大语言模型
  • OCR
  • transformers

摘要

Qwen3-VL-8B-Instruct是通义千问系列最强的视觉语言模型,支持图像和视频理解、视觉Agent操作、视觉编程、3D空间定位与长上下文视频理解。该模型在文本理解与生成、视觉感知与推理、OCR(32种语言)、STEM/数学推理等方面全面提升,原生支持256K上下文并具备Agent交互能力。适用于多模态对话、GUI自动化、文档解析、视频分析与空间推理等场景。

README

--- license: apache-2.0 pipeline_tag: image-text-to-text library_name: transformers --- <a href="https://chat.qwenlm.ai/" target="_blank" style="margin: 2px;"> <img alt="Chat" src="https://img.shields.io/badge/%F0%9F%92%9C%EF%B8%8F%20Qwen%20Chat%20-536af5" style="display: inline-block; vertical-ali…

查看完整页面 · 查看原文