LocateAnything-3B nvidia
- 类型
- model
- 任务
- image-text-to-text
- 框架
- transformers
- 下载量
- 186,844
- 点赞
- 2,913
- 访问
- public
- 文件
- 0
标签
- 视觉语言模型
- 目标检测
- 多模态
- 图像分割
- 视觉问答
- transformers
- 位置检测
- 计算机视觉
摘要
LocateAnything-3B是NVIDIA开发的视觉语言模型,采用并行框解码(PBD)技术在单步并行预测完整边界框坐标,实现快速且高质量的视觉定位,吞吐量较此前方法提升约2.5倍。模型支持指代表达定位、多目标目标检测、GUI元素定位与文本定位等任务,广泛应用于机器人、自动驾驶、GUI交互、文档理解等场景。该模型基于Qwen2.5-3B-Instruct与MoonViT构建,仅限非商业研究用途。
README
--- license: other license_name: nvidia-license license_link: https://huggingface.co/nvidia/LocateAnything-3B/blob/main/LICENSE language: - en tags: - nvidia - eagle - vision - object-detection - grounding - locateanything - arxiv:2605.27365 demo: https://huggingface.co/spaces/nvidia/LocateAnything…