Unlimited-OCR baidu
- 类型
- model
- 任务
- image-text-to-text
- 框架
- transformers
- 下载量
- 3,048,228
- 点赞
- 4,054
- 访问
- public
- 文件
- 0
标签
- 多模态
- 视觉模型
- 计算机视觉
- 大语言模型
- 文本生成
- OCR
- 文档解析
- transformers
摘要
Unlimited-OCR 是百度推出的开源视觉语言模型,专注于光学字符识别(OCR)与文档解析,支持单张图像、多页图像及 PDF 文件的超长上下文解析。该模型在 DeepSeek-OCR 基础上进一步优化,通过大长度输出与 n-gram 去重机制实现高质量长文档抽取。适用于文档数字化、PDF 文本提取、版面解析等多模态理解场景。
README
--- pipeline_tag: image-text-to-text language: - multilingual tags: - baidu - vision-language - ocr - custom_code license: mit library_name: transformers --- <p align="center"> <img src="assets/baidu.png" width="55%" alt="Baidu Inc." /> </p> <hr> <h1 align="center">无限 OCR 之力</h1> <div align="center…