Unlimited-OCR baidu

类型
model
任务
image-text-to-text
框架
transformers
下载量
3,048,228
点赞
4,054
访问
public
文件
0

标签

  • 多模态
  • 视觉模型
  • 计算机视觉
  • 大语言模型
  • 文本生成
  • OCR
  • 文档解析
  • transformers

摘要

Unlimited-OCR 是百度推出的开源视觉语言模型,专注于光学字符识别(OCR)与文档解析,支持单张图像、多页图像及 PDF 文件的超长上下文解析。该模型在 DeepSeek-OCR 基础上进一步优化,通过大长度输出与 n-gram 去重机制实现高质量长文档抽取。适用于文档数字化、PDF 文本提取、版面解析等多模态理解场景。

README

--- pipeline_tag: image-text-to-text language: - multilingual tags: - baidu - vision-language - ocr - custom_code license: mit library_name: transformers --- <p align="center"> <img src="assets/baidu.png" width="55%" alt="Baidu Inc." /> </p> <hr> <h1 align="center">无限 OCR 之力</h1> <div align="center…

查看完整页面 · 查看原文