百度近日在GitHub和ModelScope社区发布了名为“Unlimited-OCR”的开源项目,旨在推动DeepSeek-OCR模型的边界,实现“单次长视野文档解析”。该项目不仅发布了技术论文,还提供了完整的推理代码和部署方案。Unlimited-OCR的核心在于处理长文档及多页PDF的能力,其测试环境基于Python 3.12、CUDA 12.9及PyTorch 2.10,支持在NVIDIA GPU上高效运行。模型采用HuggingFace Transformers架构,支持两种推理配置:“gundam”模式采用裁剪策略处理高分辨率图像,“base”模式则适用于标准文档及多页PDF解析,最大上下文长度可达32768。为了解决长文本生成中的重复问题,模型内置了N-gram重复惩罚机制。在部署层面,Unlimited-OCR除支持本地推理外,重点引入了SGLang作为服务端加速引擎。通过SGLang,用户可搭建OpenAI兼容的API服务,利用自定义Logit处理器优化长文档解析质量,并支持对PDF进行批量并发处理。代码库现已开源,开发者可直接通过HuggingFace或GitHub下载使用。
事件分析
💡 核心观点:百度借力DeepSeek架构与SGLang加速,意图在生成式OCR的长文档解析赛道确立新标杆。
原文链接:Hacker News







AI周刊:大模型、智能体与产业动态追踪