GLM-OCR 是一款全新的开源多模态OCR模型,专为应对复杂文档理解场景而生。该模型基于 GLM-V 架构,创新性地引入了多令牌预测(MTP)损失函数和强化学习技术,显著提升了训练效率与识别精度。在权威的 OmniDocBench V1.5 测试中,GLM-OCR 以 94.62 的分数霸榜第一,超越了 GPT-4o 等现有模型。其核心优势在于“小而精”,仅凭 0.9B 的参数量实现了高精度与高效率的平衡,特别擅长处理复杂表格、公式及印章。目前该模型已全面开源,支持 vLLM、Ollama 及 Apple Silicon 本地部署,为企业级应用提供了低成本、高效率的解决方案。
GLM-OCR开源登顶基准:0.9B参数实现SOTA性能,专攻复杂文档理解
未经允许不得转载:80aj » GLM-OCR开源登顶基准:0.9B参数实现SOTA性能,专攻复杂文档理解
相关推荐
Kimi K3 不再是便宜替代品:开源 Coding 模型开始逼近前沿
Z.ai 把开源权重推到前沿位置
英伟达发布SANA-WM:单卡可运行的高效开源视频生成模型
AI开发者面临“选型焦虑”:模型迭代太快,Qwen还能打吗?
仅26M参数!Needle模型将Gemini工具调用能力蒸馏至极致,支持本地PC微调
Mieru-OCR v1.2.0 发布:基于 ONNX Runtime Web 的浏览器端离线验证码识别工具
小参数大能耐:ZAYA1-8B数学能力匹敌DeepSeek-R1,AMD入局引发热议
DeepSeek V4 Pro 跑分曝光:力压 Kimi 2.6 夺得 Livebench 开源模型冠军