手写字识别实测:腾讯元宝意外胜出,Kimi与Gemini惜败
针对手写小说电子化的实际需求,作者横向对比了Gemini、DeepSeek、Kimi、豆包、文心一言等十余款主流大模型及传统OCR工具。结果显示,尽管Gemini等多模态模型备受推崇,但在处理潦草手写体时存在幻觉或准确率不足的问题。传统扫描...
标签索引 / 第 5 页
这个标签下有 190 篇文章。按时间回看相关判断与实践记录。
标签精选
针对手写小说电子化的实际需求,作者横向对比了Gemini、DeepSeek、Kimi、豆包、文心一言等十余款主流大模型及传统OCR工具。结果显示,尽管Gemini等多模态模型备受推崇,但在处理潦草手写体时存在幻觉或准确率不足的问题。传统扫描...
针对传统RAG方案难以处理包含图文、视频的混合企业知识库痛点,通义实验室正式开源了VimRAG框架。该框架能够统一处理“文本+图像+视频”三种模态,有效解决跨模态、长上下文(如长时间视频定位)的检索难题。通过结合Qwen2.5-VL-7B-...
AI 独角兽 MiniMax 正式推出了名为 MMX 的官方命令行(CLI)工具,专为 AI Agent 及开发者生态打造。该工具打破了传统 API 调用的繁琐,允许用户直接在终端或任何 Agent 环境中,通过简单的命令生成文字、图像、视...
Meta推出全新Muse Spark模型,主打工具调用、视觉推理链及多Agent协同功能。其最大亮点在于“Contemplating(深思)”模式,支持多个Agent并行思考问题并汇总结果。性能测试显示,Muse Spark在CharXiv...
近期,科技社区有用户基于DeepSeek界面的细微变化推测,该模型可能即将发布原生多模态功能。发帖者指出,鉴于其“快速模式”已展现出OCR图文识别能力,逻辑上推断“专家模式”极有可能集成了更深层的图像理解与交互功能。若此次猜测属实,意味着D...
据DeepSeek官网最新动态,备受瞩目的国产大模型DeepSeek正在对新版本进行灰度测试。此次更新最大的亮点在于首次支持多模态能力,标志着该模型已突破单一文本处理的局限,向图像、视频等多维交互领域进军。这一技术跃升意味着DeepSeek...
一项针对多模态大模型OCR能力的对比测试显示,谷歌Gemini在处理极难识别的手写字迹时表现优于字节跳动的豆包。测试素材选用了字迹细小且书写潦草的私人日记文本,尽管对模型识别能力构成巨大挑战,Gemini仍展现出了更强的鲁棒性。测试数据表明...
开发者 Fikri Karim 在 GitHub 上开源了 Parlor 项目,展示了在 M3 Pro 芯片上运行完全本地化的实时多模态 AI 能力。该项目利用 Google 最新的 Gemma 4 E2B 模型处理视觉和语音输入,结合 K...
本文汇总了一位科技极客与ACM竞赛选手对当前主流大模型的主观使用体验。海外“御三家”中,Claude凭借极具灵性的代码能力备受推崇,但账号封禁风险大、获取门槛高;Gemini则因强大的推理能力和多模态表现成为首选,常用于文档审阅与日常问答。...
近日,有开发者在社区热议 Grok 独特的网页交互功能。与 ChatGPT 和 Gemini 仅提取文本摘要不同,Grok 展示了直接抓取第三方网页并在输出中嵌入可视化“快照”的能力。这种“所见即所得”的信息整合方式,不仅大幅提升了用户获取...