跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

OCR识别

这个标签下有 12 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

Auge Vision:让开发者直接在终端调用计算机视觉能力

Auge Vision 是一款新兴的命令行工具,旨在将计算机视觉和 OCR(光学字符识别)能力直接集成到开发者的终端环境中。尽管目前社区反馈显示其在中文识别的示例演示中可能存在瑕疵,但这并未掩盖其作为“终端原生 AI”的创新价值。该项目代表...

1 分钟阅读74 阅读
前沿哨所

多模态大模型“团战”失败?手写菜单识别竟成顶级AI的软肋

一则来自技术社区的帖子引发了广泛关注,该测试揭示了主流多模态大模型在特定场景下的实际短板。测试要求模型从包含复杂手写数字和勾选标记的菜单图片中,精准提取菜品名与数量,并强制输出为无Markdown干扰的YAML格式。结果显示,包括GLM-5...

1 分钟阅读81 阅读
前沿哨所

搞定辅导作业:程序员打造“松鼠听写”,集成OCR与语音交互

针对市面上听写软件词库割裂、节奏僵化的问题,一位开发者推出“松鼠听写”App。该应用集成了 OCR 图像识别技术,支持直接拍摄书本自动提取词汇,免去了跨 App 复制的繁琐。同时,引入语音控制系统,用户可通过语音指令切换词汇或重复朗读,让孩...

1 分钟阅读168 阅读