跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 5 页

多模态

这个标签下有 190 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

手写字识别实测:腾讯元宝意外胜出,Kimi与Gemini惜败

针对手写小说电子化的实际需求,作者横向对比了Gemini、DeepSeek、Kimi、豆包、文心一言等十余款主流大模型及传统OCR工具。结果显示,尽管Gemini等多模态模型备受推崇,但在处理潦草手写体时存在幻觉或准确率不足的问题。传统扫描...

1 分钟阅读116 阅读
前沿哨所

通义实验室开源VimRAG:攻克图文视频混合知识库的RAG难题

针对传统RAG方案难以处理包含图文、视频的混合企业知识库痛点,通义实验室正式开源了VimRAG框架。该框架能够统一处理“文本+图像+视频”三种模态,有效解决跨模态、长上下文(如长时间视频定位)的检索难题。通过结合Qwen2.5-VL-7B-...

1 分钟阅读240 阅读
前沿哨所

DeepSeek疑似被曝将推原生多模态:专家模式或成关键

近期,科技社区有用户基于DeepSeek界面的细微变化推测,该模型可能即将发布原生多模态功能。发帖者指出,鉴于其“快速模式”已展现出OCR图文识别能力,逻辑上推断“专家模式”极有可能集成了更深层的图像理解与交互功能。若此次猜测属实,意味着D...

1 分钟阅读99 阅读
前沿哨所

OCR实测:面对潦草手写文本,Gemini识别准确率显著优于豆包

一项针对多模态大模型OCR能力的对比测试显示,谷歌Gemini在处理极难识别的手写字迹时表现优于字节跳动的豆包。测试素材选用了字迹细小且书写潦草的私人日记文本,尽管对模型识别能力构成巨大挑战,Gemini仍展现出了更强的鲁棒性。测试数据表明...

1 分钟阅读165 阅读