大模型多模态实测:DeepSeek在象棋OCR识别中“翻车”,Gemini完胜
一项针对中国象棋场景的OCR对比测试显示,多模态大模型在特定领域的表现参差不齐。测试要求模型识别棋盘截图并转换为标准UCCI/FEN格式。结果显示,Google Gemini是唯一完全正确的模型;GPT系列出现了部分颜色识别错误;而近期备受...
一项针对中国象棋场景的OCR对比测试显示,多模态大模型在特定领域的表现参差不齐。测试要求模型识别棋盘截图并转换为标准UCCI/FEN格式。结果显示,Google Gemini是唯一完全正确的模型;GPT系列出现了部分颜色识别错误;而近期备受...
一位AI开发者分享了模型迁移的实战经验:由于此前使用的Google Antigravity账号被封,不得不转测国产大模型。经测试,智谱GLM在工作流中表现不佳,无法稳定调用工具,而DeepSeek V4 Pro和Mimo 2.5与业务逻辑高...

ECS / OSS / CDN / 云数据库一站采购,常用云资源集中选配;新用户与续费均有专场优惠,适合个人开发者与小团队长期使用。
科技社区近期热议 DeepSeek (DS) 的表现,有开发者发帖称其实际体验已媲美 Claude Opus 4.6/4.7。用户指出,DeepSeek 在逆向工程等复杂任务中表现出色,推理能力极强且指令遵循度高,甚至在“道德限制”方面比国...
本文基于社区实测与官方数据,深入分析了 DeepSeek V4 Pro 在六大类内容创作中的表现。实测表明,其中文本土化能力极强,在结构化报告和文档撰写上已比肩 Claude,且拥有显著的价格优势。官方测评数据显示,DeepSeek 在办公...
针对顶级产品播客 Lenny’s Podcast 存在的语言障碍和检索低效问题,开发者利用 DeepSeek API 构建了一站式解决方案。该项目不仅完成了 303 期节目的逐句中英对照翻译,还利用 AI 自动生成摘要、思维导图...
有社区用户测试发现,向DeepSeek提问经典逻辑题“如何用一刀把三个橘子分给四个小朋友”时,触发了安全拒绝机制。然而,将“橘子”换成英文“orange”后,模型却生成了包含暴力内容的回答。这一现象不仅展示了大模型在逻辑处理上的局限性,更暴...
近日,有开发者在科技社区反馈,在使用集成 DeepSeek 最新 API(提及 thinking max 模式)的 OpenCode 工具时体验不佳。该用户尝试生成一个 3D 魔方前端页面,模型历经 5 轮对话才勉强实现基础功能。在进行第 ...
文章深度剖析了OpenAI与DeepSeek截然不同的商业逻辑。OpenAI倾向于“按价值定价”,Sam Altman认为未来的AI代理将不再按Token计费,而是按任务完成度收费,旨在参与客户创造的价值分配,甚至推出月费2000美元的高端...
针对国产大模型在真实开发场景下的表现,一位开发者在中型项目中选取了DeepSeek V4 Pro、GLM 5.1、MiMO-2.5Pro及DeepSeek V4 Flash四款API进行代码审查对比。通过使用相同的提示词并经由GPT 5.5...
继DeepSeek V4发布后,有用户发现其火速上线了多模态功能。然而,实测结果显示DeepSeek在视觉理解方面存在明显短板,特别是在手写文字OCR识别上,错误率高达90%,表现远逊于豆包(30%)和Llama 3.1(10%)。此外,测...