近日,一项关于多模态大模型在视觉理解领域的对比测试引发了开发者社区的关注。一位科技爱好者在处理漫画图片分镜提取任务时,发现谷歌的Gemini模型展现出了惊人的性能,甚至达到了“降维打击”的效果。该任务的核心挑战在于识别并绘制出漫画中形态各异、极不规则的分镜边框。据该开发者介绍,在一至两年前,此类高难度任务通常需要耗费数月时间去专门调优OpenCV等传统计算机视觉算法,且效果往往不尽如人意。然而,在使用Gemini 1.5 Flash(注:原文称3.7 flash,推测为实验版本或笔误)进行“单次尝试(One Shot)”时,仅凭一个简单的提示词“用红色边界给漫画图片的分镜绘制边框,注意分镜很多是不规则的图形”,模型便精准地识别出了所有不规则分镜并完美绘制了边界。为了横向对比,该开发者同步测试了近期大火的Qwen(通义千问)3.8版本模型,结果显示虽然Qwen具备视觉能力,但在处理此类复杂的非规则图形边界时,其识别精度和逻辑能力仍明显逊色于Gemini一个档次。此外,当尝试使用ChatGPT进行相同操作时,模型并未给出处理结果,而是直接触发了风控机制,提示“生成的图片可能违反内容策略”并报错。这一实测案例不仅直观地展示了当前多模态大模型在视觉推理能力上的梯队差异,也引发了关于AI模型在图像处理应用中“所见即所得”时代的讨论。
事件分析
此次测试揭示了多模态大模型在特定垂直领域替代传统CV算法的巨大潜力。从技术维度看,Gemini能够精准识别漫画中的非规则分镜,说明其具备了极强的空间关系理解能力和抗噪能力,能够区分画面内容与画面布局,这是单纯的目标检测模型难以实现的。相比之下,Qwen虽然在中文语境下表现优异,但在复杂的几何形状推理和精细视觉指令遵循上,与谷歌的一线模型仍存在代差。另一方面,ChatGPT的“翻车”折射出主流模型在安全策略(Safety Alignment)上的矫枉过正,将正常的图片处理任务误判为违规内容,这种“过度防御”在限制了模型应用边界的同时,也恰恰给了竞争对手弯道超车的机会。未来,视觉大模型的竞争焦点将不仅仅是看谁“看得见”,更在于谁能精准理解复杂空间逻辑且拥有更开放的生成策略。
核心观点:多模态大模型正在通过提示词工程将传统CV算法的数月工作量压缩为“秒级”,Gemini在复杂图形理解上的领先优势证明了谷歌在视觉感知领域的深厚积累。
原文链接:Linux.do