Linux.do论坛一位用户发布了一项大模型横向对比实测,通过统一的SVG重绘任务测试Gemini 4与Claude Opus 5.5的图形生成能力。测试提示词要求模型将一张参考图转换为SVG格式,元素数量须控制在1500至1700个之间,精细度越高越好,并要求模型给出完整的绘制过程录像或动画,展示图形从无到有的全过程。该提示词特别强调模拟人类绘画的工作流程:先画草稿确定大形和比例,再铺大色块建立明暗关系,随后逐步细化结构、光影与细节,最后检查整体并调整收尾。绘制方式上,要求模型根据当前画面分批决定下一步内容,允许在绘制过程中修改比例、轮廓与连接关系,观察与修正贯穿始终而非事后统一调整。楼主展示了Gemini 4在不同Agent设置下生成的两版图形,并与Opus 5.5的结果进行对比,同时邀请社区成员用各自的模型复现该测试。帖子发布后引发论坛讨论,已有用户参与交流并分享各自的测试结果。此类社区自发的横向评测,为观察新一代模型在复杂指令遵循、空间推理与代码生成等方面的实际表现提供了直观参考。
事件分析
SVG精细重绘正成为社区评测多模态与代码模型的热门方式,它同时考察指令遵循、空间结构理解、审美判断与长流程Agent规划能力,比单点问答更能暴露模型短板。该测试强制模拟人类绘画的分阶段流程,实质是将Agent的多步规划与自我修正能力作为评测核心,与当前Agentic工作流的发展方向一致。图形生成类任务对模型的坐标计算、层级组织和细节控制要求极高,任何环节失衡都会导致画面崩坏,因此具备一定区分度。不过该测试样本单一、评价主观、缺乏量化指标,结论仅供参考,难以替代标准化基准。后续可关注各家模型在图形生成与Agent长程任务上的迭代表现,以及社区评测能否沉淀为更系统的公开基准。
核心观点:SVG重绘已成为检验大模型综合能力的新标尺,代码精度、审美素养与Agent长程规划缺一不可。
原文链接:Linux.do