DuckBenchmark 横空出世:纯视觉识别难倒众 AI,仅旧版 Gemini 幸存
近日,科技社区 Linux.do 发起了一项名为“DuckBenchmark”的纯视觉挑战,要求 AI 识别一只较为罕见的绿色返祖珂尔鸭。测试结果显示,绝大多数主流大模型(包括升级后的 Gemini 新版)纷纷“阵亡”,普遍将其误判为常见的...
标签索引
这个标签下有 2 篇文章。按时间回看相关判断与实践记录。
标签精选
近日,科技社区 Linux.do 发起了一项名为“DuckBenchmark”的纯视觉挑战,要求 AI 识别一只较为罕见的绿色返祖珂尔鸭。测试结果显示,绝大多数主流大模型(包括升级后的 Gemini 新版)纷纷“阵亡”,普遍将其误判为常见的...
近日,科技社区针对主流多模态大模型进行了一场别开生面的“麻将识别测试”。测试结果显示,包括豆包、通义千问(Qwen 3.5-VL)以及Gemini在内的顶尖AI模型,在面对基础的麻将牌面识别任务时表现惨淡,频频出现识别错误或“一本正经胡说八...