Gemini 3.0 Pro vs OpenAI 5.2:历史地图查询测试暴露性能差距
近日,一位用户在Linux.do社区分享了针对AI模型的实际测试:查询1964年以前中国地图信息时,Gemini 3.0 Pro提供了错误链接,而OpenAI 5.2 Thinking则准确找到答案。这一比较突显了AI模型在历史信息检索任务...
标签索引
这个标签下有 3 篇文章。按时间回看相关判断与实践记录。
标签精选
近日,一位用户在Linux.do社区分享了针对AI模型的实际测试:查询1964年以前中国地图信息时,Gemini 3.0 Pro提供了错误链接,而OpenAI 5.2 Thinking则准确找到答案。这一比较突显了AI模型在历史信息检索任务...
本文聚焦于kilo code平台上的四个免费AI模型:xAI的Grok Code Fast 1、MiniMax M2、Mistral的Devstral 2以及Kwaipilot的KAT-Coder-Pro V1。作者通过artifical分...
本文作者为了凑单购物,设计了一道数学题测试各大AI模型的能力。题目要求使用指定数字(99,39,59等)加起来之和最接近599但要大于599,且必须包含99,数字可重复。测试对象包括Gemini、ChatGPT、Claude、DeepSee...