DeepSeek 4分,Gemini 84分:一份AI"智商测试"撕开了中美大模型的真实差距
ARC-AGI-2 是 AI 行业唯一不能靠背答案、不能靠堆算力刷高分的测试。2026 年 2 月更新的排行榜上,中国最强模型 12 分,美国最强 84 分。但故事远没有这么简单——因为 84 分的那位,在 IDE 里写代码反而不如 69 ...
标签索引
这个标签下有 2 篇文章。按时间回看相关判断与实践记录。
标签精选
ARC-AGI-2 是 AI 行业唯一不能靠背答案、不能靠堆算力刷高分的测试。2026 年 2 月更新的排行榜上,中国最强模型 12 分,美国最强 84 分。但故事远没有这么简单——因为 84 分的那位,在 IDE 里写代码反而不如 69 ...
近日,科技社区V2EX分享了一个有趣的大模型(LLM)智商测试链接。该测试通过复杂的逻辑陷阱和推理题,直观展示了Claude、GPT等主流AI模型的真实“智力”水平,而非仅限于知识检索。这种互动式评测不仅趣味十足,更是一面镜子,反映出当前A...