近日,在技术社区Linux.do上发布的一项针对人工智能模型的“智商测试”引发了广泛关注。该测试以一道包含伪十六进制数据和隐晦线索的CTF风格谜题为题,要求模型根据便签上的提示“If you understand the wire, you understand the man”以及关于“Magic”和“Key”的描述,层层剥开数据,最终生成一个演示用的Bitcoin压缩WIF私钥。该挑战不仅考察模型的数据处理能力,更检验其在面对多层逻辑嵌套和特定领域知识(如加密货币密钥格式)时的推理深度。
测试结果显示,当前主流大模型在面对此类复杂逻辑链时表现出了显著的性能差异。据发帖人反馈,只有“opus 4.8”能够成功解出谜题;而备受瞩目的GPT系列和Grok表现不佳,其中Grok更是给出了完全错误的结果。国产模型方面,DeepSeek在正式版发布前直接“卡死”,Kimi K3也同样遭遇了运行停滞的问题,其余模型尚待测试。这一现象表明,尽管大模型在自然语言对话上已趋于成熟,但在涉及具体逻辑推理、进制转换及密码学知识综合调用的复杂任务中,各模型仍存在明显的“短板”或稳定性问题。此外,鉴于谜题涉及私钥生成,社区也特别声明这仅为CTF学习演示,严禁用于真实资产交易。
事件分析
DeepSeek和Kimi出现的“卡死”现象,值得深思。这通常意味着模型陷入了某种思维循环,或者是因为推理链过长导致上下文窗口资源耗尽,这反映了部分模型在长思维链规划和自我纠错机制上仍需优化。相比之下,Opus的成功以及Grok的离谱错误,揭示了不同架构模型在精确模式匹配和事实性约束上的巨大差异。对于AI Agent或AI编程应用而言,这种能够处理非结构化数据并执行严谨逻辑任务的能力,正是目前技术落地的关键分水岭。
💡 核心观点:现有大模型在处理深层逻辑推理与长链条任务时存在显著的“能力断层”,模型不仅要会“说话”,更要学会像侦探一样在复杂信息中保持逻辑闭环。
原文链接:Linux.do





