当AI去考“命理师执照”:大模型在复杂逻辑推理上的盲区与突破
研究人员利用全球命理师大赛的真题构建了 AI Benchmark,发现 DeepSeek、Gemini 等顶尖大模型在八字推理任务上准确率约 36%,显著高于随机猜测,但仍落后于人类专家。研究指出,八字推演涉及复杂的结构化逻辑,容易导致大模...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
研究人员利用全球命理师大赛的真题构建了 AI Benchmark,发现 DeepSeek、Gemini 等顶尖大模型在八字推理任务上准确率约 36%,显著高于随机猜测,但仍落后于人类专家。研究指出,八字推演涉及复杂的结构化逻辑,容易导致大模...