科技社区 Linux.do 的开发者对通义千问最新模型 Qwen3.8 进行了实测,重点评估了其在 Qwen Studio 环境下的代码生成与逻辑推理能力。测试任务旨在生成一段尽可能逼真的“迎风飘扬的国旗”代码(涉及 SVG 与 Three.js 技术)。测试结果显示,该模型在执行该任务时表现远逊于竞品 Kimi,且未能达到传闻中接近 GPT-4(文中戏称“肥波 5”)的水平。
在测试过程中,Qwen3.8 触发了异常的“长思考”模式。虽然开发工具已成功输出 tool_call,但模型陷入了漫长的推理循环。检查后台日志发现,模型竟生成了高达 372 个思考节点(思考段落),这种过载的思考链路最终未能生成有效的代码,导致 HTML 输出为空。开发者随后进行了手动干预,模型才在少量的思考节点下成功生成旗帜代码。
此外,社区反馈指出 Qwen3.8 近期的更新极为频繁。有用户提到,该模型的思考机制已从“3 条简述”升级为类似 DeepSeek R1 的“雷霆思考”模式,思考片段激增至百条以上。虽然这种深度思考模式在某些测试中展现出实力,但本次“372 节点空转”事件暴露了模型在复杂任务下的资源管理缺陷和推理链路不稳定性。
事件分析
💡 核心观点:深度推理不应是简单的算力堆砌,372 个无效思考节点警示行业:若缺乏高质量的核心逻辑引导,大模型的“长思考”反而会成为效率的黑洞。
原文链接:Linux.do





