近日,科技社区 Linux.do 发布了截至 2026 年 7 月的最新大语言模型写作能力评测数据。此次更新标志着模型评估基准的一次重要迭代,项目组全面废弃了此前已停止维护的旧测试数据,转而采用更贴合当前模型能力的评测体系,确保了数据的有效性和时效性。新的评测结果重点整合了 EQ-Bench 排行榜(Creative Writing & Long-form Writing)以及 GitHub 上的 `lechmazur/writing` 开源项目测试成绩。
在具体的评测维度上,该基准特别针对 LLM 的创意写作和长篇写作能力进行了深度剖析。其中,GitHub 上的 `lechmazur/writing` 测试标准极具参考价值,它要求模型在创作短篇故事时,必须准确且自然地融入 10 个强制性故事要素,涵盖人物设定、关键物品、核心概念、角色属性以及深层动机等。这种“强制要素整合”的测试方法,有效过滤掉了单纯的语言堆砌,真正考验了模型在复杂指令遵循、长程逻辑连贯性以及创意要素整合方面的硬实力,而非仅仅是流畅度。对于关注 AI 应用落地、提示词工程以及模型选型的开发者与研究者而言,这份榜单提供了极具价值的参考依据,客观展示了当前头部 AI 模型在文学创作领域的真实水平。
事件分析
同时,引入 EQ-Bench(情商基准)强调了“人味”和情感智商的重要性。随着 LLM 从单纯的问答工具向内容创作助手转型,单纯的语言流畅度已不再是核心指标,能否理解人类情感、动机并进行连贯的长篇叙事变得至关重要。废弃旧基准也侧面说明了部分早期针对小模型或简单文本生成的测试已无法满足当前参数量级 SOTA 模型的评估需求,行业正迫切需要更高难度的“图灵测试”标准。
💡 核心观点:写作基准的迭代表明,AI 竞赛焦点已从单纯的文本生成转向指令遵循与复杂逻辑构建的深度融合。
原文链接:Linux.do





