大模型写作能力榜单更新:GitHub最新基准与EQ-Bench排名

近日,科技社区 Linux.do 发布了截至 2026 年 7 月的最新大语言模型写作能力评测数据。此次更新标志着模型评估基准的一次重要迭代,项目组全面废弃了此前已停止维护的旧测试数据,转而采用更贴合当前模型能力的评测体系,确保了数据的有效性和时效性。新的评测结果重点整合了 EQ-Bench 排行榜(Creative Writing & Long-form Writing)以及 GitHub 上的 `lechmazur/writing` 开源项目测试成绩。

在具体的评测维度上,该基准特别针对 LLM 的创意写作和长篇写作能力进行了深度剖析。其中,GitHub 上的 `lechmazur/writing` 测试标准极具参考价值,它要求模型在创作短篇故事时,必须准确且自然地融入 10 个强制性故事要素,涵盖人物设定、关键物品、核心概念、角色属性以及深层动机等。这种“强制要素整合”的测试方法,有效过滤掉了单纯的语言堆砌,真正考验了模型在复杂指令遵循、长程逻辑连贯性以及创意要素整合方面的硬实力,而非仅仅是流畅度。对于关注 AI 应用落地、提示词工程以及模型选型的开发者与研究者而言,这份榜单提供了极具价值的参考依据,客观展示了当前头部 AI 模型在文学创作领域的真实水平。

事件分析

此次评测基准的更新反映了行业对 LLM 能力评估的精细化趋势。不同于传统的数学或代码基准,写作能力(尤其是创意写作)更难量化。GitHub 项目 `lechmazur/writing` 提出的“10 个要素整合”测试法,本质上是在测试模型的“指令遵循”与“上下文关联”能力的上限。如果一个模型能在一篇短故事中完美嵌入 10 个特定的、甚至可能是相互制约的要素,说明它具备极强的逻辑编织和长程记忆能力,而非简单的概率预测。

同时,引入 EQ-Bench(情商基准)强调了“人味”和情感智商的重要性。随着 LLM 从单纯的问答工具向内容创作助手转型,单纯的语言流畅度已不再是核心指标,能否理解人类情感、动机并进行连贯的长篇叙事变得至关重要。废弃旧基准也侧面说明了部分早期针对小模型或简单文本生成的测试已无法满足当前参数量级 SOTA 模型的评估需求,行业正迫切需要更高难度的“图灵测试”标准。

💡 核心观点:写作基准的迭代表明,AI 竞赛焦点已从单纯的文本生成转向指令遵循与复杂逻辑构建的深度融合。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册