长上下文是伪命题?实测Grok通过“大海捞针”却无法理解百万字小说逻辑
一位开发者针对Grok-4.20和4.30进行了长上下文能力的实战测试,结果引人深思。测试分为两部分:首先使用约150万token的机器生成文本进行“大海捞针”测试,模型表现完美,准确回答了所有问题;然而,当上传一部约89万token的百万...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
一位开发者针对Grok-4.20和4.30进行了长上下文能力的实战测试,结果引人深思。测试分为两部分:首先使用约150万token的机器生成文本进行“大海捞针”测试,模型表现完美,准确回答了所有问题;然而,当上传一部约89万token的百万...