Grok 4.20 Beta 登顶?新基准测试显示其幻觉率创历史新低
据科技分析平台 Artificial Analysis 报道,xAI 最新发布的 Grok 4.20 Beta 版本在性能上实现了三大关键突破。最引人注目的是,在名为“AA-Omniscience”的评估测试中,该模型展现出了迄今为止业界最...
标签索引
这个标签下有 3 篇文章。按时间回看相关判断与实践记录。
标签精选
据科技分析平台 Artificial Analysis 报道,xAI 最新发布的 Grok 4.20 Beta 版本在性能上实现了三大关键突破。最引人注目的是,在名为“AA-Omniscience”的评估测试中,该模型展现出了迄今为止业界最...
据社区消息及第三方分析平台数据,智谱AI旗下的GLM模型迎来重大升级。最新数据显示,GLM-5的幻觉率从此前版本的90%大幅降低至34%。这一惊人的降幅表明,该模型在事实准确性和逻辑稳定性方面取得了质的飞跃,有效缓解了大模型常见的“一本正经...
百川智能推出新一代医疗强化大模型 Baichuan-M3。不同于传统模型,它专注于临床决策过程的显式建模,通过 Fact-Aware 强化学习显著降低幻觉率。在 HealthBench、SCAN-bench 等多项权威评测中,Baichua...