揭秘 AI 模型的“暗中削弱”:一张图看懂大模型性能退化史
随着大模型频繁更新,用户常怀疑模型变“笨”或受到更多限制。该项目通过可视化图表记录了各大 AI 模型的 ELO 评分历史,旨在揭露潜在的“暗中削弱”现象。文章指出,模型更新可能引入过度审查、过度量化以节省算力或行为退化。此外,项目还区分了 ...
标签索引
这个标签下有 2 篇文章。按时间回看相关判断与实践记录。
标签精选
随着大模型频繁更新,用户常怀疑模型变“笨”或受到更多限制。该项目通过可视化图表记录了各大 AI 模型的 ELO 评分历史,旨在揭露潜在的“暗中削弱”现象。文章指出,模型更新可能引入过度审查、过度量化以节省算力或行为退化。此外,项目还区分了 ...
近期,知名大模型竞技场(LMSYS Arena)接连下架了Claude 3 Opus及GPT-4.5(原文提及5.4)等顶尖模型,引发社区对LLM评测体系的广泛质疑。随着行业技术路线从单纯的“问答式AI”加速转向具备自主规划能力的“Agen...