跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

模型评估

这个标签下有 3 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

声称媲美顶尖模型?如何科学评估公司自研大模型的成色

随着大模型遍地开花,不少公司内部开始训练“自研模型”,且往往伴随着性能“媲美Opus”的激进宣传。本文源于开发者社区的真实困惑,探讨当内部模型宣称具备顶尖能力时,应当如何进行科学的“验收”与测试。讨论涉及如何通过标准Benchmark(如M...

1 分钟阅读104 阅读
前沿哨所

拒绝模型性能焦虑,AI应用“好用”比“聪明”更重要

虽然像Opus 4.6这样的顶尖模型在处理复杂编程任务时效率极高,但大多数用户在非编程或日常场景下并不需要极致的性能。文章指出,衡量AI工具的价值不应仅依赖Benchmark跑分,更应关注用户体验和“外设”生态。以豆包和DeepSeek为例...

1 分钟阅读104 阅读