跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

模型评测

这个标签下有 28 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

AI 大模型

Opus 4.8 把"诚实"当成了卖点

Anthropic 今天发布了 Claude Opus 4.8。价格没变,跑分照常往上走,这本来是一次很常规的小版本升级。但发布稿里花了不小的篇幅讲一件事:这个模型更”诚实”了。 诚实度被拿出来当主打,这是个值得留意...

5 分钟阅读270 阅读
前沿哨所

Hacker News热议盘点:当前最受开发者欢迎的AI编程模型

一位开发者为了弥补因休假两周而错过的技术动态,选择通过编写脚本自动化分析 Hacker News (HN) 的评论数据,而非手动翻阅海量讨论。该项目旨在快速提取并汇总 HN 社区当下最受推崇的 AI 编程模型。作者不仅构建了可视化数据面板,...

1 分钟阅读95 阅读
前沿哨所

告别“应试教育”:为何针对测试集优化的模型往往高分低能?

一位开发者在社区分享了AI训练中的典型误区:将数据分为训练集和测试集后,盲目要求模型最大化测试集分数。这种做法导致模型在特定数据上“作弊”或严重过拟合,虽然评测分数极高,但在实际应用中泛化能力极差。这一经历深刻揭示了机器学习中“唯指标论”的...

1 分钟阅读59 阅读
前沿哨所

Claude Opus 4.7 实测翻车?连基础逻辑“糖果题”都解不开

近期,关于 Claude Opus 4.7 的性能在社区引发热议。有科技爱好者通过第三方渠道对该模型进行了实测,结果显示,即便是在面对经典的“糖果问题”等基础逻辑推理题时,该模型依然给出了错误答案。这一表现引发了用户对新模型能力的强烈质疑,...

1 分钟阅读518 阅读