跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 2 页

基准测试

这个标签下有 32 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

京东云发布CodingPlan测试报告,实测AI编程性能基准

Linux.do社区曝光了一份关于京东云CodingPlan的测试报告。该报告通过详尽的基准测试,深入分析了京东云在AI编程领域的最新技术进展,重点考察了其模型在代码生成、逻辑推理及工程辅助等方面的实际表现。作为国产科技巨头在垂直领域的积极...

1 分钟阅读317 阅读
前沿哨所

知名 Web 框架性能“试金石” TechEmpower 宣布停止维护

TechEmpower 公司宣布将不再维护其业界公认的 Web 框架性能基准测试项目。该项目长期覆盖 Python、Go、Rust 等主流编程语言与框架,长期以来是开发者评估技术栈性能上限的重要参考。尽管没有任何基准能完美代表实际场景,但其...

1 分钟阅读296 阅读
前沿哨所

社区质疑DeepSeek存在“背题”行为,或导致基准评分虚高

来自科技社区的用户观察指出,DeepSeek模型在应对特定逻辑推理题时,表现出明显的“背题”倾向。该模型似乎倾向于直接从记忆的题库中检索答案,而非进行逐步推理;若记忆答案本身错误,模型便难以自我修正。这种现象引发了关于AI模型评分机制的深层...

1 分钟阅读157 阅读