跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

AI基准测试

这个标签下有 13 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

ARC-AGI-3首日战报:引入Agent框架将得分从0%飙升至36%

在ARC-AGI-3基准测试发布的首日,一项技术演示引发了热议:通过利用特定的Agent“Harness”(连接框架/工具套件),开发者成功将系统得分从0%提升至36%。尽管该成绩因使用了辅助工具而不具备官方“裸模型”排行榜的入围资格,但H...

1 分钟阅读115 阅读
前沿哨所

深度解析:机器学习基准测试的新兴科学

这本书深入剖析了机器学习领域最核心却又常被误解的环节——基准测试。作为现代AI的基石,基准测试通过将数据划分为训练集与测试集,确立了模型竞争的规则。然而,研究界长期对基准的局限性持批评态度。本书旨在从科学视角重新审视这一机制,探讨如何在推动...

1 分钟阅读106 阅读
前沿哨所

硬核指南:利用“Juice值”与知识盲区精准评估大模型推理能力

本文分享了超越官方基准测试的两种大模型实测方法。一是“Juice值”测试法,通过特定提示词获取模型数值,对比标准参考表判断其推理深度是否达标;二是“知识截止日期”探测法,通过询问截止时间点附近的重大突发新闻,区分模型是基于训练数据回答还是凭...

1 分钟阅读156 阅读