跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

AI测评

这个标签下有 24 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

大模型“刷榜”乱象丛生:如何寻找真正公正的AI测评平台?

随着大模型技术的爆发式发展,各大厂商竞相角逐排行榜,导致“跑分注水”、针对题库特训甚至商业定制冠军等乱象频发。这种为了刷榜而优化的行为,使得榜单难以反映模型的真实能力,不仅误导用户,也无益于技术进步。当前,行业迫切需要寻找公认、公正且无商业...

1 分钟阅读148 阅读
前沿哨所

多模态大模型“团战”失败?手写菜单识别竟成顶级AI的软肋

一则来自技术社区的帖子引发了广泛关注,该测试揭示了主流多模态大模型在特定场景下的实际短板。测试要求模型从包含复杂手写数字和勾选标记的菜单图片中,精准提取菜品名与数量,并强制输出为无Markdown干扰的YAML格式。结果显示,包括GLM-5...

1 分钟阅读80 阅读
前沿哨所

OCR实测:面对潦草手写文本,Gemini识别准确率显著优于豆包

一项针对多模态大模型OCR能力的对比测试显示,谷歌Gemini在处理极难识别的手写字迹时表现优于字节跳动的豆包。测试素材选用了字迹细小且书写潦草的私人日记文本,尽管对模型识别能力构成巨大挑战,Gemini仍展现出了更强的鲁棒性。测试数据表明...

1 分钟阅读165 阅读
前沿哨所

Claude App被指降智?开启思考模式仍难解经典“水果题”

近日,有科技社区用户反馈,在Claude官方App客户端中使用Opus模型测试经典的“水果题”(测试字符计数逻辑)时,即便开启了“思考开关”,模型仍反复给出错误答案(如29),而此前在网页版或其他环境下该模型能正确输出(如21)。用户质疑官...

1 分钟阅读237 阅读
前沿哨所

豆包登顶SuperCLUE国产第一,跻身全球榜单前四强

权威中文大模型测评基准SuperCLUE更新了榜单,字节跳动旗下的豆包大模型表现惊艳,成功获评国产第一,并在全球总榜中位列第四。SuperCLUE作为独立的综合性测评基准,涵盖了通用、文本、多模态、推理、Agent及AI应用等关键领域。此次...

1 分钟阅读641 阅读