跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

AI评测

这个标签下有 27 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

被低估的小米大模型?实测MiMi:中文语义精准且响应极快

近日,科技社区有用户分享了小米自研大模型MiMi的深度体验。实测表明,MiMi模型在中文语义理解、响应速度及上下文保持方面表现优异,且免费额度充足。该模型不仅适用于日常问答、写作润色和翻译摘要,在代码简单调试方面也表现出色,被视为国产大模型...

1 分钟阅读128 阅读
前沿哨所

AI推理实测:Claude优雅攻克Grok未能解决的“双星”物理极难谜题

科技社区近日曝光了一道被称为“守望者双星”的AI极限测试题,该题目融合了广义相对论、脉冲星轨道动力学以及包含黄金分割比的复杂非线性微分方程,旨在挑战大模型的长链条推理能力。据反馈,此前专门用于测试Grok的这道难题并未获得完美解答。然而最新...

1 分钟阅读136 阅读
思考杂谈

为什么大多数 AI 评测天生在奖励遗忘

过去两年,AI 圈最荒唐的事之一,不是模型会胡说八道,而是我们一边用“单题过关”的方式评测系统,一边又装出惊讶:为什么这些系统不会真正变好。我的判断是,大多数所谓 Agent benchmark,从设计上就不是在衡量成长,而是在惩罚成长;不...

9 分钟阅读103 阅读