跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

模型测试

这个标签下有 7 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

LLM模型认知误区:为何AI将Gemini 3.1 Pro误判为1.5 Pro?

论坛上有用户发现,当询问尚未正式发布或数据集尚未覆盖的“Gemini 3.1 Pro”时,多个主流LLM模型均将其误认为“Gemini 1.5 Pro”。分析认为,这是因为模型在训练阶段接触了大量关于1.5 Pro的数据,导致其在向量空间中...

1 分钟阅读122 阅读
前沿哨所

金鱼AI模型上线Artificial Analysis测试平台

Artificial Analysis的Image Arena平台提供了一个创新环境,让用户通过选择偏好图像来评估AI文本到图像模型,无需了解模型提供商。目前,新图像模型“金鱼”正在该平台进行测试。测试中使用了提示“设计一个关于日常运动益处...

1 分钟阅读281 阅读
前沿哨所

AI模型Opus-4.5实测:每5小时处理75条数据

本文报告了AI模型Opus-4.5的性能测试结果,在每5小时的运行中成功处理了75条数据,剩余分数分别为0.9866667和0.97333336。话题包含19个帖子,由16位参与者深入讨论,提供了模型效率、资源使用和稳定性的技术分析。测试数...

1 分钟阅读256 阅读