主流AI大模型集体“翻车”:强答未发布的小米16参数,全军覆没
近日,一项针对主流大模型的简单“钓鱼测试”意外揭露了当前AI技术的软肋。测试者向Grok、Kimi、DeepSeek、豆包、智谱以及Gemini等多款顶尖模型询问“小米16搭载什么CPU”。结果显示,即便这些模型大多开启了“思考”或深度推理...
标签索引
这个标签下有 3 篇文章。按时间回看相关判断与实践记录。
标签精选
近日,一项针对主流大模型的简单“钓鱼测试”意外揭露了当前AI技术的软肋。测试者向Grok、Kimi、DeepSeek、豆包、智谱以及Gemini等多款顶尖模型询问“小米16搭载什么CPU”。结果显示,即便这些模型大多开启了“思考”或深度推理...
近日,有社区用户对名为Qclaw的大模型产品进行了代码生成能力测试。结果显示,在安装特定的UI/UX技能插件后,Qclaw仅用两次尝试便完美复刻了腾讯官网的前端界面。这一惊艳表现引发了外界对其技术架构的强烈质疑。观察者推测,鉴于国内大模型在...
本文通过实战测试验证了“重复提示词”对提升大模型准确性的效果。测试对象涵盖DeepSeek、Qwen Plus和Doubao 1.8。结果显示,仅输入一遍时DeepSeek错误率较高,但重复输入两遍后,所有模型准确率均大幅提升。此外,测试还...