前沿AI大模型集体“翻车”:竟连麻将牌都认不全
近日,科技社区针对主流多模态大模型进行了一场别开生面的“麻将识别测试”。测试结果显示,包括豆包、通义千问(Qwen 3.5-VL)以及Gemini在内的顶尖AI模型,在面对基础的麻将牌面识别任务时表现惨淡,频频出现识别错误或“一本正经胡说八...
标签索引 / 第 76 页
这个标签下有 1711 篇文章。按时间回看相关判断与实践记录。
标签精选
近日,科技社区针对主流多模态大模型进行了一场别开生面的“麻将识别测试”。测试结果显示,包括豆包、通义千问(Qwen 3.5-VL)以及Gemini在内的顶尖AI模型,在面对基础的麻将牌面识别任务时表现惨淡,频频出现识别错误或“一本正经胡说八...
Anthropic 最新研究揭示了 AI Agent 的落地现状:软件工程以 49.7% 的使用率断层领先,成为 AI 智能体的最主要应用场景。反观医疗、法律等 16 个高价值垂直领域,渗透率均低于 5%,处于极早期阶段。数据显示,随着用户...
近日,有开发者在技术社区反馈Claude最新版本疑似出现严重的Token计费Bug。多名用户发现,其账户的Token消耗速度异常,原本20美元的额度在5小时内被耗尽,周消耗量莫名激增11%,部分案例显示消耗速度甚至达到正常的4倍以上。该问题...
针对科技爱好者面临的信息过载与低质量内容泛滥问题,开发者构建了开源项目“Horizon”。该工具能够整合 RSS、HackerNews、Reddit 及 GitHub 等多渠道数据,利用 AI 对抓取的内容进行质量筛选与精准总结。其独特之处...
本文探讨了AGI实现的关键,认为其不仅仅取决于基座模型的参数量,更在于能否形成一个“泛化的完美闭环”。该闭环系统要求AI具备自主生成数据、探索物理世界、自我评估并迭代出更强版本的能力。文章强调,为避免纯AI生成数据导致的“模型坍塌”,系统必...
近日,有技术社区用户分享了与Gemini 3.1模型的交互体验。在操作过程中,模型意外出现了“删错东西”的失误,导致此前工作看似白费,但随即依靠强大的上下文记忆能力完成了自我纠错和数据恢复。此外,用户发现该模型的行为模式发生了显著变化,打破...
当前数字基础设施默认终端操作者为人类,但具备自主交易能力的 AI Agent 正在打破这一信任基石,导致身份验证与法律问责失效。针对此挑战,该文提出了名为“人类信任根源”的公共领域框架。该架构通过人性证明、硬件绑定设备身份及行为认证三大支柱...
近日,有科技社区网友在测试热门的AI生图提示词(将文章转为卡通信息图)时发现,使用Google Gemini生成的图片中,本应是文字的部分变成了无法识别的“西夏文”或乱码符号。尽管提示词逻辑清晰,但AI模型在处理图像中的具体文字语义时仍存在...
本开源项目深入剖析了 Palantir 区别于传统科技巨头的核心战略——“本体论”。它不是单纯的技术,而是将现实业务映射为“数字孪生”的运营基础。与仅用于查看的静态数据湖不同,本体论通过将业务对象(名)与动作(动)统一建模,让数据直接驱动现...
Hacker News近期热议的一篇论文为当前过热的AI行业泼了一盆冷水。论文指出,大语言模型(LLM)在道德推理、幼儿级简单计数等人类认为具备智能的维度上存在显著缺陷。评论认为,这些失败源于LLM作为“下一个token预测器”的本质,它们...