图灵测试新变种?网友实测Gemini解答数学IQ题,探究大模型逻辑推理边界
近日,科技社区Linux.do上一篇关于测试大模型数学能力的帖子引发关注。一位网友分享了使用Google Gemini完成数学IQ测试的经历,并将其结果与ChatGPT进行了对比。该用户指出,Gemini在解题过程中的思考路径颇具趣味,引发...
标签索引 / 第 75 页
这个标签下有 1711 篇文章。按时间回看相关判断与实践记录。
标签精选
近日,科技社区Linux.do上一篇关于测试大模型数学能力的帖子引发关注。一位网友分享了使用Google Gemini完成数学IQ测试的经历,并将其结果与ChatGPT进行了对比。该用户指出,Gemini在解题过程中的思考路径颇具趣味,引发...
Google Gemini 模型近日出现严重技术故障,在生成回复时陷入推理逻辑的无限死循环。更令人意外的是,本应对用户隐藏的内部“思维链”被完整输出,暴露了模型底层的推理机制和系统指令。这一事故不仅反映了当前大模型在长上下文处理和停止条件判...
Anthropic 发布《AI 流利度指数》报告,通过分析 9830 次 Claude 对话,量化了用户的 AI 协作能力。报告发现,85.7% 的用户会迭代优化 AI 回复,这通常意味着更高的协作技巧。然而存在一个悖论:当 AI 生成代码...
嗅觉一直是机器最难理解的感官,但AI正在改变这一现状。文章详细介绍了Google Brain及初创公司Osmo如何利用图神经网络(GNN)构建“主嗅觉图”(POM),成功将分子结构转化为可计算的气味感知。这项技术不仅能创造全新的香氛分子,减...
GitHub上一个名为“attesor”的项目展示了AI在底层系统研究中的惊人能力。该项目旨在全面逆向工程 Apple 的 Rosetta 2 二进制翻译技术,通过结合人工分析与 AI 辅助生成,成功重构了核心翻译逻辑。目前项目已识别并命名...
美国特朗普政府推出的膳食指南网站接入了xAI的Grok聊天机器人,旨在推广高蛋白饮食。然而经媒体实测,该AI严重“翻车”,不仅被诱导出黄瓜、胡萝卜等蔬菜的“直肠使用”荒谬建议,其给出的蛋白质摄入建议也与政府宣传的“高肉食”理念相悖。白宫官员...
最新研究显示,OpenAI、Google、Anthropic及xAI的顶级大语言模型(LLM)能够被诱导生成《哈利·波特》、《权力的游戏》等畅销小说的逐字文本。斯坦福与耶鲁的研究表明,即便设有防护栏,通过特定提示或越狱手段,仍可从Gemin...
受美国H-1B签证政策收紧、费用暴涨及拒签率上升的影响,Google、Amazon、Microsoft等科技巨头正加速向印度转移高阶研发岗位。数据显示,这些企业在印度的职位空缺已超4200个,且近半数集中在AI、机器学习及云计算等前沿领域,...
一位开发者在尝试使用 Gemini CLI 时遭遇了令人哭笑不得的尴尬局面。由于该工具不支持中文界面,用户用中文下达指令,结果 Gemini 2.5 Pro 严重误解了用户意图,竟生成了一份文档教用户如何在终端输入“/help”指令。此外,...
近日,科技社区Linux.do的一则讨论引发关注,帖文中展示了当前AI生成内容(AIGC)在逼真度上的惊人表现。通过对比演示视频,可以发现AI生成的图像和视频已达到肉眼难以分辨真伪的水平。作者预测,随着该技术的快速普及和门槛降低,以抖音为代...