社区质疑DeepSeek存在“背题”行为,或导致基准评分虚高
来自科技社区的用户观察指出,DeepSeek模型在应对特定逻辑推理题时,表现出明显的“背题”倾向。该模型似乎倾向于直接从记忆的题库中检索答案,而非进行逐步推理;若记忆答案本身错误,模型便难以自我修正。这种现象引发了关于AI模型评分机制的深层...
标签索引 / 第 91 页
这个标签下有 2415 篇文章。按时间回看相关判断与实践记录。
标签精选
来自科技社区的用户观察指出,DeepSeek模型在应对特定逻辑推理题时,表现出明显的“背题”倾向。该模型似乎倾向于直接从记忆的题库中检索答案,而非进行逐步推理;若记忆答案本身错误,模型便难以自我修正。这种现象引发了关于AI模型评分机制的深层...
针对现有主流模型库(如 models.dev)阅读体验差以及普遍缺失“条件计费”规则的痛点,一位开发者独立构建了全新的 AI 模型数据库信息站。该平台不仅优化了平铺列表的展示形式,提供了按厂商查询、跨供应商模型对比等功能,更核心的是整合了复...
近日,有Reddit用户发现ChatGPT在处理“随机选数”任务时存在明显的偏差。当被要求从1到10000之间随机选择一个数字时,ChatGPT并没有呈现均匀的随机分布,而是频繁选择7200到7500之间的数字。这一发现揭示了大型语言模型(...
本文记录了一位北京中九高校大二学生的真实困惑。作者技术涉猎广泛(全栈、部署、AI工具),且拥有极强的社群组织能力,搭建了700余人的技术交流圈。然而,面对实验室打杂的浅层工作和对学术Idea的质疑,他深感技术深度不足,对未来感到迷茫。他迫切...
卡内基梅隆大学与 Together AI 等机构联合发布了 Mamba-3,这是一种专为“推理效率”优化的新型状态空间模型(SSM)。与侧重训练速度的前代不同,Mamba-3 通过引入更丰富的递归机制、复数值状态跟踪及 MIMO 变体,有效...
本文系统整理了 AI Agent 领域的核心技术栈与高频面试考点。内容涵盖 Agent 的架构定义(如 ReAct、Plan-and-Solve)、大模型规划能力的提升路径(CoT/ToT)、长短时记忆机制的设计,以及多智能体系统协同的优劣...
本文来源于技术社区Linux.do,详细介绍了一种利用开源项目mcp-chrome将Gemini大模型与Chrome浏览器连接的方法。通过Model Context Protocol (MCP) 协议,用户可以赋予AI助手操控浏览器的能力,...
OpenUI 团队在处理 LLM 输出的解析器时发现,Rust 编译为 WASM 的方案反而成为了性能瓶颈。测试表明,JS 与 WASM 之间的数据序列化、内存拷贝以及反序列化等“边界税”开销,远超 Rust 本身的计算优势。团队将解析器完...
OpenCode 是一款全新的开源 AI 编程代理,旨在通过 AI 技术辅助开发者在终端、IDE 或桌面端编写代码。该工具最大的亮点在于其强大的兼容性:支持通过 Models.dev 连接 75 多种 LLM 提供商(包括 Claude、G...
美团正式开源了代号为LongCat-Flash-Prover的大模型。这是一个拥有5600亿参数的旗舰级MoE(混合专家)模型,旨在推进原生形式化推理技术。该模型采用了Agent智能体与工具集成的推理机制,专门针对数学证明语言Lean4进行...