性能突增但推理变慢:Claude Mythos疑采用字节跳动提出的循环架构
Anthropic 拒绝公开 Claude Mythos 模型架构,但其一项测试成绩引发了社区广泛猜测。在 GraphWalks BFS 基准测试中,Mythos 得分高达 80.0%,碾压 GPT-5.4 的 21.4%。Meta 工程师...
标签索引
这个标签下有 3 篇文章。按时间回看相关判断与实践记录。
标签精选
Anthropic 拒绝公开 Claude Mythos 模型架构,但其一项测试成绩引发了社区广泛猜测。在 GraphWalks BFS 基准测试中,Mythos 得分高达 80.0%,碾压 GPT-5.4 的 21.4%。Meta 工程师...
卡内基梅隆大学与 Together AI 等机构联合发布了 Mamba-3,这是一种专为“推理效率”优化的新型状态空间模型(SSM)。与侧重训练速度的前代不同,Mamba-3 通过引入更丰富的递归机制、复数值状态跟踪及 MIMO 变体,有效...
本文系统拆解大模型选型的核心技术参数,涵盖模型系列、架构类型、参数规模、后训练方式、量化精度和上下文长度。作者基于两年AI应用开发经验,详细解析了如Qwen3、VL、MoE等专业概念,并提供了量化精度选择策略和显存估算方法。文章强调理解这些...