Thinking Machines Lab 正式发布了多模态模型 Inkling-Small,该模型拥有 276B 总参数,但在推理时仅激活 12B 参数。官方基准测试数据显示,Inkling-Small 在多项关键指标上表现强劲,其性能超越了 DeepSeek V4 Flash、Claude 4.5 Haiku 以及 Gemini 3.5 Flash-Lite 等主流模型。在 AI 智能体与编程能力方面,Inkling-Small 在 SWE-Bench Verified 测试中获得了 80.2% 的高分,优于 DeepSeek V4 Flash 的 70.7% 和 Qwen3.5 的 71.0%;在 Terminal Bench 终端操作基准中得分为 64.7%,同样处于领先地位。在通用推理领域,该模型在 GPQA Diamond 上达到 89.5% 的准确率,在数学竞赛 AIME 2026 中获得 95.5% 的分数,ARC-AGI-1 得分为 84.0%。此外,Inkling-Small 具备多模态与音频处理能力,视觉能力在 MMMU Pro Standard 上得分 74.0%,并在 Chat IFBench 和 Global-MMLU-Lite 等综合测试中保持竞争力。作为采用开放权重的模型,Inkling-Small 展示了极高的参数利用效率,为开发者在构建高性能 Agent 和代码应用提供了新的强力基座。
事件分析
💡 核心观点:Inkling-Small 凭借极致的 MoE 架构优化,证明了开源模型在仅激活 12B 参数的情况下即可全面超越 DeepSeek V4 Flash 等顶级竞品,确立了 AI Agent 代码生成领域的效能新标杆。
原文链接:Linux.do





