韩国生成式 AI 企业 Upstage 正式发布了代号为 Solar Open 2 的主权基础模型。该模型采用 2500 亿参数的 MoE 架构,但在推理时仅激活 150 亿参数,旨在平衡高性能与低推理成本。Solar Open 2 的核心定位是专为智能体应用优化,其在预训练和后训练阶段均聚焦于 MCP 工具调用、编程及办公自动化等真实 Agentic 场景,强调模型在实际工作环境中的执行与纠错能力。技术上,该模型引入了混合注意力架构(GQA 结合线性注意力),实现了高达 100 万 token 的超长上下文窗口,同时有效控制了显存占用。性能方面,Solar Open 2 在 MMLU-Pro 知识基准与 LiveCodeBench 编程基准中均取得同类模型最高分,并在韩国职场基准测试中超越了 DeepSeek V4 Pro 等超大参数模型。针对韩语优化的分词器使其处理本地文本的效率远超全球通用模型,大幅降低推理成本。目前,模型权重已在 Hugging Face 以商业友好许可证发布,量化后仅需两块 NVIDIA H200 GPU 即可运行。
事件分析
💡 核心观点:Solar Open 2 通过架构创新与垂直语种优化,证明了主权模型在特定场景下比通用巨头模型更具性价比。
原文链接:Linux.do





