韩国发布 Solar Open 2:250B 参数大模型,专为 AI Agent 场景打造

韩国生成式 AI 企业 Upstage 正式发布了代号为 Solar Open 2 的主权基础模型。该模型采用 2500 亿参数的 MoE 架构,但在推理时仅激活 150 亿参数,旨在平衡高性能与低推理成本。Solar Open 2 的核心定位是专为智能体应用优化,其在预训练和后训练阶段均聚焦于 MCP 工具调用、编程及办公自动化等真实 Agentic 场景,强调模型在实际工作环境中的执行与纠错能力。技术上,该模型引入了混合注意力架构(GQA 结合线性注意力),实现了高达 100 万 token 的超长上下文窗口,同时有效控制了显存占用。性能方面,Solar Open 2 在 MMLU-Pro 知识基准与 LiveCodeBench 编程基准中均取得同类模型最高分,并在韩国职场基准测试中超越了 DeepSeek V4 Pro 等超大参数模型。针对韩语优化的分词器使其处理本地文本的效率远超全球通用模型,大幅降低推理成本。目前,模型权重已在 Hugging Face 以商业友好许可证发布,量化后仅需两块 NVIDIA H200 GPU 即可运行。

事件分析

Solar Open 2 的发布标志着区域大模型正从单纯的参数竞赛转向针对特定场景的极致优化。技术层面,Upstage 并未盲目追随全 softmax 注意力或纯线性注意力的路线,而是采用混合架构来解决长上下文的内存墙问题,这种设计在百万 token 级别的应用中具有重要的工程参考价值。产业层面,该模型强调“主权”与“Agent”属性,通过针对韩语的专用分词优化,打破了全球通用模型在非英语语境下的成本与效率劣势,这在 DeepSeek 引发全球成本战的当下,为区域性 AI 厂商提供了一种差异化的生存路径。其能够在双卡 H200 上运行 250B 模型的能力,也揭示了 MoE 架构在私有化部署和本地化推理方面的巨大商业潜力。

💡 核心观点:Solar Open 2 通过架构创新与垂直语种优化,证明了主权模型在特定场景下比通用巨头模型更具性价比。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册