Thinking Machines Lab发布Inkling-Small:12B激活参数实测性能超越DeepSeek V4

<article class="article-content">

Thinking Machines Lab 正式发布了多模态模型 Inkling-Small,该模型拥有 276B 总参数,但在推理时仅激活 12B 参数。官方基准测试数据显示,Inkling-Small 在多项关键指标上表现强劲,其性能超越了 DeepSeek V4 Flash、Claude 4.5 Haiku 以及 Gemini 3.5 Flash-Lite 等主流模型。在 AI 智能体与编程能力方面,Inkling-Small 在 SWE-Bench Verified 测试中获得了 80.2% 的高分,优于 DeepSeek V4 Flash 的 70.7% 和 Qwen3.5 的 71.0%;在 Terminal Bench 终端操作基准中得分为 64.7%,同样处于领先地位。在通用推理领域,该模型在 GPQA Diamond 上达到 89.5% 的准确率,在数学竞赛 AIME 2026 中获得 95.5% 的分数,ARC-AGI-1 得分为 84.0%。此外,Inkling-Small 具备多模态与音频处理能力,视觉能力在 MMMU Pro Standard 上得分 74.0%,并在 Chat IFBench 和 Global-MMLU-Lite 等综合测试中保持竞争力。作为采用开放权重的模型,Inkling-Small 展示了极高的参数利用效率,为开发者在构建高性能 Agent 和代码应用提供了新的强力基座。

事件分析

Inkling-Small 的发布标志着开源模型在“推理效能比”上的显著突破,其核心看点在于 12B 激活参数量能够匹敌甚至超越参数量更大的竞品,这表明其 MoE(混合专家)架构优化极其成熟。产业影响方面,Thinking Machines Lab 作为由前 OpenAI 及 Anthropic 核心成员创立的新势力,直接对标 DeepSeek 和 OpenAI,意图通过开放策略抢占智能体与代码生成的市场高地。随着此类高质量开源模型的出现,行业竞争重心正从单纯的参数规模转向推理效率与复杂工具调用能力,这将加速具备 Agentic 能力的轻量化模型在实际生产环境中的落地。

💡 核心观点:Inkling-Small 凭借极致的 MoE 架构优化,证明了开源模型在仅激活 12B 参数的情况下即可全面超越 DeepSeek V4 Flash 等顶级竞品,确立了 AI Agent 代码生成领域的效能新标杆。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册