Qwen3-Next新架构发布:混合注意力+超稀疏MoE,推理提速10倍

Qwen团队即将发布下一代模型Qwen3-Next,采用创新的混合注意力架构和高达1:50的高稀疏MoE技术。首款模型Qwen3-Next-80B-A3B虽总参数800亿,但仅激活30亿,性能超越Qwen3-32B且训练成本不到十分之一。得益于多标记预测(MTP)等优化,其在长上下文场景下推理吞吐量提升超10倍。目前,Transformers、vLLM、SGLang等主流框架已完成代码合并支持。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册