Qwen3.6实测:在受限硬件下MoE模型速度倍超Dense架构

近日一份关于 Qwen3.6 模型的基准测试显示,在 CUDA 核心与内存带宽受限的硬件环境下,Qwen3.6-35B-A3B(MoE 混合专家模型)的推理性能显著优于 Qwen3.6-27B(Dense 稠密模型)。在模拟线上流量的固定 QPS 测试中,MoE 模型通过 NVFP4 量化,实现了 229.79 tok/s 的吞吐量,几乎是 Dense 模型(132.89 tok/s)的两倍。数据表明,在非顶尖算力设备上,MoE 架构结合量化技术能更有效地利用硬件资源,提供更快的交互体验。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册