算力瓶颈还是扩容失败?用户实测 Kimi 2.6 旗舰版响应需2分钟

近日,有月付99元的Kimi 2.6用户在技术社区反馈,模型在回答问题时出现极度延迟,单次生成耗时接近2分钟,严重影响了使用体验。这一现象引发了业界对于大模型推理效率与基础设施负载能力的担忧。尽管Kimi在模型能力和上下文窗口上持续迭代,但过高的响应延迟暴露了其在算力调度或推理优化上的短板。这表明,在“模型智商”竞赛之外,如何保障高并发下的响应速度,已成为大模型商业化落地的关键阻碍。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册