小米近日更新了MIMO大模型服务的定价策略,确立了“1亿Credit等于1元人民币”的锚定机制,并公开了API价格与Credit的换算关系。分析指出,新套餐的优惠幅度随着购买档位提升而增加,Max档位折扣近20%。其宣称的“用量提升5-8倍”并非简单的数值膨胀,而是源于引入了全新的缓存计费策略:新逻辑下,命中缓存与未命中缓存的价格差异高达50至120倍。这一极低成本的缓存策略基于小米在推理系统上的深度技术重构。技术团队基于SGLang HiCache完整支持SWA(滑动窗口注意力),将KV Cache在多级存储间的数据搬运量降低至优化前的1/7,可缓存Token数量提升5倍。结合7:1的Hybrid Attention混合注意力机制比例,以及MTP技术对吞吐量的补偿,小米成功在降低显存占用的同时保持了高推理速度。这种架构上的平衡使得缓存命中的边际成本大幅降低,从而支撑了0.02元/M的超低命中价,实现了高性能与低成本的兼得。
事件分析
💡 核心观点:AI推理的下一阶段竞争焦点将从模型训练转向基于KV Cache优化的系统工程能力,架构级优化是降价的本源。
原文链接:Linux.do

评论前必须登录!
立即登录 注册