科技论坛 Linux.do 用户发布了一项国产大模型编程能力的实战对比测试。测试选取 GLM、DeepSeek、Qwen、MiMo 四款国产模型,与 Luna Max 进行同题对决,统一使用 Claude Code CLI 作为执行框架,未采用各家专属编程工具以保证对比条件一致。结果显示,五款模型全部 100% 通过任务,但耗时和步骤数差异显著:Qwen 以 17 分钟位居最快,DeepSeek 用时 22 分钟,GLM 耗时 32 分钟,MiMo 用时 33 分钟,Luna Max 则超过 1 小时,耗时最长。测试者透露了若干细节:DeepSeek 使用 high 档运行,而其他模型均拉满配置,对 DeepSeek 略有不利;GLM 因多次缓存突然归零导致消费偏高,与 Claude Code CLI 的配合度不佳;MiMo 在 33 万 token 上下文时触发了一次压缩,其余模型均未压缩。成本方面,若计入中转站倍率,Luna Max 反而比其他模型便宜约 50 至 100 倍,呈现以超长思考时间换取极低价格的特征。需要注意的是,该测试每个模型仅运行一次,样本量有限,结果仅供参考,不具备严格基准测试的统计意义,但为开发者选型提供了真实场景下的第一手参考数据。
事件分析
核心观点:模型评测正从榜单跑分走向真实 Agent 实战,缓存稳定性与框架适配度正在成为比基准分数更关键的成本变量。
原文链接:Linux.do

评论前必须登录!
立即登录 注册