实战测评:从MiniMax到Opus 4.6,国产大模型在Agent场景下的真实表现

一位开发者在OpenClaw框架下深度实测了多款主流大模型在Agent场景的表现。测试发现,MiniMax 2.5虽有人情味但执行力较弱,智谱GLM 5逻辑能力强但缺乏温度,而Kimi k2.5凭借均衡的能力成为目前国产模型中的最优解。相比之下,Opus 4.6展现出碾压级的意图理解能力,其对指令的精准捕捉被评价为“非同代际的产物”。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册