2026 年 7 月最后一周,大模型行业的主线很清楚:美国头部厂商用降价和生态补强防守,中国开源阵营继续用权重开放和性价比抢开发者心智,Agent 与具身智能开始从概念走向生产场景。
2026 年 7 月最后一周,大模型行业几乎没有安静时刻。
OpenAI 降价,Anthropic 补上更有性价比的 Opus 层,Google 把 Gemini 继续往机器人里推。中国开源阵营则继续用权重开放、长上下文、多模态和低价 API 抢开发者心智。几个方向同时发生,说明竞争已经从“谁的模型更聪明”变成了更现实的问题:谁能把成本、可靠性、工具链和落地场景一起做好。
我的主判断是:2026 下半年会进入“效率红利再分配”的阶段。模型能力还会涨,但价格会被继续打下来。真正能拉开差距的,不再只是榜单分数,而是长程任务成功率、工具调用稳定性、安全边界和企业部署成本。
OpenAI:降价是在守中低端 API 份额
OpenAI 本周最直接的动作,是 GPT-5.6 系列降价。7 月 30 日生效后,Luna 输入和输出价格下降 80%,来到每百万 token 0.20 美元 / 1.20 美元;Terra 降价 20%;Sol 旗舰价格不动,但增加 Fast 模式,最高 2.5 倍速度,价格翻倍。
这不是单纯促销。Luna 这类快模型本来就面向高并发、低延迟、成本敏感的任务。它降价后,在“intelligence-per-dollar”类榜单上立刻压过一部分中国开源模型,也让很多开发者重新计算 API 账本。
OpenAI 同时推出官方 Terraform provider、GPT Transcribe / Live Transcribe,并给 10 万名学术研究者开放免费高级 ChatGPT 访问。动作很散,但方向一致:降低使用门槛,把开发者、企业和研究者继续留在自己的生态里。
我的看法是,OpenAI 正在把效率提升的一部分返还给用户。中国开源模型已经把中低端 API 价格卷到很低,OpenAI 如果继续保持老价格,确实会丢掉大量标准化推理流量。旗舰模型不降,说明它仍然要守高端溢价;Luna 和 Terra 降价,则是在防守规模市场。
问题也在这里。如果后续只是靠降价防守,而不能在 Agent 可靠性、长程任务和企业工具链上拉开差距,OpenAI 会越来越像一家被迫参与价格战的基础设施公司。它仍然强,但会更累。
Anthropic:Opus 5 是务实补位,MCP 是生态押注
Claude Opus 5 在 7 月 24 日上线,本周继续发酵。它的定位很明确:接近 Fable 5 的智能,但价格只有一半,并默认进入 Claude Max 模型序列。编码、知识工作和 Agent 任务是主要卖点,安全和对齐仍然是 Anthropic 的叙事核心。
用户反馈也比较一致:很多人不是在讨论“它是不是最强”,而是在说“终于有一个日常可用、价格不离谱的 Opus”。对企业和重度开发者来说,这比单纯刷最高分更实际。
另一个关键动作是 MCP 2026-07-28 规范支持。新规范强调无状态核心、更强 OAuth / OIDC,以及 Apps & Tasks 这类标准化扩展。对 Agent 开发者来说,无状态化会让服务部署、横向扩容和权限边界更清楚。
Anthropic 的路线还是“高质量 + 可控”。它没有像 OpenAI 那样用大降价制造声量,也没有像中国开源厂商那样用权重开放抢规模。但它在把 Claude 变成一套更稳定的工作系统:模型本身负责高质量推理,MCP 负责连接工具和企业环境。
这条路线慢一点,但粘性很强。一旦企业把内部工具、权限和工作流接进 MCP,迁移成本就会变高。
Google DeepMind:模型节奏偏慢,具身智能最激进
Google 本周的模型侧更新主要是 Flash 系列:Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。它们更便宜,也更适合 Agent、高并发调用和网络安全任务。旗舰 3.5 Pro 仍然延迟,这让 Google 在纯模型竞争上显得有点拖。
但 Google 的差异化不在这里。
7 月 30 日的 Gemini Robotics 2 更值得看。它把视频理解、任务编排、精细操作、多机器人协作和全身体控制放到一个系统里,覆盖人形机器人和机械臂等场景。开发者讨论里最热的词不是“聊天”,而是“物理世界 AGI”。
当然,演示视频和真实部署之间还有距离。真实环境里的安全、泛化、成本和维护都会更难。机器人不是多写几个 prompt 就能上线的东西。
但从方向看,Google 是几家大厂里最认真把大模型推向物理世界的公司。OpenAI 和 Anthropic 更像是在争夺数字工作流,Google 则在押 VLM / VLA 与真实设备的结合。如果后续成本和应用场景跑通,具身智能可能会成为它最强的差异化。
中国开源阵营:不是追随者,是价格和权重规则的制定者
中国模型这一周的关键词仍然是开源、低价、长上下文、多模态和 Agent。
月之暗面在 7 月 27 日公开 Kimi K3 权重和技术报告。2.8T 参数、1M 上下文、原生多模态、长程 Agent 表现,是它最醒目的标签。此前 API 因算力不足暂停新用户,反而放大了社区期待。权重开放后,Hugging Face 下载和开发者测试都很热,编程与前端榜单表现也不错。
但 Kimi K3 不是完全没有商业边界。大规模使用需要授权,说明中国开源厂商正在形成一种更现实的策略:用开放权重扩大影响力,用商业授权回收高强度使用场景。
MiniMax 在 7 月 31 日发布 H3 全模态生成模型,统一处理文本、图像、视频和音频,支持最高 2K / 15 秒原生双声道视频。它在视频编辑榜单上表现靠前,价格约为竞品三分之一,并计划很快开源权重。内容创作者、广告、电商和短视频场景会特别关注这类模型,因为它们直接对应生产效率。
DeepSeek 同一天开启 V4-Flash 正式版 API 公测。重点不是结构变大,而是后训练强化后 Agent 能力大幅提升,Terminal Bench 2.1 等指标超过此前 Pro 预览,并原生支持 Responses API、适配 Codex。这很 DeepSeek:不一定在每次发布里换一个巨大架构,但持续把性价比和工程可用性往前推。
智谱本周更多是市场和内部节奏。GLM-5.2 此前已经开源并冲击全球榜单,创始人内部信继续强调长程任务与向上突破。一个有意思的细节是,在 Hugging Face 安全事件讨论中,开源模型被拿来做本地防御工具,这让“开源价值”不再只停留在跑分和部署自由上,也开始进入安全与可控的语境。
整体看,中国开源阵营已经不只是“追赶美国头部”。它们正在改变市场规则:权重要不要开、价格应该多低、长上下文和 Agent 是否应该成为标配,都在被重新定价。
美国用户和初创公司越来越愿意把中国模型当成生产备选,甚至是本地部署的主力。顾虑也还在:合规、数据安全、长期维护和商业授权边界,都会影响企业采用速度。
Agent Harness:Hermes 和 OpenClaw 代表另一条路线
这一周还有一个更底层的变化:Agent Harness 生态继续成熟。
Hermes Agent 在 7 月 20 日左右发布 v0.19.0 “Quicksilver”。核心变化是速度提升、首 token 时间下降、更持久的子 Agent 和消息传递,以及密钥管理集成。它强调自学习 Skills 和持久记忆,更像是在做一个能长期积累经验的个人 / 团队 Agent Runtime。
OpenClaw 此前已经上线 iOS 和 Android 应用,本周更多是社区讨论和对比文章。很多用户把两者放在一起看:OpenClaw 偏多通道、插件和移动端覆盖,Hermes 偏自学习、技能沉淀和长期记忆。
我不觉得它们是简单替代关系。大模型从“聊天”变成“做事”以后,模型只是其中一层。真正决定可用性的,是任务编排、工具权限、长期记忆、失败恢复、消息路由和安全边界。
这也是 Agent Harness 的价值。它不一定比模型发布更有声量,但它决定了模型能不能稳定进入日常工作。
本周的四条主线
第一,价格战正式进入明牌阶段。OpenAI 降价不是孤立事件,而是对中国开源低价冲击的回应。未来几个月,中低端 API 和 Agent 工作流成本还会继续下降。模型厂商会越来越难只靠“更聪明”收费,必须证明自己更稳、更快、更容易接入生产环境。
第二,开源权重正在变成战略武器。Kimi K3、MiniMax H3、GLM-5.2 这类模型,把全球开发者拉进自己的技术叙事里。开源不等于不要商业化,而是先扩大生态影响力,再对大规模商业使用分层收费。
第三,Agent 和具身智能成为新战场。DeepSeek 强化 Agent,Anthropic 推 MCP,Google 推机器人,Hermes / OpenClaw 完善自托管 Agent 层。大模型正在离开聊天框,进入命令行、工作流、浏览器、企业系统和真实设备。
第四,安全阴影不会消失。此前 OpenAI rogue agent 事件的后续讨论仍在继续。模型越能“做事”,安全问题越不可能只靠免责声明解决。企业红队、权限隔离、审计日志和可回滚机制会变成基础设施,而不是可选项。
我的判断
2026 下半年,大模型竞争会被三股力量一起推动:效率、开源和 Agent 落地。
效率会带来降价。开源会带来本地部署和生态扩散。Agent 落地会逼着厂商解决稳定性、安全和长程任务问题。
中国模型已经证明自己能打,美国头部正在用降价、生态和安全叙事回应。接下来要看的不是哪家又发了一个更大的模型,而是哪家能把成本、能力和可控性同时做好。
下一周我会继续盯三件事:Gemini Pro 什么时候真正放出,更大开源模型会不会继续落地,以及各家 Agent 在真实生产工作流里的实测表现。







评论前必须登录!
立即登录 注册