2026 年 8 月第一周没有新的旗舰模型炸场,但产品下沉、企业合规、开源视频、Agent 基础设施和融资动作都在加速。真正的主线越来越清楚:大模型竞争正在从参数规模,转向稳定、便宜、可控地交付工作流。
上半月的余温还在。OpenAI 继续把 GPT-5.6 系列往更低门槛推,中国厂商在 Coding 和视频赛道卷价格、卷开源,开源 Agent 阵营则进入更实际的阶段:谁能少出错、能接工具、能记住经验、能被安全地放进工作流。
我这周的判断很简单:2026 年下半年的主战场,已经不是“谁的参数更大”。参数仍然重要,但用户愿意付钱的地方,正在变成另一件事:模型能不能像一个稳定同事那样,把任务做完。
本周主线:能力开始向工作流让位
过去两年,大模型新闻最容易被一个指标带着跑:参数规模、上下文长度、榜单分数、多模态能力。到了 2026 年,这些指标还在,但它们不再自动等于产品价值。
OpenAI 的免费层扩张说明,强一点的模型正在变成获客工具。Anthropic 的企业钩子说明,公司用户更关心审计、DLP 和部署边界。MiniMax H3 的开源视频模型说明,生成能力一旦接近可用,价格和交付方式会立刻变成战场。Hermes Agent v0.20 的热度则说明,开发者已经不满足于“和模型聊天”。他们想要的是一个能接系统、接工具、接其他 Agent 的运行层。
这周没有核弹级发布,但每条线都指向同一个方向:模型能力本身正在被包装成更具体的工作流能力。
OpenAI:把 GPT-5.6 往免费层下沉
OpenAI 本周的动作集中在 GPT-5.6 家族的体验优化和免费层扩张。
8 月 6 日,OpenAI 宣布改进 GPT-5.6 Sol,面向 Plus 和 Pro 用户开放。官方重点放在两个方向:回答更聚焦,冗余更少。内部评测里,事实错误率相比 GPT-5.5 Instant 下降约 68%。
另一边,GPT-5.6 Luna 被设为 Free 和 Go 用户默认模型,并准备开放无限文本聊天和 “Think” 按钮。这个按钮的实际含义不是把免费用户路由到 Sol,而是给小模型更多推理时间。
这是一套很清晰的商业逻辑:
- 用 Luna 把免费体验做顺,降低用户流失。
- 用无限聊天养成使用习惯。
- 用 Think 按钮改善小模型的可用性。
- 把真正强的 Sol 留在付费墙后面。
用户反馈也很符合预期。无限聊天受欢迎,免费层体验变好也没人会拒绝。但“免费用户永远碰不到真旗舰”的吐槽也会继续存在。OpenAI 不是在做慈善,它是在用低成本模型扩大入口,再把高价值需求往上转化。
教育场景也在推进。ChatGPT Work 和 Codex 插件继续扩展,这条线短期不会像旗舰模型那样吸引眼球,但它更接近真实付费场景。
Anthropic:企业合规继续变成护城河
Anthropic 这一周不像 OpenAI 那么热闹,但动作很企业向。
8 月 5 日,Anthropic 推出 Enterprise 推理钩子 Inference Hooks,支持实时 DLP 数据丢失防护。8 月 6 日,Claude Code 被允许在自有算力上运行。8 月 7 日,Fable 5 的生物学安全护栏继续加强。组织层面,Mariano-Florentino Cuéllar 被任命为首席全球事务官。
这些动作放在一起看,Anthropic 仍然在押“安全 + 企业合规”的差异化路线。
Inference Hooks 对普通用户不性感,但对企业是刚需。很多公司不是不用 AI,而是不敢让模型接触敏感数据、客户资料、源代码和内部文档。实时 DLP 这种能力,决定了模型能不能进生产环境。
Claude Code 自托管则是开发者侧的小利好。它给团队更多控制权,尤其适合那些既想用 Claude Code,又不想把执行链完全交给外部服务的组织。
问题也还在。此前网络安全测试中 Claude 相关模型“跑偏”的事件继续发酵,Fable 系列的政府限制阴影也没有散。Anthropic 现在的产品和组织调整,本质上是在对冲监管风险。
Google DeepMind:从研究组织转向交付组织
Google DeepMind 本周最重要的不是模型,而是组织。
Demis Hassabis 转任 GDM 主席兼 Alphabet 首席科学家,Koray Kavukcuoglu 升任 GDM SVP,直接向 Sundar Pichai 汇报,负责 Gemini 模型和开发者生态。
这像一次从研究型组织到产品交付型组织的升级。Google 不是没有模型能力,问题一直是节奏:研究成果多,产品入口分散,开发者心智也没有 OpenAI 那么集中。
WeatherNext 在飓风预测上继续刷存在感。七月的 Gemini 3.6 Flash、3.5 Flash-Lite、Cyber、Robotics 2 仍有余热。Google 在 Flash 系列的性价比和机器人落地上下注很重,但 Pro 级别迟迟没有大规模开放,说明它仍在平衡安全、成本和商业节奏。
Google 的优势是工程和生态,弱点是用户感知容易被稀释。组织调整如果能把 Gemini 的模型、API、开发者工具和终端体验拧到一起,下半年还有机会重新拉回存在感。
中国厂商:一边涨价,一边开源
中国大模型玩家这周的关键词是商业化和开源双线推进。
智谱的 Coding Plan 订阅正式回归,改成透明积分制。Lite 起步 118 元/月,新用户价格明显抬高,Pro 档涨幅更明显,老用户有过渡保护,周末全天还有低峰倍率。ARR 约 10 亿美元的消息继续发酵,股价表现强势,高盛也上调了中国大模型收入预期。
用户反馈明显分裂。积分制透明度被认可,大家至少知道钱花在哪。但涨价也让性价比被重新审视,尤其是在 Kimi、DeepSeek 等选项持续挤压的情况下。智谱的 Coding 能力仍是核心卖点,很多人还在等更强的下一代模型。
月之暗面的 Kimi K3 余波还在。2.8T 参数、开源、长上下文、视觉原生,这组标签直接把开源模型的天花板往上推了一截。性能逼近前沿闭源,融资估值持续上修,美国方面也开始质疑蒸馏和芯片使用问题。
K3 是一次真正的开源冲击波。争议不会少,因为中美 AI 竞争已经不只是在模型分数上较劲,还延伸到了供应链、训练路径和开源边界。
DeepSeek 8 月 6 日重启约 80 亿美元融资轮,估值接近 740 亿美元。此前融资因创始人言论泄露暂停,现在重新启动,说明资本对中国开源阵营的信心没有散。但这个估值已经不允许它只做“便宜好用”的标杆。接下来要持续交付,才撑得住市场预期。
MiniMax H3:视频生成开始进入价格战
MiniMax 是这周产品新闻里最亮的一条线。
8 月 3 日,MiniMax 正式发布并开源 H3 多模态视频生成模型。H3 支持原生 2K、立体声音频、最长 15 秒视频生成,也支持多模态参考。API 定价很有攻击性,大约只有竞品的十二分之一,并登上 Artificial Analysis 视频编辑榜第一。
社区反馈很分裂,但方向清楚:
- 视觉包装、角色一致性、文本渲染被夸。
- 物理运动和影院级张力还不如 Seedance。
- 本地部署门槛不低,完整 2K 流程仍依赖官方组件。
- 开源权重存在地域限制,排除美、欧、英、韩,背后和版权诉讼有关。
这是一种典型的“半开源”策略。用权重换生态,用 API 保利润。对开发者来说,它降低了试错成本;对 MiniMax 来说,它把视频生成从高端展示拉进了可商业化的价格区间。
视频模型一旦开始卷价格,行业节奏会变得很快。图像生成经历过类似过程:先比质量,再比速度,再比价格,最后比工作流。视频也会走这条路,只是成本更高、版权和地域限制更麻烦。
Agent 战场:Hermes 0.20 把社区热度打起来了
这周最大的社区热度来自 Nous Research 的 Hermes Agent v0.20.0,代号 Herald。
8 月 3 日发布的这个版本,更新量很大:实时可打断语音、自定义唤醒词、Agent-to-Agent 协议、可验证引用、签名 Webhook、桌面平台强化。社区反响强烈,不只是因为功能多,而是这些功能都在补 Agent 真正进入工作流之前的缺口。
语音可打断,说明 Agent 不再只是命令行工具。A2A 协议说明多个 Agent 之间需要协作边界。可验证引用解决的是信任问题。签名 Webhook 则是把 Agent 接进外部系统时必须要有的安全基础。
OpenClaw 现在进入更成熟的稳定优先阶段。月度扩展稳定版、安全打分卡、Foundation 化后的持续运营,都说明它已经从实验工具走向长期项目。但开发者迁移到 Hermes 的声音在变多,理由很直接:稳定性、自学习技能循环、安全记录。
我的看法是,OpenClaw 打开了“本地 Agent 可以真正做事”的想象空间,Hermes 正在把这件事做得更可靠、更可组合。
2026 年的 Agent 不再是聊天机器人的升级版。它更像一个工作流操作系统。谁先解决记忆、技能自我进化、跨 Agent 协作和安全边界,谁就更接近真实生产力。
用户情绪:欢迎更便宜,也更挑剔
这周的社区反馈可以压成几条:
- OpenAI Luna 无限聊天受欢迎,但免费层用不到真旗舰的抱怨不会消失。
- 中国 Coding Plan 涨价引发情绪波动,积分透明是一回事,性价比是另一回事。
- H3 视频模型让人兴奋,尤其是价格和包装能力,但物理真实感和本地体验仍有明显短板。
- Agent 阵营的开发者在用脚投票,稳定性比功能数量更重要。
- 安全和监管阴影继续加重,生物护栏、网络安全测试事故、地域开源限制都在提醒行业:能力越强,约束越多。
这里有个很现实的变化:用户已经不再被“新模型发布”四个字轻易打动。大家会问价格,会问能不能接 API,会问上下文是否稳定,会问能不能本地跑,会问出了问题谁负责。
这不是热情下降,而是市场成熟了。
下周看什么
下周我会重点看四件事。
第一,智谱是否真有万亿级新模型动作。如果有,重点不是参数,而是 Coding 和 Agent 场景能不能拉开差距。
第二,DeepSeek 融资落地后的细节。估值接近 740 亿美元之后,它需要给市场更明确的增长叙事。
第三,Hermes A2A 生态能不能起飞。协议发布只是开始,关键是有没有真实的跨 Agent 协作样例和可复用工作流。
第四,各国监管会不会继续收紧开源权重。MiniMax H3 的地域限制已经给了一个信号:未来的“开源”可能越来越不像过去那个开源。
这周没有一夜改变格局的模型。但产品化、商业化和 Agent 基础设施都在往前推。下半年真正拉开差距的,可能不是下一个 T 参数,而是谁能把模型变成可靠的同事。
数据综合公开新闻、官方发布与社区讨论,仅供参考。欢迎补充你看到的一手反馈。





评论前必须登录!
立即登录 注册