本周大模型圈最重要的信号不是又多了几个新模型,而是后训练、Agent能力和开源可用性同时加速。智谱、DeepSeek、Google、OpenAI和Anthropic都在用不同方式回答同一个问题:模型怎样从会聊天变成能稳定干活。
如果只看发布节奏,会觉得信息很散。智谱发 GLM-5.3,DeepSeek 推 V4 Pro 正式版,Google 三周一更 Flash,OpenAI 继续商业化,月之暗面融资余热还在,MiniMax 则往音乐生成继续推进。
但把这些事放到一起看,主线很清楚:大模型竞争正在从“谁的基座更大”转向“谁能把基座潜力榨出来,并接进真实工作流”。编程、长程任务、Agent runtime、验证回路,正在变成主战场。
智谱:GLM-5.3 把后训练的上限打出来
8 月 14 日,智谱发布 GLM-5.3。最有意思的地方是,基座几乎没有换,仍然沿用 GLM-5.2 约 7430 亿参数的底子,主要提升来自后训练 Scaling:更大规模的长程任务环境、更丰富的场景、更长训练时间。
官方给出的数据很激进。内部编程体感比 5.2 提升约 50%;Terminal-Bench 3.0 从 4.6 拉到 28.3;DeepSWE v1.1 从 46.2 到 66.9;Agents’ Last Exam 也明显进步。智谱直接把它定位为当前编程能力最强的开源模型,接近 Claude Fable 5,部分网络安全任务还接近或略超 Mythos 5 / GPT-5.6 Sol。
权重没有当天放出,计划两周后开源,理由是先做安全加固。工具侧则已经接入 ZCode、AutoClaw 等场景。
我认为这是本周最有信号意义的发布。它说明一件事:很多基座模型还没被训练到可用性上限。过去大家容易把能力差距归因于参数、数据或架构,现在 GLM-5.3 这个案例更像是在说,后训练本身已经成为一条足够硬的 Scaling 路线。
这对开源生态很关键。开源模型过去经常在聊天、知识问答、数学题上看起来不错,一到真实软件工程就掉链子。GLM-5.3 如果后续社区实测能接近官方数据,国产开源模型就不只是“能跑”,而是开始进入“能干活”的区间。
另一个不能忽略的点是安全能力。模型越会写代码、越会操作环境,网络安全任务上的能力就越容易同步冒出来。能力提升不是单向收益,它会同时抬高防御和滥用两边的天花板。
DeepSeek:V4 Pro 正式版补齐 Agent 短板
8 月 13 日前后,DeepSeek 推出 DeepSeek-V4-Pro-0813 及配套更新。重点不再只是通用对话,而是 Agent 和软件工程:DeepSWE 等基准大幅提升,原生支持 Responses API 和 Codex 相关流程,同时推出 Harness 工具。
价格侧也有变化。API 引入峰谷定价,整体仍然亲民,但已经开始上调。这个动作很现实:DeepSeek 仍然打性价比,但不再只是低价冲量,而是在把生产级接口、工具链和商业模型接起来。
DeepSeek 和 GLM-5.3 形成了一个有趣对照。智谱这次像是把“后训练爆发”摆到台前,强调模型能力的跳升;DeepSeek 则更像是在强调“现在就能接进开发者系统”。一个打上限,一个打落地速度。
对开发者来说,后者很重要。模型基准再漂亮,如果接口、价格、工具链、上下文管理、调用协议不顺,真实使用会很快卡住。DeepSeek 这一轮的价值就在于,它把 Agent 能力和可用接口一起往前推了一步。
Google:Flash 高频迭代,Pro 压力还在
Google 本周发布 Gemini 3.7 Flash,距离 3.6 Flash 只有三周。更新重点仍然围绕编码、调试、issue resolution、Web 开发、知识工作和 Agent workflow。DeepSWE 等指标有进步,价格上还给出年末前半价优惠,约 $0.75/1M input、$3.75/1M output,并接入 Gemini Spark 等产品。
这条线很务实。Google 现在显然知道,Flash 是它保开发者心智的工具:更新快、价格压得住、速度够用、能覆盖大量日常任务。它不一定要在每一个 frontier 指标上赢,但必须让开发者每天愿意调用。
同一时间,DeepMind 领导层调整也值得看。Koray Kavukcuoglu 接任更多核心管理职责,Demis Hassabis 转任主席,组织叙事更聚焦 LLM 与前沿模型追赶。外部也有消息称旗舰 Pro 仍在延迟,内部对 coding 等任务差距有清醒认识。
所以 Google 当前的状态是两层:Flash 在快速补位,Pro 仍然承压。Flash 是扎实的工作模型,但真正决定 Google 站位的,还是下一代 Pro / frontier 模型能不能在编程和长程任务上重新拉回心智。
OpenAI:模型声量不高,商业动作很密
OpenAI 本周模型侧相对安静,商业和产品动作更多。
年化营收 run rate 已经到 400 亿美元量级,IPO 叙事继续强化。资深高管 Brad Lightcap 宣布离职,ChatGPT 推出 Linux 桌面版和餐厅预订功能,Business 增加 Premium seats。广告测试也开始出现,主要面向 Free / Go 层级,官方说不影响回答本身。
这几件事放一起看,OpenAI 已经从“模型发布驱动公司”越来越像“超级应用和商业化平台”。广告、座席、预订、本地桌面端,都是把 ChatGPT 从工具变成入口。
这里的风险也很直接。只要广告进入产品,用户就会天然担心回答质量、排序逻辑和推荐动机会不会被污染。即便短期不影响回答内容,信任成本也会上升。OpenAI 接下来要证明的不只是模型强,而是商业化不会破坏用户对回答的基本信任。
月之暗面:Kimi K3 余波继续发酵
月之暗面本周不是全新模型发布,而是 Kimi K3 的资本和市场余波继续扩散。K3 在 7 月发布后,超大规模开源 MoE 的可用性已经被市场重新定价。F 轮超募完成,投后估值约 350 亿美元,Pre-IPO 轮也提前启动。
这条线说明国产头部已经进入双重竞争:技术要卷,资本节奏也要卷。K3 的价值不只是一个模型本身,而是证明了“开源权重 + 大规模 MoE + 可商业化产品”的组合还有想象空间。
和智谱、DeepSeek 放在一起看,国产三线的分工变得清楚:智谱在编程和后训练上打爆发,DeepSeek 继续推性价比和工程生态,月之暗面用大模型产品和资本市场扩大战线。
MiniMax:Music 3.0 继续做差异化
MiniMax 本周发布 Music 3.0,定位为下一代开源权重音乐生成模型。它支持从概念和可选歌词直接生成完整歌曲,强调生产就绪和表现力。
这不是本周大模型主线里最核心的事件,但它很能说明 MiniMax 的打法:不只在通用文本模型里硬挤,也在多模态生成里找差异化空间。音乐生成是一个很好的切口,因为它对最终体验敏感,对模型输出的完整性和风格控制要求高,商业化场景也更直观。
Agent 产品侧,MiniMax 也在继续更新插件市场、Code Review 等功能。它没有智谱和 DeepSeek 这一周那么抢眼,但路线并没有停。
OpenClaw 和 Hermes:模型越强,runtime 越值钱
模型能力上去以后,Agent runtime 的价值反而更清楚了。
OpenClaw 本周继续做成熟度建设:LTS 通道、运行证据持久化、附件处理、Gateway 稳定性等更新。Hermes 也在 v0.20 前后的 Herald 方向继续推进,包括语音、Agent-to-Agent、webhook、桌面插件等能力。
这类系统的意义,不是再包一层聊天界面,而是把模型放进可运行、可观察、可复用的工作系统里。知识库里之前记录过 Karpathy 的 spec / harness / verification 三层框架:模型缺的不只是智力,更多时候是规格、驾驭环境和验证回路。
这一周的模型发布正好印证了这个判断。GLM-5.3、DeepSeek V4 Pro、Gemini Flash 都在强调编程和长程任务,但真实落地时,决定体验的往往不是模型单次回答,而是任务能不能拆、环境能不能接、证据能不能保存、失败能不能恢复。
换句话说,下一阶段的竞争不会只发生在模型榜单上,也会发生在 runtime、工具协议、任务记录和验证系统里。谁能把“模型很强”变成“稳定、可控、可复用地干活”,谁就更接近真实生产力。
本周社区反馈
开发者社区对 GLM-5.3 和 DeepSeek V4 Pro 的编码、Agent 表现期待很高。讨论焦点不是“国产模型有没有追上”,而是“后训练到底还能把旧基座抬多高”。这比单纯看参数更有价值。
Google 3.7 Flash 的反馈偏务实。大家认可它是一个扎实的工作模型,也喜欢半价策略,但对 Google 的 frontier 模型什么时候真正追上,仍然有疑问。
OpenAI 广告测试引发了体验焦虑。多数人现在还不是反对广告本身,而是担心回答质量和推荐逻辑被商业目标牵引。对 OpenAI 来说,这会是一条很细的线。
开源模型的真实编程可用性明显提升。已经有人开始把国产开源模型当作日常主力或强补充,而不是只拿来跑 benchmark 和尝鲜。
我的判断
本周最值得记住的不是某一个模型名字,而是后训练 Scaling 的威力再次被验证。智谱和 DeepSeek 都在用“同一基座 + 更狠后训练 / 更完整工具链”打出漂亮结果。开源模型在编程和 Agent 任务上的差距正在缩小,闭源第一梯队的护城河会更多转向安全、可靠性、生态和商业闭环。
这也会改变开发者选模型的方式。以前大家问“哪个模型最聪明”,现在更该问四个问题:它会不会写代码,能不能跑长任务,接口和价格能不能进生产,失败后有没有验证和恢复机制。
下周最值得盯四件事:GLM-5.3 权重开源后的社区实测,DeepSeek V4 Pro 正式版的生产反馈,Google 是否继续加速 Pro,OpenAI 广告测试会不会扩大到更多场景。
大模型下半场已经不是单纯比谁参数大,也不是比谁先发新闻稿。真正的比赛会落到后训练效率、Agent 落地速度、开源可用性和商业化节奏上。这个方向,本周已经看得很清楚。
数据与发布信息综合自官方博客、新闻报道及公开基准,截至 2026 年 8 月 14 日。






评论前必须登录!
立即登录 注册