
大模型周刊 39:工作流开始压过参数规模
2026 年 8 月第一周没有新的旗舰模型炸场,但产品下沉、企业合规、开源视频、Agent 基础设施和融资动作都在加速。真正的主线越来越清楚:大模型竞争正在从参数规模,转向稳定、便宜、可控地交付工作流。 上半月的余温还在。OpenAI 继续把 GPT-5.6 系列往更低门槛推,中国厂商在 Coding 和视频赛道卷价格

2026 年 8 月第一周没有新的旗舰模型炸场,但产品下沉、企业合规、开源视频、Agent 基础设施和融资动作都在加速。真正的主线越来越清楚:大模型竞争正在从参数规模,转向稳定、便宜、可控地交付工作流。 上半月的余温还在。OpenAI 继续把 GPT-5.6 系列往更低门槛推,中国厂商在 Coding 和视频赛道卷价格

Jason Liu 在 AI Engineer 的这场 Codex 工作坊,表面是在讲 appshots、skills、plugins、memory、automation 和 computer use,实际讲的是一个更大的转向:Agent 不再只是接一次任务的工具,而是在被组织成可长期运行的个人工作系统。

2026 年 7 月最后一周,大模型行业的主线很清楚:美国头部厂商用降价和生态补强防守,中国开源阵营继续用权重开放和性价比抢开发者心智,Agent 与具身智能开始从概念走向生产场景。
公开仓库出现一份被指向 Claude Opus 5 网页端与移动端的长系统提示词。它展示了记忆、版权、工具调用和产品推荐的细颗粒度约束,也提醒 Agent 开发者:能力之外,边界配置才是产品稳定性的底盘。
Meta、微软、谷歌都在面对同一道算力选择题:客户愿意付费,但自家模型、Agent 和核心业务同样缺卡。短期卖算力能补现金流,长期却可能把 AI 竞争力让出去。
一项涉及 ChatGPT、Claude、Gemini 的模拟研究显示,AI 在长期聊天建立信任、诱导受试者下载应用时的成功率高于真人。风险不在“更会聊天”,而在诈骗可被批量化。
强模型没把提示词工程干掉,但它确实让很多“角色扮演+十条禁令”变成了噪音。我会先删规则、补验收,再看效果。

有人在搜索框里反复打 freemodel 这个词。需求还是那...

2026 年 7 月 18 日到 7 月 24 日,大模型圈的关键词不是单纯的跑分,而是安全事故、算力约束和开源模型的反击。OpenAI 内部测试引发的 Hugging Face 安全事件,把能力与护栏的矛盾推到了台前;Kimi K3、GLM-5.2、Gemini、Anthropic 和开源 Agent 的动向,也让基

Google DeepMind 研究副总裁 Benoit Schillings 在 AI Engineer 的这场分享里说了一句很狠的话:代码已经结束了,但还有大量事情要做。本文整理这场演讲,并结合我自己的 AI 编程 / Harness 笔记,讨论为什么未来的瓶颈不再是写代码,而是规格、验证、安全、架构和新型软件语言

Tesla 机器学习工程师 Ishita Daga 在这段 12 分钟分享里,把企业数据 Agent 的失败原因压到三个词:歧义、腐败、偏好。本文结合我自己的 Harness / 企业记忆笔记,讨论为什么加模型、加上下文、加知识库都不是根治方案。原视频:https://www.youtube.com/watch?v=B

本文整理自 Google DeepMind 工程师 Philipp Schmid 在 AI Engineer 的演讲。核心问题不是 Skill 有没有用,而是没有 eval 的 Skill 无法判断何时该触发、何时该退休,也无法证明它真的让 Agent 变好。原视频:https://www.youtube.com/wa