AI 下一波竞争:模型更聪明之后,谁来接管速度、上下文和注意力

AI 下一波竞争:模型更聪明之后,谁来接管速度、上下文和注意力 日报图文

过去两年,判断一家 AI 公司强不强,最省事的办法是看模型榜单。推理分数高一点、代码能力强一点、上下文再长一点,似乎就足以解释产品差距。这个判断正在迅速过期。

Matthew Berman 与 OpenAI 的 Tibo Sottiaux 进行了一次 44 分钟访谈。表面上,他们聊了 Codex、超高速推理、ChatGPT 与编码产品的融合、云端 Agent、递归式自我改进,以及 OpenAI 和 Anthropic 的竞争。把这些话题串起来,会看到一条更重要的主线:下一波 AI 的竞争焦点正在从单次回答能力,扩展到速度、持续上下文、注意力管理和个性化运行时。模型仍然重要,但模型越来越像发动机;真正拉开体验差距的,是整辆车如何围绕人来运行。

一次未发布的产品,如何改变一家公司的性格

访谈开头谈到了一段很有意味的经历。Tibo 曾在 Google DeepMind 工作,参与过语言模型基础设施和产品化。当时团队已经做出可供内部聊天的 LM Chat,时间大约早于 ChatGPT 公开发布一年。模型能生成连贯文本,虽然早期更像一个有趣的实验,但实用性已经开始显现。团队自然产生了对外发布的愿望,最终没有走到公众面前。

这段历史的价值不在“谁更早做出聊天机器人”。大公司实验室从来不缺原型,真正稀缺的是把原型推向真实用户、接受混乱反馈、允许产品反过来重塑组织的能力。

Tibo 对 OpenAI 文化的描述很直接:研发与产品靠得很近,创意可以自下而上形成,小团队能快速聚集并发布功能。同时,产品还要维持一致性,避免不断试验把界面堆成杂货铺。这两股力量天然拉扯。一边是速度,一边是完整性;一边鼓励任何人提出新想法,一边要求产品仍然像同一个产品。

这也解释了为什么“自我颠覆”在 AI 公司里格外重要。传统软件可以围绕成熟产品做多年优化,前沿模型每隔几个月便会改变能力边界。语音模型突然自然到足以承担日常输入,工具调用突然稳定到可以执行长流程,推理速度突然提升一个数量级,旧的交互设计就会失去依据。组织若只保护当前收入和既有界面,很容易重演 LM Chat 的故事:技术已经出现,产品仍被过去的成功锁住。

对创业团队而言,这里有一个比“快速迭代”更难的要求:每隔一段时间,主动检查产品假设是否已经被新模型推翻。路线图不能只回答下季度交付什么,还要回答哪些既有模块可能失去存在价值。

Agent 的上限,开始被笔记本电脑限制

访谈里有句话让我停了一下:未来的高能力 Agent,需要超出个人电脑的资源边界。

笔记本电脑围绕人类设计。人一次盯住几个窗口,一分钟输入几十个词,前台运行少量交互任务。CPU、内存、应用窗口和通知系统,默认服务于这种节奏。模型没有同样的生理限制。一个足够成熟的 Agent 可以并行探索多条方案:一边阅读代码,一边编译测试,一边检查生产日志,一边建立假设,再让多个执行单元相互校验。

当并行规模从三四个任务变成几十个任务,本地桌面会成为调度器的瓶颈。云端 Agent 因而拥有更深的意义。它不只是把命令行搬到远程服务器,还会形成一层持续运行的计算环境:保存长期上下文,调用组织工具,管理并发任务,在人离线时继续工作,并在真正需要判断时请求注意力。

今天的编码 Agent 已经暴露了过渡期的笨拙。用户维护规则文件、技能文件和项目记忆;子 Agent 需要人工拆分;不同会话经常丢失背景;十几个任务同时运行后,人开始频繁切换窗口,最后沦为“Agent 进度管理员”。算力提升了,人的认知负担也同步增加。

这说明多 Agent 的核心挑战并非再多开几个终端。真正困难的是建立可靠的运行时:

  • 能理解个人目标、团队状态和项目历史;
  • 能把复杂工作拆成可验证的任务;
  • 能控制并发量,避免把调度压力全部甩给人;
  • 能识别高风险动作,在执行前请求审批;
  • 能用证据汇报结果,失败后保留可恢复状态;
  • 能判断什么时候立即打断,什么时候延后汇总。

对于正在做 Agent 平台的人,这个方向很熟悉。消息队列、租约、任务状态机、权限边界、可观察性、长期记忆,这些传统分布式系统能力会重新成为 AI 产品的地基。模型负责产生智能动作,运行时负责让动作可控、可续、可验收。

速度改变工作流,也改变“好答案”的定义

很多人把推理加速理解成少等几秒。访谈给出了一个更准确的视角:速度跨过某个阈值后,工作方式会发生相变。

如果 Agent 完成一轮任务需要 30 到 45 分钟,用户自然会同时启动十几个任务,用并行掩盖等待。代价是持续的上下文切换。每个 Agent 返回时都需要重新加载背景,确认它做了什么、下一步该怎么走。任务数量越多,人的注意力越碎。

当生成、工具调用和原型构建接近实时,用户可以围绕两三个主任务保持连续思考。说出想法,几秒后看到原型;指出问题,立即得到修订;让系统生成小报告,再顺势追问。这时 AI 更像思维回路的一部分,等待感显著下降。

有个细节很容易被宣传数字盖过去:模型吐字快,整个 Agent 未必快。真实延迟来自一条完整链路,包括模型推理、网络往返、工具启动、网页加载、代码编译、测试执行、数据库查询和权限确认。访谈中也提到,当任务主要是大段代码生成时,超高速模式能明显接近其标称提升;工具调用占比高时,体感提升会缩小。

因此,下一代 Agent 平台会像性能工程团队一样逐层找瓶颈。更快的模型只优化其中一段。工具协议需要减少握手,运行环境需要预热,多个无依赖步骤需要并行,缓存需要知道什么能复用,失败重试还要避免重复副作用。速度最终是一项系统工程。

速度也会改变用户对质量的容忍方式。一次回答要等十分钟,人会期待它足够完整;一次回答只需几秒,人更愿意通过多轮互动逐步逼近结果。产品设计会从“生成最终答案”转向“维持高带宽协作”。这正是语音、共享画布、实时代码和可视化原型值得关注的原因。

最稀缺的资源从算力转向人的注意力

Tibo 在访谈里反复谈到注意力管理。这可能是整场对话里最值得产品经理记住的部分。

Agent 有能力并行处理一百件事,不意味着应该把一百个结果同时推给用户。系统越强,越要克制通知。一个真正围绕人设计的 Agent,需要知道用户能承受多少并发,当前是否处于深度工作状态,哪个问题必须马上决定,哪个问题可以等到半小时后的统一汇报。

这会让“主动性”获得更严格的定义。主动并不等于频繁发消息,也不等于未经确认替用户行动。好的主动性包括三层判断:

  1. 价值判断:这件事值得现在做吗?
  2. 风险判断:可以自动执行到哪一步?
  3. 时机判断:什么时候向人请求输入,干扰成本最低?

当前多数 Agent 只做到第一层的一部分。它们能够发现待办,却难以稳定评估业务优先级;能够调用工具,却不总能识别组织中的隐性边界;能够发送通知,却不了解一条通知打断了什么。

未来的个人 Agent 会逐渐形成“注意力预算”。低风险、可回滚、有明确验收标准的工作在后台完成;涉及资金、删除、对外发送、权限扩大等动作进入审批;多个普通进展被压缩成一次摘要;真正阻塞主线的问题才立即出现。这样一来,Agent 的价值不再由执行次数衡量,而由替人保住了多少连续注意力衡量。

对企业系统也是一样。一个每小时产生上百条“智能告警”的平台,很可能只是把日志噪声翻译成自然语言。更成熟的系统应该先聚类、关联、验证,再把少数需要决策的问题送到负责人面前。

ChatGPT 与 Codex 融合,背后是角色界面的退场

访谈谈到 ChatGPT 与 Codex 的融合时,外界最自然的疑问是:面向普通人的聊天产品,为什么要和专业编码工具合在一起?

Tibo 给出的方向是构建统一的个人智能 Agent。用户属于程序员、设计师、产品经理或市场人员,只是组织为了降低复杂度而使用的标签。现实中的个人往往跨越多个角色:开发者也会写方案、查资料、分析财务;产品经理也可能读日志、改 SQL、制作原型。随着自然语言降低技能门槛,角色边界会继续变淡。

统一底层并不要求所有人看到同一套固定界面。更合理的形态是共享一套模型、记忆、工具和安全机制,再根据个人能力、任务阶段和使用习惯动态组织界面。熟练开发者可以看到终端、diff 和测试结果;非技术用户看到目标、进度和审批项;同一个人处理不同任务时,界面也会变化。

我更愿意把它叫作“个性化运行时”。记住用户喜欢简洁回答,只能算最浅的一层。它还要理解:

  • 常用工具和数据源;
  • 项目之间的依赖关系;
  • 对风险的容忍度;
  • 偏好的验收方式;
  • 什么时候需要解释,什么时候直接给结果;
  • 哪些决定可以代理,哪些决定必须保留给本人。

做到这一步,传统应用的入口会逐渐弱化。用户先表达目标,运行时再决定调用代码工具、浏览器、文档、表格或企业系统。应用不会消失,但应用之间的切换成本有机会被 Agent 吸收。

“递归式自我改进”首先发生在工程系统里

递归式自我改进经常被描述成模型自行训练出更强模型,听起来遥远又带有科幻色彩。访谈提供了一个更现实的版本:强模型先用于优化承载模型的基础设施。

它可以分析推理栈、改进 CUDA 内核、寻找服务瓶颈、重构关键路径、提高令牌效率,也可以帮助开发云端 Agent,让研究人员和工程师更快获得模型能力。模型提升基础设施,基础设施降低运行成本并提高速度,随后更强、更便宜的模型又被用于下一轮优化。

这个循环已经具备商业意义。模型能力相近时,推理成本、响应速度和可用额度会直接影响产品扩散。效率提升如果被转化成降价、更高配额或更快服务,就会带来更多真实使用;更多使用又产生新的工作负载和产品反馈,帮助团队发现下一轮优化位置。

因此,判断一家 AI 公司的长期竞争力,不能只看训练出什么模型,还要看它有没有能力把模型用于自身工程体系。研究、推理基础设施、产品反馈和分发渠道之间的循环速度,可能比一次榜单领先更重要。

当然,循环越快,安全闸门越重要。访谈也谈到前沿训练暂停与安全团队评估。外部很难仅凭这段对话判断具体机制是否充分,但一个原则很明确:高能力系统需要明确的暂停条件、审批权和恢复标准。自动化修复生产问题很诱人,涉及高风险动作时仍应保留最小而有效的人类控制点。

OpenAI 与 Anthropic 的差异,会越来越像运行时哲学之争

当主持人问到 OpenAI 与 Anthropic 的竞争,Tibo 把重点放在广泛普及、社区反馈和产品分发上。站在受访者立场,这当然带有公司叙事色彩,不能当成中立市场结论。不过,它提示了一个观察框架:头部公司的差异,正在从“谁的模型更强”延伸到“谁希望 AI 以什么方式进入工作与生活”。

有的产品强调深度工作、清晰边界和可控的专业环境;有的产品强调统一入口、语音优先、广泛覆盖和大规模分发。两条路线都会吸收对方的长处,最终仍可能形成不同的产品气质。

用户选择平台时,也应该减少对单次测评的依赖。更值得比较的是:长期记忆是否可靠,工具生态是否开放,权限是否透明,任务能否恢复,结果有没有证据,团队协作是否顺畅,价格和限额是否匹配真实工作负载。对组织而言,迁移成本主要沉淀在上下文、流程和工具连接中,远高于聊天记录本身。

给 Agent 开发者的五个判断

看完这场访谈,我没太在意某个功能会在哪天发布。产品规划会变,型号和价格也会变。下面五个判断更耐用。

第一,模型只是运行时的一部分。 记忆、权限、任务状态、工具协议、可观察性和验收机制共同决定 Agent 能否进入生产环境。

第二,延迟是产品变量。 快十倍会催生新交互,慢链路也会吞掉模型加速收益。需要测量端到端任务时间,而非只看每秒令牌数。

第三,并发能力必须配合注意力治理。 多 Agent 数量不应成为炫技指标。系统需要主动压缩通知、控制并发、选择打断时机。

第四,个性化要深入目标和边界。 记住称呼与语气只是起点。真正的个性化包括项目上下文、风险偏好、工具权限和验收习惯。

第五,组织发布能力本身就是技术能力。 原型能否被真实用户使用,反馈能否快速回到研究和工程,决定了技术潜力能否转化为产品优势。

结语:下一波 AI,要看谁能让智能持续工作

这场访谈真正描绘的未来,没有停留在“模型还能聪明多少”。它指向一种持续运行的智能基础设施:理解个人与团队上下文,拥有比本地电脑更大的资源空间,能并行执行复杂工作,又懂得保护人的注意力;它通过语音、画布、代码和工具融入自然流程,并在高风险处停下来等待授权。

如果只记住一句话,可以记住这个判断:模型能力决定 Agent 能做什么,运行时决定这些能力能否稳定、自然、低打扰地进入现实世界。

接下来真正值得追踪的指标,会从榜单分数扩展到任务完成时间、上下文保持率、人工接管次数、错误恢复能力、通知打断成本和单位任务价格。谁能把这些指标同时做好,谁才更可能提前抵达下一波 AI。


视频来源:Matthew Berman,How to Understand the Next Wave of AI Before Everyone Else | Tibo Interview
受访者:Tibo Sottiaux(视频介绍标注为 OpenAI 成员)
发布日期:2026 年 8 月 24 日
原视频:https://www.youtube.com/watch?v=4qjEgPojjzM

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册