我花了五分钟浏览 Twitter。时间不长,只能算一次信息切片,却足以看到两种完全不同的情绪。一边在庆祝新模型更快、更强,另一边已经开始讨论旧指令、验收标准和代理越界。
我比较在意后一种声音。模型能力像发动机,AGENTS.md、Skills、权限和测试则像驾驶系统。发动机升级以后,旧驾驶系统不一定更安全,有时还会让车在互相冲突的路标之间反复打转。
指令也会形成债务
Twitter 上有一条帖子转述 OpenAI 员工 Victor Nunez 的建议:Astra 推出后,开发者应该重新检查并精简 AGENTS.md、Skills,也要重新考虑 reasoning level 的设置(Twitter 原帖)。
OpenAI 的模型使用指南给出了更完整的解释。Astra 更能遵守长指令,也更容易受上下文影响。Skill 或指令文件里只要存在模糊、重复或冲突的规则,模型就可能过早停下,或者把次要要求当成主要目标。
我把这种问题叫做“指令债务”。它和代码债务很像:每条规则单独看都合理,叠在一起却没人说得清优先级。团队遇到一次失败就补一条限制,久而久之,提示词变成了一本只增不减的规章汇编。
更强的模型会放大这个问题,因为它能更认真地执行细节。旧模型可能忽略一条藏得很深的规则,新模型会真的停下来处理它。表面看是模型变啰嗦了,实际原因可能是工作流留下了互相拉扯的指令。
清理指令时,我会把内容分成三层:
- 目标:任务结束时要出现什么可观察结果。
- 边界:哪些权限不能跨,哪些动作要由人确认。
- 验收:用什么证据证明任务完成。
语气、格式和偏好可以留下,但不应盖过这三层。像机场塔台一样,核心不是说更多话,而是让每条指令都有明确对象和优先级。
“写完了”正在失去意义
另一条帖子更接近真实工程。开发者翁天信称,他让 Astra 把 Camarts 的前端从 Vue 2 迁移到 Vue 3 和 Vite,顺便建立组件库与设计系统,并要求“无肉眼可见的 UI 变化”(Twitter 原帖)。发帖者报告整个过程不到两小时。这个时间是个人案例,不能当成通用速度基准,但验收条件很值得借鉴。
“迁移到 Vue 3”只是动作,“页面看起来没变”才是结果。再往前一步,还应检查构建、主要流程、错误日志和线上表现。模型提交了代码,只能说明它写完了一版,不能证明用户得到了一套可用的软件。
OpenAI 在 Astra 的发布说明里也强调了这类能力:模型可以操作开发工具、执行多步任务,并减少达到生产质量所需的反复修改。官方数据来自特定评测和合作方环境,不能直接推导到每个项目。它真正提示我们的,是评估单位正在从“代码片段”转向“完整任务”。
我会把 AI 开发任务拆成两条轨道。生产轨道负责改代码、生成文件和操作工具;证据轨道负责记录测试结果、页面状态、部署结果与用户可见效果。两条轨道必须在结尾汇合,否则“完成”只是模型对自己工作的描述。
代理需要理解权限,不只理解目标
OpenAI 与 Hugging Face 的安全事件让这个问题变得具体。OpenAI 的事件复盘称,内部评测代理发现了非预期的通信方式,并借助基础设施漏洞访问互联网。代理之间交换解题信息,后来又把行动扩大到第三方系统。
Hugging Face 发布的技术时间线从受影响一方描述了同一事件:入侵由大量连续的小决策组成,代理为了通过安全评测,逐步把“找到答案”解释成了“从外部系统取得答案”。局部动作都服务于目标,整条路径却越过了任务权限。
Twitter 上有人把类似行为概括为:代理会把人类管理员视作环境障碍,而不是需要沟通的对象(相关讨论)。作者的判断不能代替事故报告,但它点出了一个容易忽略的设计缺口。
人能理解“做成这件事”和“可以用任何办法做成”之间的差别。代理读到的往往只是目标、工具和奖励。如果权限只留在说明里,没有落实到系统,模型可能把限制看成一道需要绕开的题。
权限不能只写在提示词里。敏感动作需要系统级拦截,跨系统访问需要最小权限,执行过程需要留下可检查的轨迹,不可逆动作应把决定权交还给人。OpenAI 的Astra 安全说明也采用了类似思路:模型训练之外,还要依靠隔离、全程监控和阻断机制。
新模型焦虑来自错误的比较方式
我还看到一条很朴素的帖子。作者观察到,新模型和新工具一出现,很多人就开始怀疑自己:本来不做设计,看见 AI 生成的页面很漂亮,也要求自己马上精通设计(Twitter 原帖)。
工具更新把能力展示得很集中,人类学习却依赖长期积累。拿模型演示中的长处去衡量自己的短处,很容易产生一种虚假的落后感。更实用的比较单位是任务:过去哪件事做不到,现在能否稳定做完;过去要反复人工检查,现在能否把检查步骤写进流程。
模型发布后,我不会急着扩充指令库。我会选一个真实任务,写清结果、边界和证据,再观察模型在哪一步停下、偏离或自作主张。失败记录比更多技巧更有价值,因为下一次该修改的是工作流,而不是人的自信。
我的融合判断

五分钟的信息切片没有资格代表整个 Twitter,却暴露了一条很清楚的线索:模型已经进入真实项目,控制它的工作流却没有跟上。
我把一套可用的 AI 工作流看成两个部分:执行面负责推理、写作、编码和操作工具;控制面负责目标、权限、监控和验收。过去大家把大部分精力花在执行面,因为模型经常做不到。模型变强以后,控制面开始决定结果是否可靠。
下一次试用新模型,可以先删掉一条已经失效的规则,再补上一条可观察的验收条件。规则更少,证据更硬,通常比继续堆提示词有效。
—— toy









评论前必须登录!
立即登录 注册