Anthropic 明确拒绝支持 AGENTS.md:坚持“人机协作”路线,警惕全自动代理风险

近日,针对开发者提出的在 Claude Code 工具中支持 AGENTS.md 配置文件的功能请求(Issue #6235),Anthropic 官方明确表示拒绝支持,并详细阐述了其产品设计的核心理念。

AGENTS.md 是一种常用于 AutoGPT 等“自主智能体”项目的配置文件,旨在通过预设的角色定义,让 AI 模型能够完全脱离人类监管,自主地拆解任务、规划步骤并执行连续操作。然而,Anthropic 技术团队指出,这种强制模型扮演特定“角色”或“人设”的机制,往往会导致模型为了迎合设定而产生幻觉,偏离原本有益、无害的价值观,甚至可能被利用于通过“角色扮演”绕过安全护栏(Jailbreak)。

此外,Anthropic 认为,Claude Code 的定位应当是高度可控的辅助工具,而非全自动的黑盒代理。支持 AGENTS.md 会将用户的使用模式锁定在“一次性设定、全自动运行”的框架中,剥夺了开发者在每个关键步骤中进行干预、审查和指导的灵活性。Anthropic 强调,其产品哲学是“人在回路中”的协作模式,即 AI 建议下一步行动,由人类决策并批准执行,以确保代码的安全性和可控性,而非追求无人监管的完全自动化。

事件分析

这一事件揭示了 Anthropic 与当前市场上激进追求“全自动智能体”的厂商之间的本质差异。当前行业热捧“Agentic Workflow”,试图让 AI 模拟人类独立完成复杂任务,而 Anthropic 则选择了一条更为审慎的路径。

从技术安全角度看,Anthropic 的担忧有其合理性。强制性的“角色扮演”确实容易引发对齐失效,导致模型输出不可控的内容,这与其坚守的“宪法 AI”安全底线相悖。

从产品定位来看,Anthropic 似乎意在将 Claude Code 打造为增强人类能力的“副驾驶”,而非替代人类的“自动驾驶仪”。这种拒绝可能短期内限制了部分追求极致自动化的开发者的需求,但从长期看,在代码生成这种高风险场景下,强调“人机确认”的交互模式可能更符合企业级应用对安全合规的要求。这也表明,在 AI 发展路径上,关于“自主性”的边界定义已成为头部厂商的核心分歧点之一。

核心观点:Anthropic 宁愿牺牲“全自动”的热度也要守住安全底线,这标志着 AI 开发工具正从追求“无人代理”回归更务实的“人机协作”辅助模式。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册