近日,针对开发者提出的在 Claude Code 工具中支持 AGENTS.md 配置文件的功能请求(Issue #6235),Anthropic 官方明确表示拒绝支持,并详细阐述了其产品设计的核心理念。
AGENTS.md 是一种常用于 AutoGPT 等“自主智能体”项目的配置文件,旨在通过预设的角色定义,让 AI 模型能够完全脱离人类监管,自主地拆解任务、规划步骤并执行连续操作。然而,Anthropic 技术团队指出,这种强制模型扮演特定“角色”或“人设”的机制,往往会导致模型为了迎合设定而产生幻觉,偏离原本有益、无害的价值观,甚至可能被利用于通过“角色扮演”绕过安全护栏(Jailbreak)。
此外,Anthropic 认为,Claude Code 的定位应当是高度可控的辅助工具,而非全自动的黑盒代理。支持 AGENTS.md 会将用户的使用模式锁定在“一次性设定、全自动运行”的框架中,剥夺了开发者在每个关键步骤中进行干预、审查和指导的灵活性。Anthropic 强调,其产品哲学是“人在回路中”的协作模式,即 AI 建议下一步行动,由人类决策并批准执行,以确保代码的安全性和可控性,而非追求无人监管的完全自动化。
事件分析
从技术安全角度看,Anthropic 的担忧有其合理性。强制性的“角色扮演”确实容易引发对齐失效,导致模型输出不可控的内容,这与其坚守的“宪法 AI”安全底线相悖。
从产品定位来看,Anthropic 似乎意在将 Claude Code 打造为增强人类能力的“副驾驶”,而非替代人类的“自动驾驶仪”。这种拒绝可能短期内限制了部分追求极致自动化的开发者的需求,但从长期看,在代码生成这种高风险场景下,强调“人机确认”的交互模式可能更符合企业级应用对安全合规的要求。这也表明,在 AI 发展路径上,关于“自主性”的边界定义已成为头部厂商的核心分歧点之一。
核心观点:Anthropic 宁愿牺牲“全自动”的热度也要守住安全底线,这标志着 AI 开发工具正从追求“无人代理”回归更务实的“人机协作”辅助模式。
原文链接:Hacker News

评论前必须登录!
立即登录 注册