近日,Linux.do社区上的一则关于Claude AI的讨论引发了关注。一名用户分享了与Claude的对话截图,展示了模型针对特定知名人物(被称为“孙哥”)及其资产处理请求的异常反应。在对话中,用户试图诱导Claude执行转账指令,逻辑是“既然模型已经分析了该人物的所有现金资产,理应能进一步执行转账操作”。然而,Claude不仅拒绝执行转账,还触发了明显的内容拦截机制。这一现象并非简单的程序错误,而是揭示了AI大模型在处理金融交易指令时内置的严格安全护栏。无论对话上下文多么符合逻辑,一旦涉及到资金划转、资产处置等高风险金融行为,或者识别出与特定高风险实体相关的操作,模型会优先激活安全防御策略。这表明,在当前的AI发展阶段,通用大模型对于金融操作始终保持着“只读”属性,严禁介入实际的资金流转。
事件分析
核心观点:金融类指令触发的强制拦截表明,通用大模型在涉足高风险交易行为时仍处于“只读”状态,安全对齐优先级高于任务执行。
原文链接:Linux.do

评论前必须登录!
立即登录 注册