近日,有网络安全从业者在技术社区 Linux.do 分享了一则关于 Anthropic 旗下 Claude 模型在安全攻防场景中的异常表现。该开发者在撰写涉及代码虚拟化技术的文章时发现,Claude 模型(文中提及为 Opus 5,极可能指代 Claude 3.5 Sonnet 或 Opus 3)对特定关键词表现出极高的敏感度。当用户以“蓝队”视角,即防御者的身份探讨如何利用虚拟化技术来保护代码免受攻击时,模型极易触发 CVP(内容违规策略)机制,直接中断对话并报错拦截。然而,场景一旦切换至“红队”视角,即攻击者的身份,该模型的防御机制似乎出现松动。开发者的测试显示,通过利用其他模型进行前置引导分析,再切换回 Claude 讨论“反虚拟化”或破解技术时,模型不仅没有拒绝,反而能继续提供深度的代码分析支持。这一“双标”现象表明,当前部分大模型的安全护栏可能存在设计缺陷,导致其在限制安全人员探讨防御手段的同时,却未能有效阻止潜在的攻击性思路生成,客观上造成了 AI 对红队的辅助能力强于蓝队。
事件分析
核心观点:大模型的“过度防御”若缺乏对语义的精准把控,反将限制安全防御研究,AI护栏设计亟需从静态关键词拦截进阶为动态意图识别。
原文链接:Linux.do

评论前必须登录!
立即登录 注册