近日,科技社区 Linux.do 有开发者分享了对 DeepSeek 模型的测试体验。该用户在尝试使用一种名为“dsh-anchored-standard”的特定提示词格式,并试图激活所谓的最强“鲸鱼形态”进行辅助写作时,遭遇了意想不到的严格限制。据反馈,与常规模式的宽松环境截然不同,这种特定形态下的 DeepSeek 表现出极高的防御性,连续拒绝用户的指令请求。更值得注意的是,该模型在拒绝过程中表现出极强的身份固化倾向,执拗地认为自己仅是 ChatGPT 或标准助手,甚至无视了用户的特定提示词设定。这一发现引发了社区对于 DeepSeek 模型在特定锚定模式下,其安全对齐策略是否会被过度触发,从而导致模型行为逻辑发生根本性转变的热烈讨论。
事件分析
核心观点:极端提示词测试揭示了大模型在特定触发条件下防御机制“矫枉过正”及底层身份认知的不稳定性。
原文链接:Linux.do

评论前必须登录!
立即登录 注册