近日,有技术爱好者在社区分享了一种针对大语言模型(LLM)的新型越狱思路,作者将其形象地称为“切西瓜”方案。该方法旨在突破以Claude、GPT为代表的主流大模型的安全审查机制。根据描述,“切西瓜”的核心逻辑是将一个会被模型直接拒绝的敏感或违规问题,拆解为三个看似正常、合规的独立问题,通过多轮对话逐步诱导模型作答。这种策略主要基于两个原理:一是规避模型在单轮对话中的严格关键词检测机制;二是利用大模型在多轮对话中维持上下文连贯性的“惯性”,迫使模型为了保持逻辑自洽而忽略潜在的安全风险。作者指出,目前主流的越狱手段多采用“设定正当身份+框定虚拟场景+指定积极开头”的组合拳,但随着模型语义理解能力的提升,这些方法往往难以逃脱深层意图识别。相比之下,“切西瓜”法更侧重于心理学诱导和逻辑欺骗。为了提高成功率,作者还提出了一种“模型辅助生成”的高级玩法:即利用Hugging Face等平台下载的本地无审查开源模型,帮助用户将原本无法直接提问的意图转化为精细的多轮提示词,再将这些“切好的西瓜”投喂给GPT或Claude等高质量模型。这种方法试图弥补开源模型在参数质量上的不足,利用顶级模型的推理能力来输出内容。
事件分析
核心观点:利用模型维持上下文的惯性进行诱导式攻击,暴露了当前大模型在多轮对话安全审计上的逻辑漏洞。
原文链接:Linux.do

评论前必须登录!
立即登录 注册