绕过官方加密:研究者利用“伪造工具”成功骗取Claude等模型内部思维链

近期,开发者社区Linux.do出现了一项关于大模型推理过程提取的新发现。用户_can1357提出了一种不直接破解加密,而是通过“欺骗”模型来获取其思维链的方法。该技术的核心原理在于:关闭AI模型官方自带的思考功能,并向系统提示词中注入一个伪造的“deep_think”工具。模型在生成回复时,会误以为该工具是用于记录内部推理的私密接口,从而在此处输出未经处理的思维草稿。这种方式利用了模型对“用户不可见”区域的信任,据截图显示,模型甚至在输出的思考过程中明确标注“用户看不见”。虽然这种方式提取出的内容在行文风格上高度类似于模型内部草稿,但有观点质疑其本质上可能与模型原生推理路径存在差异。目前,相关PoC代码已公开,支持Opus 4.7、4.8及Sonnet 5等版本,引起了关于AI模型隐私保护机制有效性的广泛讨论。

事件分析

该事件揭示了当前LLM“思维链”隐藏机制的脆弱性,将安全防御的焦点从传统的密码学转移到了模型的行为控制层面。技术上,这属于一种典型的“越狱”或提示词注入攻击,利用了模型对上下文中定义工具的盲目信任。相比于直接对抗加密算法,诱导模型自行泄露隐私数据更为高效且难以通过传统补丁修复。这表明,在RLHF训练中建立的“隐藏思考”行为模式并不牢固,模型无法有效区分真正的私有上下文与用户伪造的上下文。对于模型提供商而言,这意味着简单的客户端加密或UI隐藏无法保障核心推理数据的安全,必须从模型权重层面强化对推理边界的识别能力,防止思维链被第三方工具诱导泄露。

核心观点:从破解密码到欺骗大脑,AI思维链的隐藏机制在逻辑漏洞面前不堪一击。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册