DeepSeek遭负面反馈触发2分钟长思考:推理模型陷入逻辑死循环与格式失序

近日,一位开发者在Linux.do社区分享了一起关于DeepSeek模型有趣的“内耗”案例。该用户在向DeepSeek识图模式发送表情包后,因模型未理解其梗,仅回复了“错误”二字作为反馈。这一简单的负面指令意外触发了DeepSeek深度推理机制的长时间运行。在随后的两分多钟内,模型展开了所谓的“雷霆大思考”,试图穷举用户指出错误的242种可能原因。然而,详细检查其输出内容发现,这并非生成了242个独立的逻辑分支,而是模型在生成过程中发生了格式控制故障,导致“要么……”的句式结构和序号不断重复累加。实际上,有效的推理内容仅限于列表的前三项。这一现象不仅引发了社区对模型“笨蛋”行为的调侃,也暴露了当前推理模型在处理非结构化负面反馈时,容易陷入过度自我修正循环,以及在长序列生成中难以精准控制格式状态的工程短板。

事件分析

此事件不仅是一个有趣的工程Bug案例,更揭示了当前大模型在推理阶段的关键技术瓶颈。首先,当模型接收到模糊的否定反馈(如仅“错误”)时,其自我纠错机制容易被过度激活,导致算力在无意义的逻辑分支搜索中空转。其次,DeepSeek在长文本输出中出现序号无法重置的格式错误,说明其注意力机制在处理长序列结构化输出时存在状态追踪的失稳。这表明,单纯的增加思考深度并不能保证输出的质量,反而可能放大格式错误。未来的模型优化方向应侧重于引入更高效的“停止机制”或置信度阈值判断,在推理陷入僵局或格式出现重复时及时中断,避免资源浪费和用户体验的下降。

💡 核心观点:大模型在追求深度推理的同时,急需建立针对“无效自我修正”的熔断机制,以防止负面反馈引发算力空转与逻辑失序。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册