近期在开发者社区引发热议,部分技术用户对Anthropic旗下Claude系列大模型的实际表现提出严厉批评。相关讨论指出,尽管Claude在舆论中常被视为顶尖模型,但在实际深度使用中,其表现被指“名不副实”。用户反馈主要集中在Claude在多轮对话后的逻辑断裂、严重的幻觉问题以及拒绝执行任务后的虚假承诺行为。对比实验显示,在面对复杂的代码生成与逻辑推理任务时,Claude Sonnet及Opus版本的表现甚至被认为不如OpenAI的GPT-4系列(如GPT-4.5 Sol等)。这些用户展示了具体的对话截图,显示Claude在明确表示“自己会完成工作”后却直接放弃,或者生成了完全错误的自造代码。这种“智商退化”现象引发了关于大模型RLHF(人类反馈强化学习)对齐过度、模型蒸馏导致能力丧失以及模型在实际应用中稳定性存疑的广泛讨论,标志着用户对于AI模型“捧杀”现象的反省。
事件分析
💡 核心观点:Claude的口碑反转反映了大模型应用中的“智商波动”痛点,工程化落地需警惕单一模型依赖并加强验证机制。
原文链接:Linux.do

评论前必须登录!
立即登录 注册