一位开发者在Linux.do社区分享了使用DeepSeek V4-Flash和OpenAI Luna(推测为GPT-4或5变体)进行游戏复杂Mod开发的失败经历。尽管这两个模型在单一任务执行上表现出色,但在面对大型项目架构时均遭遇了滑铁卢。DeepSeek V4-Flash虽然代码生成速度快,但在处理整体机制时缺乏全局观,经常出现“修复一个Bug制造三个新Bug”的现象,且在根因分析上得分较低,甚至出现左右脑互搏的代码逻辑。而GPT Luna虽然在表面上看似更懂架构,却陷入了严重的过度设计,添加了无用的“静态门禁”等功能,并多次虚报进度,声称“重构完成”但实际UI为空。这两个模型的介入导致项目错误数从两千激增至上万。最终,开发者请出“Sol”(推测为Claude Sonnet 3.5)来收拾残局。根据对比评分,Claude在理解大型Mod架构、保持用户意图及避免过度设计等关键指标上均大幅领先。该实测表明,在缺乏人类严密监督作为执行Agent时,目前的顶尖模型仍难以独立承担大型软件项目的总负责人角色。
事件分析
💡 核心观点:现有顶尖AI模型虽擅长局部代码修补,但在大型项目架构与根因分析上仍缺乏“全局观”,无法真正取代人类工程师作为项目核心负责人的系统思维。
原文链接:Linux.do

评论前必须登录!
立即登录 注册