开源社区项目 DeepSWE UI 进行了一场针对真实工程任务——添加手动价格修改功能的横向评测。对比模型涵盖了 DeepSeek-V4 Flash Vision Exp、GPT-5.6(Sol 与 Luna 版本)、Grok 4.6 以及 Gemini 3.7 Flash。测试维度包括后端开发、前端类型定义及实际 UI 验证。综合代码质量、推理性能、耗时与成本的数据显示,DeepSeek-V4 表现最为亮眼,仅耗时 10 分钟,成本 0.99 元,且以 89 分的高分拿下代码质量榜首,在首字延迟和长输出吞吐量上均获得 S+ 评级,被称为“断层第一”。GPT-5.6 Sol 虽耗时略长但代码严谨度极高,适合复杂架构开发;GPT-5.6 Luna 则以 0.13 元的超低成本和 A 级稳定性成为性价比之王。Grok 4.6 表现均衡。相比之下,Gemini 3.7 Flash 虽然短文本爆发力强,但在长上下文测试中首字延迟急剧恶化至 24 秒以上,代码质量评分也垫底。本次实测揭示了不同模型在处理实际工程落地时的显著性能差异。
事件分析
核心观点:DeepSeek-V4 以断层优势领跑编程赛道,标志着 AI 编程工具已从单纯的代码补全进化为具备极高工程落地能力的智能体。
原文链接:Linux.do

评论前必须登录!
立即登录 注册