Linux.do 社区曝光了一组多模型代码审查的对比数据,测试场景为各模型编写代码后由 Sol 模型自动进行 Review。数据显示,不同模型在缺陷拦截与收敛轮次上表现迥异:muse-spark 发现缺陷最多(37 个),但耗时较长,聚焦于 UI 交互与状态机等复杂逻辑;DeepSeek-v4-flash 以 6 个高准确性 findings 脱颖而出,专注于安全正则与异步竞态,如 HTML 标签绕过等高危漏洞;GPT-5.6-sol 在工程规范与架构契约上表现稳健;Gemini-3.7-flash 执行速度极快,擅长补齐边缘分支逻辑。相比之下,GLM 与 Kimi 主要用于常规维护,拦截率为零。
事件分析
核心观点:AI编程正从单一代码生成向多模型专业化分工演进,DeepSeek等模型在安全审查上的精准度将成为智能体工作流的关键一环。
原文链接:Linux.do

评论前必须登录!
立即登录 注册