近日,在开发者社区 Linux.do 上,一项针对大模型代码生成能力的对比测试引发了关注。技术爱好者利用 zcode 接入 OpenRouter,让多个主流大模型尝试从零编写一个网页版《我的世界》(Minecraft)克隆版。实测结果显示,被称为“牛来”的推理模型(通常指代 DeepSeek R1 或类似强推理模型)表现最为出色,其生成的代码在地图生成逻辑、人物移动控制以及方块的放置与破坏等核心交互功能上均运行流畅,没有明显 Bug。相比之下,DeepSeek V4 Pro 0813、Kimi k3、GLM 5.3 以及 Opus 5 等受测模型在处理此类复杂游戏逻辑时稍显逊色。测试者指出,虽然目前免费模型在长代码生成过程中存在不稳定、易中断的问题,且开发工具对模型思考强度的调节支持尚有限,但该实验有力地证明了新一代推理模型在处理复杂逻辑闭环和完整应用开发方面的巨大潜力,生成的项目已具备可玩性。
事件分析
原文链接:Linux.do

评论前必须登录!
立即登录 注册