开发者 kirenath 在 GitHub 上推出了名为 Vibebench 的开源项目,旨在通过实际的前端代码生成任务来横向评估各大语言模型(LLM)的能力。该项目提供了一个直观的展示平台,让 Claude、GPT、Gemini、Kimi、Qwen 等主流模型在完全相同的赛题下进行“One Shot”(一次性)编程挑战,并将生成的 HTML 代码结果进行并列展示。Vibebench 强调“消费者视角”,打破了传统基准测试仅面向厂商或研究者的局限,不仅关注 API 调用表现,更涵盖手机 App、Web Chat 等真实使用渠道。项目收录了 120 多个涵盖工具类、视觉类、游戏类及算法类的前端赛题,共计 260 多个测试阶段。其核心理念是将 HTML 生成作为 AI 代码能力的“金丝雀测试”,因为 HTML 不仅能直观地在浏览器中验证结果,还能综合考察模型对 CSS、JS 及算法的理解。目前该项目已在 GitHub 和平台网站完全开源,包含赛题库、框架及所有模型生成结果,用户可直接复现或对比不同模型的风格差异。
事件分析
原文链接:Linux.do

评论前必须登录!
立即登录 注册