开发者自建斗地主游戏实测:大模型当游戏NPC表现不稳定

一位开发者在Linux.do论坛分享了一项实测项目:为验证Jev模型是否适合充当游戏AI,其专门开发了一款名为HoppyBop的斗地主游戏,让大模型扮演牌桌上的NPC对手。实测感受方面,作者表示结果并不理想——模型表现波动明显,有时决策显得相当聪明,有时又会做出明显的低级失误,行为难以预测。为改善这一问题,作者先后调整了多版提示词和模型调用方案,均未能显著提升决策稳定性,作者推测可能与自身使用方式有关。成本方面,每局游戏的模型调用费用约为0.001至0.002美元,作者目前使用的是平台赠送的5美元免费额度,整体消耗极低。该测试以HoppyBop斗地主游戏的形式对外开放,玩家可以坐上牌桌,完整体验叫分、抢地主、出牌的游戏流程,对手可选择两位规则型AI,或由Jev模型驱动的对手。作者邀请感兴趣的玩家自行体验,并提醒开局时需选择Jev对手选项。这次实测为社区提供了一个观察大模型在博弈类游戏中真实表现的直观案例,兼具参考价值与可玩性。

事件分析

斗地主作为不完全信息博弈,涉及叫分决策、手牌拆解、记牌与对手建模等多层推理,一直是检验AI决策能力的经典场景。此次实测暴露的问题——决策忽好忽坏、提示词调优收效有限——反映出现阶段大模型在结构化博弈推理上缺乏稳定性,其概率生成机制与游戏AI所需的严格逻辑之间存在天然张力。值得注意的是成本数据:单局0.001至0.002美元的开销,已具备商业化试水的可行性。业内目前较普遍的技术路线是大模型与规则引擎混合使用:规则系统保证决策下限,大模型负责对话、性格演绎与非常规决策。后续值得关注的是专用推理模型与思维链调优能否缩小这一差距,以及大模型NPC在开放叙事类游戏与强规则博弈类游戏中可能出现的明显表现分化。

核心观点:大模型做游戏NPC聪明与智障并存,决策稳定性不足,短期内混合规则引擎仍是游戏AI的现实路线。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册