一位开发者在Linux.do论坛分享了自己开发2048游戏AI的项目进展。该项目大量借鉴了围棋AI KataGo的训练思路,采用自博弈强化学习方式训练。当前模型为64通道、6层残差网络的小型模型,网络采用Value(价值)与Policy(策略)双头设计,训练数据规模为200万条,已完成2轮训练。在实际对局测试中,神经网络与MCTS(蒙特卡洛树搜索)的混合策略在每步64次模拟的配置下,棋力已经超过无经验的新手玩家。开发者表示,项目目前已完成理论验证跑通,下一步计划先将6层残差网络模型(此处b指ResNet层数而非参数量Billion)训练至接近满分的水平,随后再扩展残差层数与输入通道数,以提升模型能力上限。项目的最终目标是实现纯神经网络一步输出,即完全摆脱搜索过程,仅通过一次前向传播直接给出决策结果,这是对AlphaZero系列技术路线的进一步极致化探索。该内容发布于Linux.do论坛,目前处于项目早期阶段,开发者表示后续将继续推进模型扩展训练,进展值得关注。
事件分析
核心观点:AlphaZero式自博弈训练门槛已降至个人开发者可及,小模型加搜索蒸馏正成为AI技术平民化的缩影。
原文链接:Linux.do

评论前必须登录!
立即登录 注册