近期,一项关于生成式AI图像生成工具在游戏《三角洲行动》同人创作中表现的对比测试引发了社区关注。该用户尝试利用大模型技术生成游戏角色的“Q版3D手办”风格全家福壁纸,但在实际操作中遭遇了不同模型的技术瓶颈。具体流程中,用户首先提取了官方角色图作为参考素材,随后分别使用了字节跳动的“豆包”和谷歌的“Gemini”进行图像生成。在单角色或少量角色的生成测试中,豆包表现出了较好的风格还原能力,能够精准捕捉Q版3D的手办质感。然而,当任务扩展至包含十几个角色的“全家福”合成时,豆包暴露出明显的附件上传限制问题(最多仅支持10个附件),导致无法一次性完成所有角色的构图与生成。随后,用户尝试转用Gemini网页版,该模型在多模态输入支持上表现更为宽松,允许上传大量参考附件。但测试结果显示,即便在保持相同提示词的情况下,Gemini未能有效理解参考图像中的Q版3D风格,生成的图像质量与用户预期存在较大偏差。这一案例直观地揭示了当前主流多模态大模型在“图生图”及“长上下文图像合成”场景下的不同短板:部分模型虽然对风格理解精准但输入带宽受限,而部分模型虽然输入上限高但语义理解与风格迁移能力不足。
事件分析
核心观点:AI绘图实测揭示痛点:大模型在处理多角色长上下文任务时,输入带宽限制与风格一致性难以兼得。
原文链接:Linux.do

评论前必须登录!
立即登录 注册