据Linux.do社区用户发布的实测帖,Facebook推出的Muse模型是一款典型的多模态生成模型,具备图片、音频和视频生成能力。发帖者对该模型进行了实际测试并分享了第一手使用体验。在图片生成方面,Muse的表现与Grok、Gemini的质量相当,处于第一梯队,但未达到顶级水平。在视频生成方面,Muse略优于Gemini和Grok,但与字节跳动的Seedance 2.0仍有明显差距,大致处于1.5梯队的水平。该模型的主要短板在于中文支持欠佳,生成内容带有较重的台湾地区口音,这也是发帖者对其评分不高的主要原因。此外,帖子中展示的GIF图片清晰度受限,是因社区平台存在文件大小限制,模型原始生成内容的实际清晰度较高。整体来看,此次测试为社区用户了解Meta旗下最新多模态生成模型的能力边界提供了直观参考,尤其是其与Grok、Gemini、Seedance等主流生成模型的横向对比结论,具有一定的选型参考价值。
事件分析
核心观点:Meta携Muse入局统一多模态战场,视频能力可圈可点,但中文短板暴露其全球化模型难以兼顾本地化市场的困境。
原文链接:Linux.do

评论前必须登录!
立即登录 注册