商汤SenseNova U1.5-Lite-Preview开源:原生4K生成与复杂排版编辑

商汤科技旗下的SenseNova(日日新)模型U1.5-Lite-Preview近日宣布开源,目前主要开放了权重文件。此次更新重点针对高分辨率图像生成与复杂排版进行了底层重构,通过重新设计图像生成头并扩展训练至4K分辨率,显著改善了局部纹理、材质表现及光影一致性,有效解决了视觉Token网格痕迹和拼接缝问题。U1.5大幅增强了中英文文字生成能力,能够精准处理海报、信息图中的复杂布局,并支持通过长提示词或JSON结构化指令进行精细控制。在编辑能力方面,该模型支持多种操作,包括基于参考图的风格重绘、多图元素重组、信息图局部修改(如标题、数字、图表)以及现实场景文字替换等。官方Benchmark数据显示,相比上一代U1,新模型在多项指标上有约10%至17%的提升。目前模型在短提示词理解、小字号文字渲染及人物面部细节等方面仍有改进空间。

事件分析

此次SenseNova U1.5-Lite的开源标志着开源图像生成模型正从单纯的“文生图”向“设计生产力工具”演进。不同于以往模型主要关注艺术风格,U1.5明确强化了4K高分辨率下的结构化排版与多轮连续编辑能力,直击商业设计场景中海报与信息图制作的痛点。通过支持结构化指令和局部编辑(如保留材质、透视的修改),该模型大幅降低了生成的随机性,提高了工业场景的可控性。在当前AI图像生成领域竞争激烈的背景下,商汤将“生成”与“编辑”深度整合,填补了开源模型在精细化迭代修图方面的空白,这对于推动AI设计工作流的实际落地具有重要意义。

💡 核心观点:开源图像模型竞争进入深水区,U1.5以4K原生生成与结构化编辑能力,尝试填补从“一次性生成”到“专业设计工具”的关键缺口。

原文链接:V2EX 分享发现

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册