8B小身量画出4K长卷,商汤开源U1.5-Lite-Preview
商汤原生统一多模态进阶版SenseNova U1.5-Lite-Preview开源。

SenseNova U1.5-Lite-Preview以8B-MoT(Mixture-of-Transformers)的轻量身量,将能力推进到4K、更精细的真实质感、更复杂的视觉控制生成和可持续迭代编辑,拿下了比肩商用闭源模型的评测成绩。
写得细,画得准
海报、信息图、品牌视觉,一张图上往往排着一串要求。主体是谁,怎么互动,元素摆在哪,什么风格,写哪些文字,哪些必须保留,哪些必须避开。
U1.5-Lite-Preview重点打磨了对长篇自然语言、结构化创作指令的理解。简单需求,几句大白话就能出图;复杂任务,把要求写完整,模型按视觉结构执行。
下图是一张背包产品解析信息图,prompt长达1675词,约束包括复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注。

模型执行长指令的本事,不靠背模板。训练并没有高度依赖专门的Prompt Enhance(提示词增强)格式化数据,模型依然能稳定执行长篇、多约束、层次化的视觉指令。原生统一多模态路线下,模型学会的是从语言描述到视觉结构的原生映射能力。
为了降低门槛,商汤还配套了实验性的Prompt Enhance Skill(提示词增强技能)。它把用户简短的想法,自动整理成包含主体、布局、风格、文字和各项约束的完整创作方案,再交给模型执行,少写漏需求。
4K,经得起放大
4K对细节、材质、光影、整体一致性的要求更高。自然风光、商业摄影、产品海报、超宽幅长卷,都要有真实的材质质感与光影层次。
还记得那张由SenseNova U1 Pro生成的8k WAIC九周年《智会世图》吗?

局部放大后文字、线条、图标及模块关系依然清晰。

下图是轻量版U1.5-Lite-Preview生成的WAIC发展历程长卷,横跨2018至2026年,原图分辨率是4K,长宽比10:3,prompt总长3880词。

长卷借用传统中国山水长卷的散点透视和连续叙事。上海城市、智慧交通、云计算、智能工厂、大模型、生成式人工智能、具身机器人、智能体和未来城市,融进同一片山河。
常规尺寸下,真实感也明显提升。
海岸游客中心概念图里,木纹、水面、黄昏光影层层分明。

路边女生,车辆背景的动态模糊与人物虚实关系自然。

文字生成与版式是另一项升级。中英文文字、复杂版式组织都做了强化。
杂志内页、旅行攻略、复杂信息图,风格保持住,版式更清晰,文字更准确。
杂志内页与武康路Citywalk攻略就是例子。


哪里不对改哪里
图像编辑要读懂画面,理解意图,判断哪里要改、怎么改、哪些绝对不能动。
依托原生统一多模态架构,U1.5-Lite-Preview在同一个模型里完成视觉理解、目标定位、约束推理、像素生成的全流程,不拼接多个独立模型。encoder-free(无编码器)视觉建模,减少了固定视觉编码器带来的信息压缩与表征瓶颈,文字笔画、局部纹理、空间结构保留得更完整,编辑准确度、画面稳定性、可控性随之提升。
创作从一次性的重新采样,转向可持续迭代的视觉操作。在当前结果上持续改文案、调版式、补元素,一次抽卡不行就重来的日子,换成反复修改、改到满意。
目前覆盖的主流创作工作流有6类。
参考图风格与设计再创作,读懂参考图的配色、构图、材质、字体和视觉语言,迁移到新主题,也能在保留原始信息的同时,给海报和信息图做整体美化。
以青花瓷风格古建筑屋顶图鉴为例,模型借来参考图的青花水墨语言,生成一整页屋顶形制图鉴。

多参考图组合编辑,从多张参考图里分别提取人物、产品、场景和风格,完成跨图绑定、内容融合与场景重构。
例如,把水煮鱼菜单与炸鸡融合,创作新的菜品菜单,两张参考图分别提供手绘菜单风格和炸鸡成品。


单参考图条件创作,以一张人物、产品或场景图片作为视觉条件,保持主体身份、外观和关键细节,生成新的海报、信息图、营销页面。
比如人物照片简历排版。

或者用一张儿童照片生成新封面。姿势、衣服、笑容都保持住了。

信息图局部编辑,对标题、数字、图标、标注、图表和内容模块定向修改,元素增删、位置调整、局部美化、瑕疵修复,牵一发不动全身。
下图只替换主标题文字,其余版式、图标、纹理照旧。

文字编辑,可以改真实场景中的文字,原有字体、材质、透视、排版与遮挡关系不变,文字自然融入原图。
下图画面里的大字由海浪与航迹组成,换字之后海面质感不破。

交互式精准编辑,用区域标记、坐标定位、marker(标记)等方式指明编辑位置与范围,调整局部属性。图10画红框圈出日期时间,改完后红框移除,字体版式照旧。

小身量,大性能
今年4月,商汤发布SenseNova U1,首次完整展示NEO-Unify(原生统一)架构,单一模型联合建模语言、视觉语义与像素生成,原生完成视觉理解、推理和生成。U1验证了统一架构可行。

落地与社区反馈也暴露出真实痛点。生成时区域之间衔接有时不够自然,出现细微网格感、拼接痕迹、纹理断裂;分辨率继续提升,局部细节、复杂空间关系和整体一致性的建模难度加大。编辑时,编辑范围外的内容可能变化,人物身份或主体结构漂移,局部修改影响整体画面。
U1.5-Lite-Preview不盲目扩大模型规模,针对痛点做全链路优化。针对网格伪影和高分辨率细节建模,重新设计生成头,减弱视觉Token(词元)网格对最终图像的影响,训练扩展至4K分辨率。针对编辑,重新组织编辑数据与训练任务,强化对原图内容、主体身份、空间结构和非编辑区域的保持。
相比U1,新版本在4个方向上提升,原生支持4K图像生成,更精细的局部纹理与真实世界质感,更准确的中英文文字生成与复杂版式组织,更稳定的图像编辑和视觉指令遵循。
多项主流生成与编辑质量评测基准上显著超越U1,8B-MoT的轻量规模,比肩商用闭源模型。


面向专业用户的交付级创作模型U1 Pro,也正在紧密邀测,商汤将于近期对公众开放服务。
参考资料:
https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
https://github.com/OpenSenseNova/SenseNova-U1
END
点击图片立即报名👇️


