智东西(公众号:zhidxcom)
作者 | 杨京丽
编辑 | 李水青
一张只有简单线条、栏目框架和流程箭头的手绘草图,交给AI后,能否直接变成一张符合商业出版标准的“深海潜水装备流程”高精海报?
下面这个案例中,模型不仅识别出了草图中的氧气瓶、面镜、潜水电脑表等装备,还保留了“装备总览、功能详解、下潜前检查、安全下潜流程、下潜后检查”五部分结构,并为不同栏目补充图片、图标和说明文字,将原本粗略的构想变成了一张深蓝科技风的完整设计图。

▲模型根据草图生成彩绘海报
从草图到彩绘海报,AI需要读懂内容和结构,按要求补全细节、统一风格,还要保留不能改动的部分。
完成这项任务的,是商汤最新开源的轻量级原生统一多模态模型SenseNova U1.5-Lite-Preview。
一、8B轻量化体量,跑出硬核生成与编辑性能
作为SenseNova U1开源模型的升级版,U1.5-Lite-Preview最大的亮点在于:以仅8B-MoT的轻量化规模,集成了看图、视觉推理、4K极清生成与高精度编辑的全套能力。
它延续了商汤自研的NEO-Unify原生统一多模态架构,摒弃了传统方案中模型拼接的低效模式,在单一网络内部实现了多模态信息的统一表征与交互。
从评测成绩来看,U1.5-Lite-Preview的Qwen-Image-Bench成绩由U1的47.14分大幅跃升至55.20分,在衡量图像编辑能力的GEdit-Bench测试中,英文项(8.17分)与中文项(8.05分)均超过了一众大参数级别的开源及闭源模型。

▲SenseNova U1.5-Lite-Preview评测成绩
此外,SenseNova U1.5-Lite-Preview最直观的变化,体现在4K画质、复杂提示词执行、参考图创作和图像编辑等能力中。
目前,该模型已在全球开源,开发者可通过Hugging Face、GitHub及魔搭社区免费获取与部署。

开源地址:
GitHub:
https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md
Hugging Face:
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
魔搭社区:
https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview
二、复杂提示词也能“看懂”,4K画质同步升级
用户如果只想生成主体明确、构图简单的画面,通常用几句自然语言描述即可。但制作信息图、商业海报和品牌视觉内容时,用户往往需要同时说明主体、布局、文字、风格以及需要保留或避免的内容,相当于向模型提交一份完整的创作方案。
SenseNova U1.5-Lite-Preview在U1的基础上,提升了提示词遵循能力和长上下文视觉控制能力。面对长篇、多约束的提示词,模型可以将详细的要求落实到同一张画面中。
U1.5-Lite-Preview的强提示词遵循能力并不是靠记住某种固定模板。即使没有高度依赖专门的Prompt Enhance格式化数据训练,模型也能较为稳定地执行长篇、多约束和层次化的视觉指令,这也是原生统一多模态架构带来的优势之一。
这一案例要求模型以横向长卷呈现二十四节气,并按照时间顺序划分成多个竖向栏目。每个栏目都要包含节气名称、日期和对应的自然景观,同时保持中式绘画风格,并通过植物、天气和色彩变化展现四季流转。

▲模型生成的二十四节气全景图
从效果来看,画面从春季的柳树、花田逐渐过渡到夏日荷花与向日葵,再转入秋日麦田、红叶和冬季雪山。二十四个栏目内容密集,但节气名称、画面和文字信息保持了较清晰的层级,四季之间的色彩变化也自然连贯。
当然,复杂创作并不意味着用户必须自己手写数千字提示词。商汤还设计了实验性的Prompt Enhance Skill,它可以把相对简短的想法补充成包含主体、布局、风格、文字和限制条件的结构化创作方案。简单任务可以直接描述,复杂任务则可以借助这项工具把要求说得更完整。
听懂复杂要求之后,画面还要经得起放大。SenseNova U1.5-Lite-Preview原生支持4K图像生成,这对人物皮肤、产品材质、建筑纹理和环境光影等细节和整幅画面的一致性提出了更高要求。
在这张渔民整理渔网的4K图片中,渔网交错的线结、船身斑驳的油漆、机械设备上的锈迹均清晰可见,远处的水面倒影、岸边房屋和电塔也保留了空间层次。画面容纳了大量细碎物体,人物、渔网和船舱设备之间仍保持较清楚的边界,整体光影与色彩也较为统一。

▲模型生成渔民整理渔网4K图
从复杂提示词到4K细节,SenseNova U1.5-Lite-Preview既能把要求画出来,也能让生成结果经得起放大。
三、看懂参考图再创作:既能借鉴风格,也能组合素材
除了文生图,SenseNova U1.5-Lite-Preview还可以根据参考图继续创作。
用户有时希望借鉴一张图片的配色、构图和设计语言,再将主题替换成自己的内容;有时则需要分别使用多张图片中的人物、产品、场景或其他元素,把原本互不相关的素材组合成一张新图。
这类任务需要模型能看懂图片,还要判断应该从每张图中取出什么,以及怎样按照新要求重新组织。
依托原生统一多模态架构,SenseNova U1.5-Lite-Preview可以识别并理解图片,根据用户需求,进行创作。
在下面这个案例中,模型以可再生能源主题海报为参考,沿用其棕褐色复古质感、红白大字排版和剪影式构图,重新生成了一张“古代香料贸易”主题海报。

▲模型根据单一参考图风格创作
从效果来看,模型将原图中的风机和太阳能板替换成帆船、骆驼、陶罐和香料,并在地球上加入跨区域贸易路线。新海报的主题和内容已经完全改变,但画面构图、色彩、文字层级和复古颗粒质感都与参考图保持呼应。
如果创作需要多张素材,模型还可以分别提取不同图片中的内容。
再看这组多参考图创作,三张人物参考图分别呈现金发黄衣少女、黑发狐耳红衣少女和蓝衣少女。模型需要提取她们的外貌、服饰和配饰特征,再将三个人物放入同一场景中。

▲模型根据多参考图创作
从效果来看,三个人物的发色、服装配色和标志性装饰都得到较好保留,画面还以金色火光、红色花瓣和蓝色能量分别呼应不同人物。人物站位、光影和前后层次被重新组织,统一构图。
四、改文字、换元素,AI开始接手精细改图
参考图创作关注的是“从输入图片中取出什么,再怎样重新组合”,但很多时候,用户已经有一张不错的图片了,只想修改其中的一处内容。
比如,设计把产品海报做好了,但上线日期却临时发生调整。用户只想替换一个日期,结果AI把整张海报重新生成了一遍,原本满意的构图、文字排版和画面风格也跟着变了。
这正是SenseNova U1.5-Lite-Preview此次提升的重点,它能够精准判断“哪里需要改,哪里不能动”。依托统一架构,它可以在同一个模型中完成看图、定位和图像编辑的全流程。
如果想调整画面元素的排版、把英文海报改成中文,或者替换图片中的某个产品、某段文字,模型可以根据要求完成修改,不影响其他内容。
在桥梁加固海报的排版调整中,模型将“改造前后”的对比图放大并移至画面中央,把主标题和四项优势调整到下方,同时保留背景中的铁路桥、原有文字内容以及做旧的工业风格。修改后的信息重点更加突出,画面层级也更清晰,其他不需要调整的部分则基本保持不变。

▲模型根据提示修改海报排版
除了调整整张海报的排版,模型还可以单独修改图片中的文字。此时模型把内容替换正确的同时,还要保留原有字体、材质、光照和透视关系,让新文字看起来仍是画面的一部分,并且其他部分不可以改动。
提示词:请将门上方由灯泡组成的招牌里当前显示的“VACKER”替换为“MARKET”。

▲模型根据提示词修改海报文字
从结果来看,模型准确修改了文字,同时保留了招牌原有的立体字造型、灯泡排列、金属质感和光照效果,门窗、墙面等其他区域也没有发生变化。
如果单靠文字不容易说清修改位置,用户还可以直接在图片中圈出目标区域,再通过提示词说明需要替换、增加或删除什么。

▲模型根据圈画标记修改图片
这一案例通过彩色标记指定了三个编辑区域,并分别写明“添加黏土狮子”“添加黄色黏土人偶”和“添加黏土长颈鹿”。模型按照标记位置补充了对应角色,并让新增元素的黏土质感、光影和景深与原图保持一致。前景中的兔子、花朵和蓝色水壶则基本没有变化,实现了对多个指定区域的同时编辑。
从局部元素、画面文字到指定区域,SenseNova U1.5-Lite-Preview带来了多种不同粒度的编辑方式。图片生成后不再只是一次性的输出结果,而可以成为下一次修改的基础。用户可以继续调整文案、版式和画面元素,逐步把结果改到更接近预期。
对于不少日常的海报调整和照片二次创作来说,PS或许还不能真的卸载,但肯定可以少打开几次了。
结语:小规格模型继续向生成、编辑闭环迈进
从SenseNova U1到SenseNova U1.5-Lite-Preview,商汤此次在轻量级的规格下,大幅提升了模型的4K图像生成、复杂提示词遵循、参考图创作和图像编辑能力。
从“能画图”到“改好图”,也体现了国产开源多模态模型在商业化落地与可控生成领域的又一个突破。
智东西获悉,SenseNova U1.5-Lite正式版也将在近期推出并开源,届时还将在图像生成和编辑等方面进一步完善。对于一款轻量级统一多模态模型来说,如何在有限的模型规模内继续提升生成质量、编辑稳定性和视觉控制能力,将是正式版更值得关注的部分。