智东西(公众号:zhidxcom)
作者 | 毕伟豪
编辑|漠影
时常会有人感慨,各种生图模型让人眼花缭乱,但一到真正交稿时,还是免不了反复“抽卡”。好不容易挑到一张满意的图,改个字、换个元素,又得重新开始。
抽到一张好看的图,和完成一项工作,毕竟不是一回事。
在真实工作中,做一张图往往只是任务的一部分:公众号文章需要封面和多张配图,企业招聘需要海报、易拉宝、折页等一整套物料,设计过程中还可能随时需要改文字、换人物服装、调整局部元素。
这也意味着,办公场景中的生图需求,对模型提出的要求已经不只是画面效果。它需要理解上下文和用户意图,处理已有素材,组织图片中的信息与版式,并在发现问题后继续修改。信息要完整,设计要美观,修改要可控,几件事缺一不可。
带着这个问题,智东西对商汤日日新SenseNova U1 Pro进行了多轮实测。相比单次给定提示词生图,U1 Pro更强调围绕任务目标组织创作流程,将需求理解、生成、编辑和调整衔接起来,一次性完成交付。
我们先从海报、漫剧人物和潮玩设计入手,再让U1 Pro为公众号文章配图、制作成套秋招物料,最后测试换装、多参考图融合和局部修改。想看的不仅是它能不能把图做好,更是它能否理解各种真实工作下的要求,让成果逐步接近交付。
今天,SenseNova U1 Pro正式版已上线商汤小浣熊提供生成体验,本次测试也通过商汤小浣熊、SenseNova Studio来完成。同时U1 Pro还面向企业客户提供API服务。

一、音乐节海报、漫剧人物、潮玩设计,先看U1 Pro能不能把图做好
生图模型真正进入工作场景,首先要过的还是视觉效果这一关。
一张海报好不好看、人物设计是否统一、产品概念图有没有设计感,这些看起来比较基础的需求,背后同时涉及构图、色彩、字体、材质以及信息层级。
因此,智东西先从三个相对独立的设计任务切入,看U1 Pro面对不同类型的视觉创作需求时,能不能理解设计意图,并创作出有风格和审美的图。
首先我们从很多年轻人喜爱的音乐节、演唱会入手,让U1 Pro生成一张兼具潮流感和现场氛围的说唱音乐节海报,提示词里给出了音乐节主题、时间地点、视觉风格和需要呈现的核心信息,整体构图、字体设计和视觉元素安排则交给模型自主完成,提示词如下:
为一场年轻人说唱音乐节设计一张宣传海报,主题突出街头、潮流、音乐现场感,画面包含主标题、举办时间、地点、艺人信息等核心文字,并加入舞台灯光、说唱人物等视觉元素。整体采用具有年轻潮流感的设计语言,突出主标题,建立清晰的信息层级,保证文字准确、易读,同时让人物、字体、背景和装饰元素形成统一的视觉风格,最终呈现一张可以直接用于音乐节宣传的完整海报。
从结果看,海报蛮有设计感。大幅标题、舞台灯光和人物形成了视觉中心,也把街头气息和现场氛围带了出来。模型还补充了提示词中没有给定的活动信息,不过这些显然属于设计样稿。这一轮我们主要观察的是画面构图与信息排布,U1 Pro的整体设计相当不错。

第二个任务,我们让U1 Pro为东方幻想题材的AI漫剧设计一个主角设定图,包括人物名称、身份、性格、服装等信息,提示词如下:
为一部东方幻想题材的AI漫剧设计一名核心主角的人物设定图,保证文字准确性。角色定位为年轻的东方幻想冒险者,设计完整的人物形象,包括发型、面部特征、服装、配饰、武器和整体配色,并通过服装材质、细节纹样和道具体现角色的身份与性格。整体风格兼具东方幻想元素和现代动画审美,人物需要具有鲜明的视觉辨识度。画面采用专业角色设定集形式,以人物全身像作为主体,同时展示人物的局部细节,如面部、服装纹样、武器或关键配饰,并在画面中合理加入角色名称、身份、性格、能力等设定信息。要求人物主体、局部细节和文字信息之间具有清晰的视觉层级,字体易读、排版整洁,所有文字准确无误;人物各部分造型保持一致,不出现服装、配饰或武器前后不一致的问题。最终呈现一张具有完整世界观和专业角色设定集质感的AI漫剧主角设计图。
下面展示的就是U1 Pro创作的角色,人物画风、武器、建模都符合中式美学的要求,而且很有仙侠漫画的感觉。

不过,单独生成一个人物,模型只要管好这一个角色即可。如果进入真实生产流程,它必须能够在连续的创作中保持一致性,于是智东西让U1 Pro延续前面风格创作女主角设定图。

可以看到,U1 Pro生成的两名角色各有辨识度,人物立绘、局部细节和设定信息的组织方式也比较接近。角色变了,整体画风并没有明显割裂。这一轮重点看的是系列角色设计的风格连贯性,而不只是单独一个人物好不好看。
最后,我们把任务转向产品视觉设计,让U1 Pro设计一款盲盒类潮玩。这一次除了角色本身,还加了材质、配色、造型和产品展示的要求,希望结果不只是一张角色立绘,而是一张有商品展示属性的潮玩概念图,提示词如下:
设计一款高端收藏级原创潮玩产品,主题为“未来城市探索家(Future City Explorer)”。画面是一张真实的潮玩新品商业产品摄影图:一只可爱、精致、具有未来感的迷你宇航员机器人站在展示底座中央,旁边摆放产品零售包装盒,整体像真实潮玩品牌刚刚发布的一款实体收藏玩具,而不是游戏CG或AI概念图。
角色设计:机器人采用可爱的潮玩比例,大头、小身体、圆润四肢,整体比例协调,具有设计师潮玩的收藏感。头部略大,脸部是黑色嵌入式显示屏,两只圆润的大眼睛带有非常柔和的青蓝色发光效果,表情友好、可爱但不过度幼稚。身穿未来宇航服,主体以哑光白色和浅灰色ABS塑料为主,搭配少量银色金属零件、透明蓝色树脂和深灰色结构件。装甲具有真实的拼接结构、细小接缝、圆角倒角、关节结构和合理的机械连接。透明头盔具有真实透明树脂质感,可以看到内部结构。
材质必须像真实生产出来的潮玩:哑光塑料、半透明树脂、局部金属件、细腻喷涂、轻微表面纹理、自然边缘高光。不同材料具有明显但真实的材质差异,不要所有表面都高反光。
展示底座:机器人站在一个简洁的圆形收藏级展示底座上。底座采用深灰色磨砂材质、银色金属和少量半透明蓝色树脂,融入少量未来城市建筑元素,只保留几栋精致的微缩建筑,不要做成复杂巨大的城市模型。底座具有真实的产品结构、接缝和固定方式,机器人双脚自然站立在底座上,比例合理,接触关系真实。
包装设计:在机器人右侧放置一个与产品等比例的精致潮玩包装盒。包装采用高级哑光纸盒+透明展示窗设计,盒面印有:“未来城市探索家”“FUTURE CITY EXPLORER”。包装设计简洁、现代、有品牌感,以白色、银灰色和少量蓝色为主,印有机器人产品视觉图和简洁的系列编号。包装盒具有真实纸张纹理、折痕、接缝和印刷质感,看起来像真正可以在商店货架上销售的潮玩产品。
摄影环境:使用真实高端商业摄影棚进行拍摄。背景为深蓝灰色的未来城市氛围,但保持克制,只出现柔和、虚化的蓝紫色城市灯光和少量建筑轮廓,不要满屏霓虹灯。使用柔和的大面积摄影灯作为主光源,辅以微弱蓝色轮廓光,让机器人白色装甲、透明头盔、金属零件和包装盒的材质清晰可见。产品放置在深色哑光摄影台上,具有自然接触阴影和轻微真实倒影。
最终效果:高端潮玩品牌新品宣传照、设计师收藏玩具、实体产品摄影、真实工业设计、精致制造工艺、真实材质、自然光影、浅景深、85mm产品摄影镜头质感。画面重点是“这真的像一个可以生产、包装、售卖的潮玩产品”。避免游戏CG、概念艺术、电影海报和过度科幻视觉。不要过度霓虹灯、不要夸张光晕、不要镜面塑料、不要所有材质都发光、不要堆砌机械结构、不要复杂到无法生产的零件、不要漂浮、不要穿模、不要畸形四肢、不要重复建筑、不要廉价塑料感、不要过度锐化、不要随机文字、不要杂乱背景、不要过度复杂的底座。
U1 Pro的输出颇有产品展示图的感觉,不管是材质还是包装盒的纸质感,尤其是顶部光线照射下玻璃和金属材质的反射,做的相当逼真,同时,在设计上也表现出了较高的审美能力。而且作为创意概念图,这样的输出把角色、材质与包装放在一起,让产品方向不再只停留于文字描述。

从音乐节海报、漫剧人物到潮玩设计,三个任务的要求并不相同:一个看构图与信息层级准确,一个看美学与系列画风,一个看产品质感,都是交付能力最直接的体现。这几项测试下来,U1 Pro能够根据不同需求调整视觉表达,这也为我们模拟真实场景和实际应用的测试提供了信心。
二、从公众号配图到企业秋招,把一项视觉工作完整做下来
单张图片能够完成之后,智东西把测试进一步放进真实的办公任务。
实际工作中,生图往往只是其中一个环节。一篇文章可能需要封面、配图和信息图,一次企业秋招则要同时准备招聘海报、宣传折页、易拉宝甚至周边设计。
先从我们熟悉的任务开始。智东西用AI创作了一篇关于SenseNova U1.5的技术解读文章,让模型按照文章内容进行配图。这是一个在媒体工作中非常重要的需求,不是单纯找一张“有科技感”的图片,而是要让图片回应具体段落。
正文插图提示词如下,后面需要附上对应的文章内容:
请根据这段文章内容制作一张公众号插图,尺寸为1024×544。先理解并提炼文章的核心信息,再进行视觉设计。要求画面简洁、清晰、有信息量,通过图形、人物/物体和简短文字结合的方式,把文章段落的核心逻辑完整呈现出来,整体采用简洁、有设计感的科普插画风格,信息层级清楚,构图舒展,文字清晰易读,避免堆砌文字和无意义装饰。
公众号文章封面的提示词如下:
根据完整文章内容,提炼文章的核心主题和最重要的信息,设计一张公众号文章封面图。要求尺寸为900×383,画面简洁、有视觉冲击力,突出文章的核心主题和主体元素。以图形、人物或场景为主,文字尽量少,只保留必要的标题或关键词,避免堆砌信息。整体风格专业、现代、有科技感,构图清晰,主体突出,适合微信公众号文章封面展示。
最终,我们为这篇技术解读文章生成了封面和插图。从效果上看,封面侧重突出主题,正文配图则尝试通过图形、简短文字和漫画式表达辅助理解。

对编辑来说,有价值的不是图片数量增加了,关键是要让图片中的概念、关系和说明符合文章原意。主题相关只是第一步,内容准确、图文配合,才是配图任务需要继续核对的部分。
U1 Pro精确理解了文章和段落的内容,所做的插图易于理解、构图清晰,还附带了不少漫画的形式辅助理解。封面和正文插图在整体视觉语言上也保持了统一性。
除了媒体,企业同样有大量的设计需求,如果从现在这个时间节点来看,秋招无疑是最重大的活动了。下面这个测试,我们给U1 Pro出了一道更复杂的题——为企业秋招准备一套视觉物料。为此,编辑部还特意请教了公司HR,把所有任务一网打尽。
这项任务的难点,不只是多生成几张图。公司名称、岗位信息、时间和地点要准确,各类物料之间要有统一的视觉风格,不同用途又不能照搬同一种版式。
比如,海报需要先吸引注意,岗位信息图需要让人快速找到招聘方向,折页则要组织更多说明内容。既要让信息讲完整,也要让布局好看、读起来不费劲。
从U1 Pro的输出结果上看,招聘海报、易拉宝和折页用了相近的配色和视觉元素,但根据使用场景不同,信息排布做了相应调整;岗位信息图更突出文字和数据,没有简单复制海报的版式,宣讲会的伴手礼也做了相应的视觉设计。
完整物料的视觉方案展示如下:

这里值得注意的是,成套设计不等于把同一张图拉成不同尺寸。它需要一边沿用既有风格,一边根据用途重新安排内容。从单张图片走到整套物料,这种关联性比单张图的效果更接近真实工作。
三、一键换装、局部修改,多图融合制作漫画风拍立得
前面的测试,主要是从无到有的创作。但真实工作里的图片处理任务还有另一半:在已有图片上继续修改。
比如给人物换一套衣服、调整房间装修风格、删除画面中的路人,或者只修改海报里的某段文字。用户要的往往不是“再来一张”,而是把眼前这一张改好。
首先来测试换装。我们生成了一张身穿连衣裙的模特图片,然后上传蓝色连衣裙图片,并让U1 Pro替换衣服和背景,并将海边背景换成草原,尽量保留人物本身的外观特征和姿态。

从最终效果看,蓝色连衣裙和草原背景都完成了对应替换,人物的脸部、发型和整体姿态保持了较高连续性,人物明暗也随新环境做了适配。

这个任务的难点在于要分清楚哪些该改、哪些该保留,衣服和场景需要变化,人物则不能因为换装被改成另一个形象。U1 Pro处理的不再只是“生成什么”,还包括“哪些地方不要动”。
随后,智东西通过一个更复杂的需求,来测试一下U1 Pro的多张参考图的理解和编辑能力,我们上传了一张在青岛吃海鲜的照片、两个人物漫画形象以及一张拍立得相框参考图,让U1 Pro对原图进行精细化修改。提示词如下:

这几张参考图里,原照片提供就餐场景、餐桌和食物布局,人物形象提供角色特征,拍立得参考则提供边框与呈现方式。U1 Pro首先要分清哪些信息需要保留、哪些元素需要替换,再协调人物比例、光影和前后关系。
从结果看,U1 Pro对参考图的理解到位,将主图中的人物替换为了漫画形象,同时,女生形象和男生形象的融合也很自然,人物替换以及桌子上小精灵的出现没有影响原图,背景和食物都保持了原状,整体呈现出统一的照片风格。

最后,我们又进行了几项快速编辑测试,包括房间重新装修、画面调色、删除部分内容、海报局部文字调整等。这些任务的共同要求只有一个:只改需要修改的地方。
例如在房间装修测试中,我们要求保留原始房间的结构、门窗和空间布局,只更换家具和整体装修风格,毛坯房摇身一变成了精装修房间。从前后对照中,仍能辨认出原空间的主要框架,室内则加入了家具和饰面,毛坯房变成了装修效果图。

风景图也可以修改,比如一键把蓝天换成阴雨天,加上自然下落的雨丝并删掉某电线杆。从前后对照看,画面光线变得更阴沉,树木、栏杆和步道的主要布局得到保留。

我们还对下面这张海报进行了局部调整,把臭豆腐改成了香豆腐,然后在旁边添加了拼音“buchou”字样。

几轮测试下来,这类局部任务的完成度整体较高,修改能够集中在指定区域,原始画面的主体结构、画面风格连续性也得到保留,没有出现“改一个地方、整张图都变了”的情况。
结语:从“生成一张图”到“完成一项任务”
整体实测结束后,商汤U1 Pro给我们留下最深刻的印象,是它不再只是追求“生成一张好看的图”,而是开始围绕一项完整任务解决问题。
海报、角色与潮玩,看的是设计表达;公众号配图和秋招物料,看的是内容关联与成套组织;换装、多图融合和局部改字,则进一步考验修改能否对准目标、保住已确认的部分。
这几件事放在一起,才更接近真实工作的要求。用户需要的不是不断拿到新的图片,而是让手上的成果一步步接近可用状态。
当然,交付也不是一句“生成成功”就能完成。信息是否完整准确,布局是否清晰美观,修改是否符合要求,输出能否满足实际用途,都要继续接受核验。
对U1 Pro这样的多模态模型,评价不应只停留在第一张图有多惊艳,而要进一步看:面对一项包含多种素材、多个交付物和多轮修改的任务,它能否持续回应需求,把信息完整性、设计表现和修改可控性放在一起做好。
这也意味着,AI生图的价值正在从“生成一张图片”,进一步走向“完成一项任务”,并能够真正嵌入个人和企业的工作流程,把一项工作持续推进到符合要求的成果。