网易首页 > 网易号 > 正文 申请入驻

开源国产8B模型,比肩闭源Image 2了!

0
分享至

金磊 发自 凹非寺
量子位 | 公众号 QbitAI

时隔仅仅三周,国产生图模型,又进化了。

上回书到,这个生图模型是4K直出的,开源的,只有8B大小的。

这一次,它的正式版本来了!若是用三个词来概括,那就是——

更完整,更准确,更稳定。

例如我们现在一口气把九张不同的食物照片丢给它:



并简单附上一句Prompt:

请将这九款美食拼成一张精美的食谱分享卡片。



原本各自拍摄、比例和背景都不一样的九张图片,一下子就被整整齐齐地设计到了一张图里;并且AI还精准识别出了每道菜品,同时还给它们适当加了美化处理,让图片整体变得更加养眼。

再来看一个编辑图片的例子。

我们在原图的基础上,用“框选+标注”的方式,把想要修改的图片局部细节给标了出来:



AI在接到任务改完以后是这样:



可以明显看到,几个目标区域都按照要求发生了变化,但床、床头柜、玻璃杯、右侧柜体,包括整个卧室原来的空间关系都基本保留下来。

而这个AI,便是商汤科技这次正式开源的SenseNova U1.5 Lite,其亮点如下:

  • 3-4k字符超长复杂指令遵循:能一次理解更长、更复杂的要求,同时处理主体、数量、位置、文字、布局和风格等多种约束,不容易漏细节。
  • 更高质量的视觉生成:构图、色彩、材质、光影和细节更自然,整体完成度更高。
  • 更可靠的原生图像编辑:改指定内容时更精准,同时更好地保持人物、结构、版式和其他区域不变。
  • 更好的文字与复杂布局:中英文文字、海报、信息图和多文本排版更准确,也更擅长组织复杂画面。
  • 更精细的视觉控制:支持框选、标记和多图参考等方式,更准确地指定“改哪里、改什么”。
  • Native 4K高分辨率输出:直接生成4K高清图,同时保住构图、纹理、小字和光影等细节。

而且啊,SenseNova U1.5 Lite依旧保持了8B的大小,还能在复杂排版与精准编辑等核心的场景上比肩闭源的GPT-Image-2:



如果说三周前的SenseNova U1.5 Lite Preview版本是验证一个统一模型能够把视觉能力扩展到哪里。

那么到了今天的正式版本,商汤科技则是进一步验证这些能力能否分别得到强化,再重新统一到一个轻量级模型中,并稳定进入真实创作流程。

效果怎么更强了?看细节

接下来,我们继续拿效果来说话。

第一个任务,先来一个考验信息组织能力的实测,主题是从可可豆到巧克力。



要在一张竖版信息图里,需要同时塞进Harvesting、Fermentation、Roasting、Grinding、Tempering到Finished Chocolate六个阶段。

每个阶段既有文字解释,也有对应的可可果、发酵箱、烘焙设备、研磨装置、巧克力浆等视觉元素,而且六层内容还得顺着版式一路往下走。

从最终的效果来看,SenseNova U1.5 Lite已经做到了可以组织一整套视觉表达,包括长文本、多层级结构、插画、数字顺序和版式关系。

这种能力再落到更日常的内容生产里,就变成了类似做社交媒体封面这类任务。

比如下面这张图:



这类图看上去虽然元素不算多,但难点就在于要做到“封面感”这三个字。

标题要立得住,主体要足够抓眼,三只狗的造型、服饰和表情既要各有区分,又不能彼此打架;同时,整张图还得维持住统一的时尚调性,而不是变成几个可爱元素拼在一起。

从最后的结果来看,正式版在这类应用型视觉任务上,已经开始更接近一张能够直接拿来用的封面作品。

接下来,我们再来看下SenseNova U1.5 Lite的局部编辑能力。

Prompt是这样的:

仿照参考图的折纸拼贴视觉,生成一张社区共享厨房运营模式信息图。



乍一眼看过去,两张图片整体的结构和风格几乎是没有变化的,因为我们的要求就是“仿照参考图”。

仔细看细节,原来属于教育项目的元素被替换成厨师帽、砧板、菜谱等厨房相关视觉,左侧的信息也跟着变成Membership Fees、Commercial Rental、Cooking Classes、Market Sales和Event Hosting。

在这类任务中,模型得先分辨出一张图里哪些东西属于主题内容,哪些东西属于更底层的设计逻辑。然后保留后者,再让新内容沿着原来的视觉语言长出来。

不过若是参考图从一张变成了多张,那任务难度就会更大了。

例如我们输入下面这三张参考图片:



然后附上这样的Prompt:

Edit Image1usingImages2and3ascontentreferencesrather than pasted rectangular images. Replace the framed band silhouetteswithallfive Radiohead membersfromImage2, transformedintothe poster’s distressed monochrome halftone style. Reflow the four lower feature blocksintoa compactleftcolumnandaddan ESSENTIAL LISTENING listontherightusingImage3onlyforwordingandhierarchy. Render thenewlist directlyonthe same continuous black distressed backgroundwithmatching off-white type; donotretainanywhiteorcream card background. Preservealloriginal textandallother poster elements.

这次Prompt更细节的一点是,第三张参考图只允许参考内容和信息层级,原来的白色卡片背景不能一起搬过来,新歌单需要直接长在海报原来的黑色做旧背景上。

SenseNova U1.5 Lite给到的结果如下:



从结果来看,Radiohead五个人进入了原来的乐队区域,人物处理后的质感和整张海报基本接上了;左下方的信息重新压缩,ESSENTIAL LISTENING则直接融进右侧版面,没有留下一块突兀的白底。

而对于刚才给到的三张参考图来说,第一张负责版式和风格,第二张负责人物身份,第三张只负责文字内容和结构。模型必须先把这三件事分开理解,最后才能重新合成到一张图里。

但在真实设计工作里,还有一种需求没有前面这么复杂,却可能出现得更频繁——改几个字

这次我们在输入原始图片后,Prompt如下:

请将左下角深蓝色矩形信息栏内的展览时间与地址详情,从
“JUNE 15 - JULY 30, 2024
URBAN GALLERY
123 CREATIVE WAY
ARTSVILLE, USA”
替换为
“AUGUST 10 -
SEPTEMBER 28, 2024
METRO MUSEUM
456 DESIGN ROAD
CREATIVITY CITY, UK”,
保持原有的白色与粉色字体样式及排版布局不变。



最终,左下角的信息完成替换,画面中心巨大的“RHYTHM OF FORM”、周围高饱和度的几何图形,以及原本的文字层级都留在原来的位置。

先拆开练,再合回来

在看完的效果之后,接下来的一个问题就是,一个8B模型是如何做到文字、审美、复杂布局、长指令、局部编辑都过关的?

据了解,SenseNova U1.5 Lite继续沿用了NEO-unify原生统一多模态架构,把视觉理解、图像生成和编辑放在同一套模型里。

也就是说,在真正动像素之前,模型先要理解画面。

哪里是主体,谁在谁旁边,哪些是文字,用户指的是哪块区域,一张参考图里到底哪些东西值得保留……这些理解过程,并不会和后面的生成、编辑彻底分家。

而正式版这次比较关键的一处变化,发生在训练阶段。商汤采用了一套很容易理解的办法:先拆开练,再合回来。

文字渲染、美学表达、图像编辑这些目标,先会分别训练对应的专项Expert

等这些Expert练完以后,再通过多教师在线策略蒸馏技术MOPD,把它们的专项能力重新融合回同一个SenseNova U1.5 Lite里。

所以训练时虽然有多个专项老师,到了最后真正交付和部署的时候,用户拿到的依然只有一个8B模型。

没有额外Router在背后判断“这次应该调用哪个子模型”,用户也不用在文字、美学、编辑几个模型之间自己来回切。

这种做法和前面的案例其实是能对上的。

比如Radiohead那组多参考图任务,模型先得理解原海报的视觉骨架,再识别人物,还要从另一张图里提取文字结构,最后才能完成生成。

到了海报改字也是一样。

“只改左下角”首先得先理解什么叫“左下角”,哪些文字属于目标区域,周围哪些图形、字体和版式不能动。等这些判断做完,才轮到最后的像素生成。

所以在统一训练体系里,视觉语义理解和空间建模形成的结构化认知,可以继续反过来帮助生成和编辑。商汤在新闻稿里把这件事概括为“理解与生成双向反哺”。

而要让这种能力在复杂任务里稳定下来,正式版后训练又专门强化了三件事。

第一件叫指令遵循。用户写了一大串要求,主体有几个、谁在左边、文字放哪儿、什么颜色、哪些东西不许改,最后模型到底执行了多少。

第二件叫视觉偏好。指令都完成以后,整张图的构图、材质、光影和最终质感到底过不过关。

第三件是编辑保持。要改的区域能不能改准,原本已经正确的地方还能不能留下来。

这三项其实刚好对应了前面几个案例最容易出问题的地方:复杂信息图怕漏要求,STYLE这样的封面直接考验美学完成度,而卧室修改、Radiohead和文字替换,则都离不开对非编辑区域的保持。

另外还有提示词增强。如果用户只给一句比较简短的需求,PE可以先帮忙把意图整理成更完整的创作方案,再交给U1.5 Lite执行。

以上便是正式版SenseNova U1.5 Lite背后的技术关键了。

生图模型的标准,得变了

若是把时间线拉长一些,回头再看SenseNova U系列这几次变化,其实我们会发现一个比较明显的趋势。

早期大家看生图模型,最容易比较的是够不够惊艳。但当AI的生图能力越发的普及,真正决定模型能不能进入工作流的问题,开始出现在第一张图生成以后。

这也是SenseNova U1.5 Lite正式版反复强调“稳定”的原因。相比再增加几个看起来新鲜的玩法,它更想解决的是一项视觉任务从生成到交付的完整链路。

对应地,评价模型的标准也在发生变化。一张图够不够漂亮依然重要,但真正拉开差距的,越来越可能是模型能不能从理解需求、生成内容,一路完成修改、细化和最终交付。

统一模型的价值也正是在这里体现出来。

SenseNova U1.5 Lite最终交付出去的依然只有8B。它没有不断叠加外部路由,也没有把不同任务拆给多个模型分别完成,而是先通过多个专项Expert补强能力,再把这些能力重新收进一个统一模型里。这样做的好处很直接:调用链路更短,部署更轻,同时还能尽量保住不同任务之间的一致性。

落到开发者和创作者的实际使用里,最终对应的其实就是三个字,快、好、省。

商汤的判断是,多模态仍然会是AI走向物理世界、真正进入生产环节的重要方向。因此这次U1.5 Lite正式版继续把大量精力放在稳定性、指令遵循和编辑精度上。它们未必像某个新玩法一样第一眼就很抓人,却更直接决定了模型能不能被真正用起来。

如果说三周前的Preview版本更多是在验证,一个8B统一模型的视觉能力究竟能铺到多宽。

那么到了正式版,问题已经开始变成另一件事:

这些已经铺开的能力,究竟能不能稳定地拿来干活。

GitHub:
https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:
https://huggingface.co/collections/sensenova/sensenova-u15

SenseNova Studio在线体验:
https://unify.light-ai.top/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
网呼:难道真的悄然淡出艺能界?龙头厂牌S1 形象网页公开「40人」阵容,顶流要角凪光竟不在其中

网呼:难道真的悄然淡出艺能界?龙头厂牌S1 形象网页公开「40人」阵容,顶流要角凪光竟不在其中

孤独的独角兽影视
2026-08-25 11:30:16
除了汉森制药,美国高盛还重仓5家小盘创新药,最高15,最低4元

除了汉森制药,美国高盛还重仓5家小盘创新药,最高15,最低4元

长风价值掘金
2026-08-25 16:10:27
中国的考公考编还能火多久?

中国的考公考编还能火多久?

细说职场
2026-08-25 17:11:56
估价8万!遇到这样的100元纸币,可别花掉了!

估价8万!遇到这样的100元纸币,可别花掉了!

富哥爱收藏
2026-08-08 13:16:30
美国制裁伊朗,凌晨2点准时动手,中方已做好最坏打算,奉陪到底

美国制裁伊朗,凌晨2点准时动手,中方已做好最坏打算,奉陪到底

黑鹰观军事
2026-08-25 13:22:51
恒大数百万烂尾业主:为什么很少看见激烈闹事,他们去哪了

恒大数百万烂尾业主:为什么很少看见激烈闹事,他们去哪了

朗威谈星座
2026-08-24 07:36:01
美国忍不了了,终于下狠手了,这一次国本动摇

美国忍不了了,终于下狠手了,这一次国本动摇

一个坏土豆
2026-08-24 20:29:46
大暴雨、特大暴雨,10级以上雷暴大风要来了!中央气象台预警:今天到明天,福建、江西、广东、海南、北京等地有大暴雨,局地有特大暴雨

大暴雨、特大暴雨,10级以上雷暴大风要来了!中央气象台预警:今天到明天,福建、江西、广东、海南、北京等地有大暴雨,局地有特大暴雨

鲁中晨报
2026-08-25 07:18:05
美媒:歼-16战斗机在演习中展现压倒性优势,共取得51次“击落”战果

美媒:歼-16战斗机在演习中展现压倒性优势,共取得51次“击落”战果

零度Military
2026-08-21 14:47:29
章子怡套现3亿上热搜,不到24小时,恶心的一幕出现,质疑声出现:“别让她跑了?”

章子怡套现3亿上热搜,不到24小时,恶心的一幕出现,质疑声出现:“别让她跑了?”

LULU生活家
2026-08-24 19:44:57
全红婵近照变化太大了,熬过了最难的发育关,小姑娘彻底长开了,模样跟以前判若两人

全红婵近照变化太大了,熬过了最难的发育关,小姑娘彻底长开了,模样跟以前判若两人

In风尚
2026-08-22 06:04:58
花2000多元入住希尔顿欢朋酒店后,女子腿上出现大片红疹,医院诊断为“虫咬皮炎”,酒店工作人员:升级房型并“自己凑”100元赔付

花2000多元入住希尔顿欢朋酒店后,女子腿上出现大片红疹,医院诊断为“虫咬皮炎”,酒店工作人员:升级房型并“自己凑”100元赔付

大风新闻
2026-08-25 08:38:05
策略:明天8月26日的预判出来了,全面减仓之前,我要说两句!

策略:明天8月26日的预判出来了,全面减仓之前,我要说两句!

一担金
2026-08-25 12:28:12
不是迷信!明日七月十四,记得:2不说,3不干,4不转,别大意!

不是迷信!明日七月十四,记得:2不说,3不干,4不转,别大意!

神牛
2026-08-25 14:05:12
比亚迪海狮08将于9月2日上市,预售价区间23万~28万元

比亚迪海狮08将于9月2日上市,预售价区间23万~28万元

IT之家
2026-08-25 18:08:14
坐了这么多次飞机,竟不知机场T1、T2、T3的“T”啥含义!

坐了这么多次飞机,竟不知机场T1、T2、T3的“T”啥含义!

小虎新车推荐员
2026-08-17 13:11:31
我们好像进入了一个非常恐怖的时代。

我们好像进入了一个非常恐怖的时代。

老陆不老
2026-08-10 08:57:46
湖南帮扶老人反被索赔事件新进展:当地司法部门正式介入调查 店家支付的1.9万元获全额返还

湖南帮扶老人反被索赔事件新进展:当地司法部门正式介入调查 店家支付的1.9万元获全额返还

闪电新闻
2026-08-25 14:35:16
吹捧印度抹黑中国的郑墨沫,最艰难时刻想回国被拒,现状如何?

吹捧印度抹黑中国的郑墨沫,最艰难时刻想回国被拒,现状如何?

吴蒂旅行ing
2026-08-25 04:22:40
面相真的是门玄学,韩沛颖就是很好的例子,剧都播完了楚嘉禾还有最强售后

面相真的是门玄学,韩沛颖就是很好的例子,剧都播完了楚嘉禾还有最强售后

小椰的奶奶
2026-08-25 04:23:53
2026-08-25 18:43:00
量子位 incentive-icons
量子位
追踪人工智能动态
13207文章数 176541关注度
往期回顾 全部

科技要闻

机器人跑赢博尔特,身体太快,脑子还在追

头条要闻

女子打赏男主播1576次近27万 家里6口人挤30平出租屋

头条要闻

女子打赏男主播1576次近27万 家里6口人挤30平出租屋

体育要闻

穆里尼奥如何摆贝林修斯姆巴佩?

娱乐要闻

张韶涵成都演唱会中暑,中途吸氧

财经要闻

瓜子二手车乱象调查

汽车要闻

2026成都车展 | 吉利中国星王博:以i-HEV混动技术,重新定义新一代油电混动

态度原创

房产
手机
本地
教育
公开课

房产要闻

一年亏掉26个亿!三江潮声,吹不醒南沙开建豪宅美梦

手机要闻

首发玄戒O3!小米18 Fold未发先火:多名网友抢先预定 预估售价破万

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

教育要闻

江苏考生到底有多少条升学路?强基、综评、提前批、国际本科

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版