网易首页 > 网易号 > 正文 申请入驻

不卷参数卷架构,这个开源模型把图像理解和生成统一了

0
分享至

henry 发自 凹非寺
量子位 | 公众号 QbitAI

这两天打开朋友圈,10条里有7条都是GPT-Image-2生的图。

中文海报、复古杂志封面、直播画面、社交截图、连高考试卷都能照着出一张几乎以假乱真的。

对此,大家伙的反应也都出奇的一致——

专业设计师们完了,我又能行了!

但实际上上手你就会有同感:免费用户一天几张,抽卡次数有限,遇到稍微严肃点的活,额度马上到顶,常常是活没干完,次数没了。

针对这一空档,商汤刚刚开源了一个全新架构的理解生成统一模型SenseNova-U1,虽然小尺寸版本只有8B,却能复刻不少GPT-Image-2的拿手绝活。

比如,我们拿它做一张量子位的招聘海报:文字、版式、配色,挑不出毛病。



太阳系图解,八大行星各自的轨道、属性、图文介绍一应俱全,看着挺像那么回事。



画个钢铁侠,模型也能自动从轮廓、铺色、细节、质感、氛围等多个阶段拆解完整的绘画流程。



来个马斯克太空集群的信息图也审美在线。



可以说,信息图(InfoGraph)、文字密集排版、图文交错——

这几个曾经被公认是AI生图最难啃的硬骨头,U1能跟GPT-Image-2挤进一桌。

在具体的图像理解与生成的多项指标上,SenseNova-U1也是登顶开源模型的榜首。



在推理响应速度上也具备相当的优势,逼近主流商用闭源模型。





这是怎么做到的,咱往下看。

连续性图文创作,这次是原生的

先说U1这次最有意思的能力,连续性图文创作

所谓连续性图文创作,就是文字和图片在一段输出里自然交叠,而不是文字归文字、图片归图片。

这听起来很简单,但实际上很难。因为文字保留语义、图片保留像素细节,这两件事在传统架构里几乎是天敌——

保了语义就丢了像素,保了像素就稀释了语义。

U1的做法是让两者在同一个表征空间里共享上下文,语义丰富性和像素级视觉保真度第一次同时拿住。

简单讲,就是模型能像人一样,边思考边画草图,文字和图片在一段输出里自然交叠。

比如,我让它生成一个“煎牛排的操作教学”。它能从食材准备,沥干水分、调味、煎制和翻面……讲到最后装盘。

每一步的关键操作都有图,牛排的形象从生肉到五分熟一路保持高度一致,不会画着画着变成另一块肉。



再比如,我想学一点漫画分镜技巧。

它能直接给我吐出图文并茂的教材式段落,从准备阶段、镜头建立、再到引入道具、次要角色一应俱全,比纯文字解释直观得多。



这种“始终是同一个主体”的连贯性看起来朴素,但对生成模型却很难。

传统范式得在多个模型之间来回调用,各画各的,角色形象很容易在第三步就走样。U1是单次单模型调用直接出全套。

对一个新模型来说,还有一个值得关注的考验就是——

高密度信息图

在模型界面中,你可以直接输入“自己的简历信息”,它就能返回你一张手绘风格的海报,信息分布、配色、字体层级都安排得明明白白。



让它讲“三只小猪盖房子”,我输入只有这么“7个字”,输出就能直接给你一整组连环画——

三只小猪、三种材料、三栋房子、最后那只大灰狼,一格一格排好,顺序对得上故事。



炒红烧肉这类做菜教程图,也可以一次直出,图文对应。



给一句“做杯咖啡的英文流程图”,图也直接出来了。



在讲究排版、涉及多种元素的插画场景中,U1也能实现比较精细的效果,比如这张划船乐的教学总览图。



最有意思的是这个,扔给它一张路边常见的“电梯安全”警示牌,让它换个排版做成一张信息图。

它还能直接把这个实现完美迁移,把版式从警示牌切成了科普卡片。





前段时间火爆的产品爆炸图,在U1这里也可以做到。一台相机,被它拆得整整齐齐:

镜头组、反光镜、快门、传感器、芯片,电池什么的,统统被它拆得整整齐齐悬浮在空中,标注线一根不少。



这种程度的玩法,以前是超大参数模型的专属。更有意思的一点是,SenseNova U1 Lite还在行业首创了图文交错的思维链。

这种会推理的能力放到图像编辑上会更有趣。

我扔给它一张刚泡好的玻璃杯热茶,让它“画出一小时后的样子”。它没有简单地直接出图,而是先做了一段推理:

一是给自己定约束,同一只玻璃杯、同一张原木桌面、同一种侧逆光,这样两张图放一起才看得出“是同一杯茶过了一小时”。

二是推导物理:刚泡时,叶片高速舒展、气泡从叶脉逸出、蒸汽在杯壁上留下弧形折射;

一小时后,多酚类扩散均匀,茶汤变深红褐,叶子完全沉降呈半透明,杯底跟桌面交界处出冷凝痕迹。光影也跟着从“清晨的清冷”过到“午后的慵懒”。



类似的还有几个测试。

给它一个绿色的香蕉,模型会先推理“叶绿素分解+糖化”,从而保证输出的是一根带着斑点的成熟香蕉。



可以说,这款新模型不只是在改图,还具备了一定的物理常识。

NEO-unify,一个网络实现“看”和“画”

看到这,你可能想问,这是怎么做到的?

U1的底层是一套叫NEO-unify的架构。一个模型同时会看、会画,理解和生成在同一个网络里完成,中间没有任何拼接。



在过去,多模态模型的标配经常是这样的,视觉编码器(VE)负责看,变分自编码器(VAE)负责画,理解归理解,生成归生成,中间靠适配器拼起来。

NEO-unify把这两个东西都拿掉了,不需要VE,不需要VAE,模型直接吃像素,直接吐像素。

具体来说,这一过程分为三步:

第一步,引入近似无损的视觉接口,把图像的输入和输出统一成同一种表示。

第二步,用Mixture-of-Transformer做主干,理解和生成共享同一套底层。

第三步,文本走自回归,视觉走像素流匹配,两套目标函数在同一个学习框架里跑完。

△图片由SenseNova U1生成

这套技术架构给了NEO-unify独门绝活,连续性图文创作。

传统模型要做这件事,得外挂工具或者后处理拼接。U1底层就是统一的,原生支持图片和文字的交叉排版,所有视觉内容都来自模型自身,不调用外部工具。

模型在思考一个问题的时候,可以一边推理一边生成中间示意图,把复杂逻辑可视化。

生成一段教程,可以在恰当的位置自然地插入说明图。

落地到模型,两个规格。SenseNova-U1-8B-MoT,8B参数,端侧能跑。SenseNova-U1-3AB-MoT,总参数38B的MoE架构,提供更强的能力,底层都是同一套NEO-unify。

此外,商汤还给U1配了一套自研推理栈,LightLLM跑理解、LightX2V跑生成,两条路解耦各管各的。以H100/H200单节点为例,生成一张2048×2048的图,端到端大概9秒。

全网开源,即刻可用

值得一提的是,商汤这次在README里把模型的局限也直接写了出来:

上下文最长32K、人物在复杂场景里的细节有时不够稳、长文字渲染偶尔会出现拼写或排版错误、连续性图文创作目前还是beta。

不过这些短板都标了“持续改进中”。换句话说,U1这次开的不是终点,是个起点。

为了方便大家使用,商汤这次顺手开源了一套SenseNova-Skills技能包,把U1做成了Agent里能直接调的工具。

sn-infographic自带87种版式、66种风格,自己评分自己挑;挂进OpenClaw,一句 /skill sn-infographic “提示词”,图就出来了。

Skills不只是infographic一个,整套覆盖图像生成、PPT制作、Excel数据分析、深度研究、跨平台搜索。

目前,SenseNova-U1两个模型已经全网开源。Hugging Face和GitHub都能下,仓库地址在https://github.com/OpenSenseNova/SenseNova-U1。

想直接体验不动手部署的,现在可以直接进入SenseNova U1 Lite Skill,https://github.com/OpenSenseNova/SenseNova-Skills。

另外,办公小浣熊也即将上线U1。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
懒懒“杀”到法国!与王思聪坐豪华游船,生图脸大眼小“见光死”

懒懒“杀”到法国!与王思聪坐豪华游船,生图脸大眼小“见光死”

落雪听梅a
2026-08-15 12:44:47
程梦圆去世后,村里人说出22年的秘密:没有血缘,却是全家的团宠

程梦圆去世后,村里人说出22年的秘密:没有血缘,却是全家的团宠

今日搞笑分享
2026-08-16 10:09:13
伟哥又发现一新作用!2026年新研究:不仅抑制癌症转移,与他汀联用,死亡风险降低32%

伟哥又发现一新作用!2026年新研究:不仅抑制癌症转移,与他汀联用,死亡风险降低32%

方舟健客科普
2026-08-14 21:25:40
“秃毛鸡还幻想孵出凤凰?”一场廉价的抓周仪式,令人看清了现实

“秃毛鸡还幻想孵出凤凰?”一场廉价的抓周仪式,令人看清了现实

妍妍教育日记
2026-08-01 09:45:09
中超争冠格局有变!山东泰山仅剩7轮赛程,落后12分,赶超蓉城希望到底有多少

中超争冠格局有变!山东泰山仅剩7轮赛程,落后12分,赶超蓉城希望到底有多少

画夕
2026-08-16 05:59:57
练肌肉=存寿命,多练这5个自重动作,覆盖全身肌肉

练肌肉=存寿命,多练这5个自重动作,覆盖全身肌肉

增肌减脂
2026-08-04 16:20:08
巴萨官媒称费兰离队是喜报!后者连遇尴尬:无队友发文送别 掉粉20万

巴萨官媒称费兰离队是喜报!后者连遇尴尬:无队友发文送别 掉粉20万

风过乡
2026-08-16 09:07:22
沉默后,中方通告全球,藏南属中国领土,赠予印度一句忠告

沉默后,中方通告全球,藏南属中国领土,赠予印度一句忠告

无情有思可
2026-08-16 10:39:02
小斯谈加盟尼克斯:那段时期很多人都不愿去 但我却热爱这种挑战

小斯谈加盟尼克斯:那段时期很多人都不愿去 但我却热爱这种挑战

北青网-北京青年报
2026-08-16 09:16:02
DeepSeek更新后价格暴涨10倍!网友:说好的永久降价呢?

DeepSeek更新后价格暴涨10倍!网友:说好的永久降价呢?

可达鸭面面观
2026-08-14 23:05:10
谢霆锋怒斥糖拌西红柿:10岁孩子都会做,能拿来比赛?

谢霆锋怒斥糖拌西红柿:10岁孩子都会做,能拿来比赛?

手工制作阿歼
2026-08-15 11:13:21
菲总统小马斯科宣布:若台海打仗,不允许任何人从菲律宾发动攻击

菲总统小马斯科宣布:若台海打仗,不允许任何人从菲律宾发动攻击

健身狂人
2026-08-15 13:21:35
一个强暴犯嚣张成这样,他凭什么!

一个强暴犯嚣张成这样,他凭什么!

BenSir本色说
2026-08-15 00:53:42
汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

LULU生活家
2026-08-15 14:17:30
《牛来》观后感:专门买票看完了,我想说点什么

《牛来》观后感:专门买票看完了,我想说点什么

叶秋臣
2026-08-15 23:39:34
《牛来》反向爆火,日排片增至300场;网友调侃:烂片不一定看,烂到极致高低看看怎么个事;出品方前身为装修公司,主创两人

《牛来》反向爆火,日排片增至300场;网友调侃:烂片不一定看,烂到极致高低看看怎么个事;出品方前身为装修公司,主创两人

极目新闻
2026-08-15 12:15:51
56岁男子南太行失联6天遗体被发现,距庙仅300米,已爬完最险路段

56岁男子南太行失联6天遗体被发现,距庙仅300米,已爬完最险路段

今日搞笑分享
2026-08-16 05:10:52
少妇被邻居强奸拍裸照后自愿同居,情夫中40万彩票后竟被少妇夫妻联合掐死

少妇被邻居强奸拍裸照后自愿同居,情夫中40万彩票后竟被少妇夫妻联合掐死

胖胖侃咖
2026-08-10 20:00:03
CCTV5直播,中国队VS新西兰队,郭士强修改12人大名单,能赢下吗

CCTV5直播,中国队VS新西兰队,郭士强修改12人大名单,能赢下吗

体坛小快灵
2026-08-16 09:54:50
9年官司三度被驳仍不认输,NBA名宿坚持要求陪审团裁决

9年官司三度被驳仍不认输,NBA名宿坚持要求陪审团裁决

甜份超标的我
2026-08-16 11:17:23
2026-08-16 11:59:00
量子位 incentive-icons
量子位
追踪人工智能动态
13153文章数 176534关注度
往期回顾 全部

科技要闻

210亿美元,黄仁勋投了马斯克

头条要闻

伊朗三大权力机构负责人罕见会晤 审议国内最新局势

头条要闻

伊朗三大权力机构负责人罕见会晤 审议国内最新局势

体育要闻

体系球员与体系本身

娱乐要闻

李小冉疑承认离婚 多次强调“一个人”

财经要闻

事关8万亿养老金!长周期考核落地中

汽车要闻

杨洋成001号车主 岚图追光S正式上市

态度原创

教育
家居
游戏
艺术
公开课

教育要闻

穷人家别再“假富养”了!中学女孩早恋,脖子上已经有草莓了

家居要闻

2026建博会(广州) 公装联探展交流活动

魔兽世界:时光服7大最热门的顶尖饰品,你是否有捡漏到一款?

艺术要闻

布鲁西洛夫:一位会画又会写的俄罗斯画家

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版