网易首页 > 网易号 > 正文 申请入驻

文生图Scaling新变量,被字节Seed团队发现了

0
分享至



文生图模型一直在扩展模型、数据和算力,但训练图像所配 Caption 的信息量,却很少被作为一个独立变量系统研究。ByteDance Seed 团队发现:自然语言 Caption 变长,并不意味着模型获得了更多可用的视觉监督;相比长度,Caption 中与图像绑定的信息量更能预测扩散模型最终达到的训练损失。

基于这一发现,团队提出 Structured Prompt,并从 Diffusability 与 Promptability 两侧共同提升文本条件,最终在复杂组合、推理和世界知识生成任务上取得显著提升。



论文 Figure 1|自然语言长度很快饱和;结构化条件持续增加图像信息,并沿统一关系降低扩散训练损失。

过去几年,文生图模型的进步几乎沿着一条熟悉的路线展开:更大的模型、更多的数据,以及更高的训练算力。

但文生图与语言模型之间存在一个容易被忽略的差异。语言模型可以直接从文本序列中进行自监督学习;文生图模型则依赖图像与 Caption 的配对,学习 “什么样的文字对应什么样的视觉内容”。图像中可能包含大量物体、属性、位置、动作和关系,但只有被 Caption 准确描述并清晰绑定的部分,才能作为文本条件监督传递给模型。

于是,一个基础问题出现了:除了继续扩大模型、数据和算力,我们能否通过增加 Caption 所携带的图像信息,让生成模型学得更好?

在这项新工作中,ByteDance Seed 团队研究了这一问题。核心结论可以概括为一句话:

真正随文本条件扩展的,不是 Caption 的 token 数量,而是其中可被模型利用的图像信息。



  • 论文标题: Scaling Properties of Text Conditioning in Visual Generation
  • 作者: Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan 机构: ByteDance Seed
  • 论文:https://arxiv.org/abs/2607.29679
  • 项目主页:https://heheyas.github.io/context-scaling
  • 代码:https://github.com/heheyas/context-scaling
  • 模型:https://huggingface.co/collections/heheyas/context-scaling
  • 在线 Demo:https://heheyas-context-scaling.hf.space/
  • Hugging Face Paper:https://huggingface.co/papers/2607.29679

Prompt 变长了,

为什么模型没有变强?

一个直觉做法,是把训练 Caption 或用户 Prompt 写得更长、更详细。更多 token 看起来应该意味着更多监督,也应该帮助模型生成更复杂的图像。

实验却给出了不同答案。在多种现有开源文生图系统上,自然语言 Prompt 随长度增加很快饱和,最终输出甚至低于各自最短 Prompt 的表现。即使专门在同一套长文本 Caption 上训练扩散模型,收益也十分有限。

为了把这个现象看得更清楚,团队设计了一个固定骨干网络的图像重建实验。对于同一张参考图像,团队从同一份完整标注出发,生成四个详细程度逐渐增加的自然语言 Caption,再使用相同的 Qwen-Image 模型和随机种子尝试还原该图像。这些 Caption 描述相同的实体和关系,后续版本主要通过补充和展开自然语言表达来增加长度。

令人意外的是,Caption 虽然显著变长,图像重建质量却几乎不再提高。新增的 prose 更多是在解释、改写或连接已经出现的内容,并没有持续增加新的、可稳定使用的视觉变量。



论文 Figure 3|固定骨干重建实验:NL Caption 继续变长后重建趋于饱和,逐步恢复 SP 字段则持续改善。

这说明,Caption 长度只是一个很弱的代理变量。一个文本可以写得很长,却仍然没有清楚说明:某个属性属于哪个物体、两个物体是什么关系、各自位于哪里,以及它们在画面中的前后层次。

如何衡量 Caption 里真正的图像信息?

如果 token 数量不足以衡量监督强弱,就需要直接测量 Caption 中与图像绑定的信息。为此,团队从已有工作中改造了两个互补指标:Grounded Perplexity Gain(GPG)和 Effective Detailness(ED)。

GPG:图像让 Caption 变得 “更可预测” 多少。

GPG 是一个需要读取模型 token 概率的白盒指标。对于同一句 Caption,团队分别让一个冻结的视觉语言模型看到和看不到配对图像,并计算图像出现后 Caption 内容 token 的对数似然提升。若 Caption 中包含大量与该图像紧密绑定的信息,看到图像应当显著提高模型对这些 token 的预测能力。

ED:Caption 覆盖了多少可靠的图像属性。

ED 是一个不依赖 token 概率的黑盒语义指标。它分别从图像和 Caption 中提取带有实体上下文的属性,再计算 Caption 属性的准确率与图像属性的召回率。最终采用更重视准确率的 F0.5,对 Caption 中没有图像依据的描述施加更强惩罚。

两个指标从不同角度刻画同一个问题:GPG 关注图像与文本之间的统计依赖,ED 关注 Caption 是否准确覆盖了可验证的视觉内容。



论文 Figure 6|GPG 与 ED 的定义及测量趋势。

Caption 信息量可以预测扩散模型的训练损失

接下来,团队固定图像、模型架构、初始化方式、优化配置和训练预算,只改变训练 Caption。整个实验包含 15 种 Caption 配置:三个不同长度的自然语言版本、六个逐步恢复字段的 Structured Prompt 版本,以及六个空间表达或字段遮蔽变体。每种配置都从同一个 BAGEL continued-training checkpoint 出发,独立训练一个扩散模型。

结果显示,自然语言 Caption 的 token 数与训练结果并不存在统一关系;但当横轴换成 Caption 信息量后,不同格式和详细程度的配置落在了高度规律的曲线上:

  • 收敛后的 diffusion loss 与 GPG 近似呈线性关系,Pearson r = -0.984;
  • 收敛后的 diffusion loss 与 ED 呈幂律趋势,log-log 空间中的 Pearson r = -0.971;
  • GPG 与 ED 对不同 Caption 配置的排序也高度一致,Spearman ρ = 0.96。

团队将其称为 text conditioning 的 scaling properties。它不是一个对所有模型都成立的理论定律,而是在固定架构与训练 recipe 下得到的经验标定。但它带来了两个直接价值。

第一,它把 Caption 信息量从一个模糊的 “数据质量” 概念,变成了可以控制和测量的训练变量:在模型、图像和算力不变时,信息量能够预测模型最终达到的训练损失。

第二,完成一次标定后,可以在同一训练 recipe 下先用 GPG 或 ED 比较候选 Caption 方案,再决定是否投入昂贵的扩散模型训练。对未参与拟合的六个 Caption 变体,两个指标仍能较准确地预测其收敛损失。



论文 Figure 7|在固定训练 recipe 下,收敛损失随 Caption 信息量呈现稳定关系。

Structured Prompt:

让信息不仅更多,而且更容易被模型使用

前面的实验揭示了一个关键点:仅仅增加自然语言 prose 并不够,新增信息还需要以稳定、明确的方式组织起来。

因此,团队提出 Structured Prompt(SP),用结构化 JSON 表示一张图像中的视觉变量。它包含三个层次:

  • 全局层:画面意图、场景、氛围、风格、光照和摄影信息;
  • 元素层:每个主体的身份、属性、动作、位置、可选深度和局部摄影信息;
  • 关系层:不同元素之间的位置、遮挡、交互和语义关系。

与自由文本相比,SP 的关键不只是 “JSON” 这一外观,而是让不同视觉变量进入稳定的命名字段,减少属性归属、空间关系和对象绑定上的歧义。在固定骨干重建实验中,随着 SP 字段逐步恢复,重建质量持续提高;在完整训练 sweep 中,字段覆盖增加也同步提高 GPG、ED,并降低收敛后的 diffusion loss。



论文 Figure 5|Structured Prompt 将全局、元素级和跨元素视觉变量组织到命名字段中。

为了在大规模训练数据上生成完整 SP,团队构建了一套 image-to-SP 标注流水线。通用 VLM 负责全局语义和局部内容,Sapiens 补充人体姿态证据,DepthAnything V2 提供相对深度,SAM 2.1 提供掩码与遮挡线索,最后再由 VLM 将这些信息统一整理为一致的完整 SP。



论文 Figure 8|VLM 与姿态、深度、分割专家共同构建完整 Structured Prompt。

团队将一个 Caption 表示能够向扩散模型暴露并组织图像监督的能力称为 Diffusability。SP 提升的正是这一侧:在不改变扩散模型架构的情况下,让模型从文本条件中学到更多、更明确的视觉变量。

Promptability:

有了好的结构,还需要 LLM 把它填好

训练时可以从配对图像中提取完整 SP,但实际生成时只有用户的一句话,没有参考图像或 oracle 标注。系统还需要一个 LLM prompter,把用户请求扩展成详细、连贯、且不违反原始约束的 SP。

团队把这种从用户请求实例化结构化条件的能力称为 Promptability。端到端生成质量取决于两侧共同作用:

Generation Quality = Diffusability × Promptability

这里的乘号是一种组织视角,而不是拟合得到的数学乘法公式:Diffusability 描述扩散模型能够从 Caption 表示中学到什么,Promptability 描述 LLM 在推理时能否真正填出高质量的 Caption 实例。



论文 Figure 4|Structured Prompt 连接标注、测量、diffuser 训练、prompter 训练与最终生成。

首先,团队固定 SP schema 和 Qwen-Image diffuser,只替换零样本 LLM prompter。随着 Qwen3.5 从 0.8B 扩展到 397B,thinking 模式下的 GenEval++ 从 46.4% 提升到 86.8%。除最小模型容易在思考过程中重复并无法输出有效 JSON 外,chain-of-thought 在其他尺度上都带来进一步提升。这说明,通用 LLM 的模型能力和推理能力,可以通过 Caption 接口直接转化为更好的图像生成结果。

但零样本 LLM 仍然倾向于生成信息不足、构图较简单的 SP。为进一步提高 Promptability,团队采用三阶段训练:

  1. SFT 学习扩散模型所期望的 SP 内容分布,而不只是 JSON 格式;
  2. Cold-start 从带有配对图像的 privileged reasoning traces 中蒸馏 “如何仅根据用户请求推导 SP”;
  3. RFT 在 prompter 自己生成并渲染的 rollout 上继续优化,由 verifier 筛选高置信轨迹,再通过 image-conditioned teacher 的 on-policy self-distillation 提供稠密 token 监督。

消融实验表明,三阶段承担不同作用:SFT 带来最大的单阶段结构提升,cold-start 加强从用户请求到 SP 的推导,而 verifier-gated OPSD 在 prompter 自身分布上取得最强结果。



论文 Figure 9|固定 schema 与 diffuser 后,生成质量随 LLM prompter 尺度和 reasoning mode 提升。



论文 Figure 10|SFT、cold-start 与 verifier-gated RFT 三阶段 prompter 训练。

结构化表示,

也让生成过程更容易迭代修正

SP 的字段化表示还有一个自然优势:当生成图像出现错误时,系统可以定位并修改相应的对象、属性、关系或布局字段,而不是重新改写整段自然语言 Prompt。

基于此,团队构建了 refine-render-judge 循环。每一轮中,prompter 根据用户请求和历史反馈生成或修订 SP,固定 diffuser 渲染图像,在线 judge 再针对 Prompt 遵循、结构和视觉质量给出 PASS/FAIL 与具体问题。若失败,下一轮只需围绕相关字段进行调整。

实验显示,增加迭代预算能够继续提高结构、对齐和 GSB 表现;但有效推理长度并不长。对于训练后的 prompter,即使允许最多 8 轮,平均也只使用 2.31 轮;从 Tmax = 4 增加到 8,收益已经很小。这表明,文生图确实受益于迭代纠错,但在当前设置下并不需要很长的 prompt-side reasoning trajectory:修复主要规格错误后,额外轮次会迅速饱和。



论文 Figure 14|Refine-render-judge 的 agentic 推理循环。



论文 Figure 15|循环能够修正对象拆分、关系和整体布局问题。

同一套 Qwen-Image,

结构化接口带来了多大提升?

最终系统由 SP-trained diffuser 与训练后的 LLM prompter 组成。它在几乎所有报告指标上领先所比较的开源权重模型,并在大多数评测上达到或超过所比较的闭源系统,优势在组合、推理和世界知识任务上尤其明显。

更关键的是 matched control。为了排除 “只是多训练了一些” 的解释,团队使用完全相同的 Qwen-Image 架构、训练图像、训练阶段和预算,额外训练了一套始终使用自由自然语言 Caption 的系统。结果如下:



论文 Table 2|与代表性文生图系统的完整对比。截图保留论文中的评测定义、加粗与脚注。

Matched NL 的额外训练确实带来了一些提升,但远不足以复现 SP 系统的结果。这说明,收益不能简单归因于更大的 backbone 或更多训练,而与 prompter 和 diffuser 之间所使用的结构化 Caption 接口密切相关。



论文 Figure 11|复杂空间关系、数量和属性绑定的定性对比。

下一步不只是 scale 模型,

也要 scale 条件本身

这项工作的出发点很简单:对于文生图模型,Caption 不是无关紧要的元数据,而是图像内容进入文本条件学习的主要接口。

当 Caption 只是变长时,新增 token 可能只是改写和铺陈;当图像信息被准确提取、清晰绑定并稳定组织时,同一个生成模型才能从中学习更多。GPG 和 ED 让这种信息成为可测量的变量,Structured Prompt 提高 Diffusability,LLM scaling、post-training 和短程 agentic refinement 则提高 Promptability。

因此,文生图的下一步 scaling 不应只关注 “负责渲染的模型有多大”,还应关注:

传递给模型的文本条件,究竟携带了多少它真正能够学习和使用的图像信息?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
巴黎生图辣眼睛!胡可一脸老相,毛晓彤像戴了张假脸,陈妍希太美

巴黎生图辣眼睛!胡可一脸老相,毛晓彤像戴了张假脸,陈妍希太美

神秘莫测的世界
2026-10-06 20:31:51
老登超市正在退场,盐城零售市场真的变了

老登超市正在退场,盐城零售市场真的变了

瓢城人
2026-10-07 20:18:24
美国为何禁止种植竹子?终于明白,原来竹子比我们想象的更可怕

美国为何禁止种植竹子?终于明白,原来竹子比我们想象的更可怕

抽象派大师
2026-09-28 16:03:48
决胜盘女王!郑钦文连赢4轮决胜盘 升第42名+第十次1000赛八强

决胜盘女王!郑钦文连赢4轮决胜盘 升第42名+第十次1000赛八强

醉卧浮生
2026-10-07 21:39:50
乌克兰媒体确认了:乌克兰武装部队新任总司令德拉帕特的团队已经制定了一项未来30年乌克兰对抗俄罗斯的“战争”计划

乌克兰媒体确认了:乌克兰武装部队新任总司令德拉帕特的团队已经制定了一项未来30年乌克兰对抗俄罗斯的“战争”计划

吉刻新闻
2026-10-06 16:37:51
1-3爆冷后,孙颖莎赛后回应输球原因让人很揪心,对手也表示尊敬

1-3爆冷后,孙颖莎赛后回应输球原因让人很揪心,对手也表示尊敬

工从昊懂球阿靖
2026-10-08 03:34:43
公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

只要高兴就好
2026-09-24 11:58:50
五大联赛身价变动:英超涨9.5亿欧,总身价141亿欧超西意之和

五大联赛身价变动:英超涨9.5亿欧,总身价141亿欧超西意之和

懂球帝
2026-10-08 04:03:20
武网替补名单报名截止即冻结,为何郑钦文排名飙升也无用?

武网替补名单报名截止即冻结,为何郑钦文排名飙升也无用?

空谷幽幽蓝
2026-10-07 20:40:51
终于有经济学家批评体制内退休金太高、加剧代际矛盾,评论区炸锅

终于有经济学家批评体制内退休金太高、加剧代际矛盾,评论区炸锅

慧翔百科
2026-06-23 08:47:02
推荐大家偷偷使用这个不雅的坐姿,对身体贼有好处!

推荐大家偷偷使用这个不雅的坐姿,对身体贼有好处!

奔波儿灞与灞波儿奔
2026-10-06 18:09:02
外交部:反对借战事关联抹黑中国

外交部:反对借战事关联抹黑中国

看看新闻Knews
2026-10-06 22:56:42
暗示卢拉倒台?巴西高院密谋大选后推翻博索纳罗定罪,时机微妙

暗示卢拉倒台?巴西高院密谋大选后推翻博索纳罗定罪,时机微妙

琴音缭绕回
2026-10-07 15:23:20
陈云找来三辆高档车进行对比,不久中央就规定高级干部必须统一坐国产车

陈云找来三辆高档车进行对比,不久中央就规定高级干部必须统一坐国产车

谈古论今历史有道
2026-10-07 08:10:08
杜特尔特家族临阵换将?莎拉被要求让位,备用计划已经做好准备

杜特尔特家族临阵换将?莎拉被要求让位,备用计划已经做好准备

历史的烟火
2026-10-08 02:26:41
同曦有压力了!董事长寄语下赛季林葳回归,新赛季仍直指季后赛!

同曦有压力了!董事长寄语下赛季林葳回归,新赛季仍直指季后赛!

细话篮球
2026-10-07 20:46:03
iPhone设置80%充电上限真的有用吗?3年测试数据出炉

iPhone设置80%充电上限真的有用吗?3年测试数据出炉

科技兽
2026-10-07 21:27:38
一觉醒来也门胡塞武装惨败,胡塞武装士兵还没来得及进入战壕,就被也门军队摩托化车辆追着碾压!

一觉醒来也门胡塞武装惨败,胡塞武装士兵还没来得及进入战壕,就被也门军队摩托化车辆追着碾压!

吃瓜小侦探
2026-10-06 21:54:11
江西省农业厅副厅长曹爱珍:仅5年从教师晋升副县长,耀眼明星终落马

江西省农业厅副厅长曹爱珍:仅5年从教师晋升副县长,耀眼明星终落马

十为先生
2026-09-11 14:18:51
缅北七年亲历者讲述:男女都会遭性侵,坐水牢放毒蛇,伤口撒辣椒

缅北七年亲历者讲述:男女都会遭性侵,坐水牢放毒蛇,伤口撒辣椒

今朝牛马
2026-02-06 17:57:17
2026-10-08 06:03:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

头条要闻

中国新婚夫妇在马尔代夫度假溺亡 有人1天目睹2起溺水

头条要闻

中国新婚夫妇在马尔代夫度假溺亡 有人1天目睹2起溺水

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

蔡康永风波再升级!这次谁也救不了他

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

本地
房产
游戏
亲子
家居

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

曝《生化危机9》剧情DLC于2027年底推出

亲子要闻

赴美生子曾经很流行,5年暴涨过20倍,现在这些孩子怎么样了?

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版