ByteDance Seed 团队在最新研究中把文生图模型的一个长期被忽视的变量单独拎了出来:训练图像所配 Caption 到底向模型传递了多少真正有用的图像信息。团队给出的核心结论是,随着文本条件扩展,真正增长的关键并不是 Caption 的 token 数量,而是其中可被模型利用的图像信息。
这项工作对应的论文题为《Scaling Properties of Text Conditioning in Visual Generation》,作者为 Zilong Chen、Chaorui Deng、Kunchang Li、Hongyi Yuan 和 Haoqi Fan,机构为 ByteDance Seed。团队同时公开了论文、项目主页、代码、模型和在线 Demo。
- 论文:https://arxiv.org/abs/2607.29679
- 项目主页:https://heheyas.github.io/context-scaling
- 代码:https://github.com/heheyas/context-scaling
- 模型:https://huggingface.co/collections/heheyas/context-scaling
- 在线 Demo:https://heheyas-context-scaling.hf.space/
- Hugging Face Paper:https://huggingface.co/papers/2607.29679
长度变长,不等于监督变强
过去几年,文生图模型的提升大体沿着扩大模型、增加数据和提高训练算力这条路径推进。但与语言模型不同,文生图模型并不是直接从文本序列中做自监督学习,而是依赖图像与 Caption 的配对,学习文字和视觉内容之间的对应关系。
团队指出,图像中可能包含大量物体、属性、位置、动作和关系,但只有被 Caption 准确描述并清晰绑定的部分,才会作为文本条件监督传给模型。由此引出一个基础问题:如果不只继续扩大模型、数据和算力,而是提高 Caption 携带的图像信息,生成模型能否学得更好。
一个直觉做法是把训练 Caption 或用户 Prompt 写得更长、更细。实验结果并没有支持这一点。团队在多种现有开源文生图系统上发现,自然语言 Prompt 随长度增加很快就会饱和,最终输出甚至低于各自最短 Prompt 的表现。即便专门用同一套长文本 Caption 训练扩散模型,收益也相当有限。
为了更清楚地观察这一现象,团队设计了一个固定骨干网络的图像重建实验。对同一张参考图像,研究人员从同一份完整标注出发,生成四个详细程度逐步增加的自然语言 Caption,再使用相同的 Qwen-Image 模型和随机种子尝试还原该图像。这些 Caption 描述的是同样的实体和关系,后续版本主要通过补充和展开自然语言表达来增加长度。

结果显示,Caption 虽然明显变长,图像重建质量却几乎不再提升。新增 prose 更多是在解释、改写或连接已经出现的内容,没有持续加入新的、可被稳定使用的视觉变量。团队据此认为,Caption 长度只是一个很弱的代理变量。文本可以很长,但仍未清楚说明某个属性属于哪个物体、两个物体之间是什么关系、它们分别位于哪里,以及画面中的前后层次。
用 GPG 和 ED 测量文本中的图像信息
既然 token 数量不足以衡量监督强弱,团队转而直接测量 Caption 中与图像绑定的信息。为此,研究人员改造了两个互补指标:Grounded Perplexity Gain(GPG)和 Effective Detailness(ED)。
GPG 是一个白盒指标,需要读取模型 token 概率。对同一句 Caption,团队分别让一个冻结的视觉语言模型看到和看不到配对图像,再计算图像出现后 Caption 内容 token 的对数似然提升。若 Caption 包含大量与图像紧密绑定的信息,模型看到图像后,对这些 token 的预测能力应当明显增强。
ED 是一个黑盒语义指标,不依赖 token 概率。它分别从图像和 Caption 中提取带有实体上下文的属性,再计算 Caption 属性的准确率和图像属性的召回率,最终采用更重视准确率的 F0.5,对没有图像依据的描述施加更强惩罚。
两个指标从不同角度刻画同一个问题。GPG 关注图像与文本之间的统计依赖,ED 关注 Caption 是否准确覆盖可验证的视觉内容。

文本信息量与扩散训练损失呈稳定关系
接下来,团队固定图像、模型架构、初始化方式、优化配置和训练预算,只改变训练 Caption。整个实验一共包含 15 种 Caption 配置:3 个不同长度的自然语言版本、6 个逐步恢复字段的 Structured Prompt 版本,以及 6 个空间表达或字段遮蔽变体。每种配置都从同一个 BAGEL continued-training checkpoint 出发,独立训练一个扩散模型。
结果显示,自然语言 Caption 的 token 数与训练结果之间不存在统一关系。但把横轴换成 Caption 信息量后,不同格式和详细程度的配置落在了高度规律的曲线上。
- 收敛后的 diffusion loss 与 GPG 近似呈线性关系,Pearson r = -0.984;
- 收敛后的 diffusion loss 与 ED 呈幂律趋势,log-log 空间中的 Pearson r = -0.971;
- GPG 与 ED 对不同 Caption 配置的排序也高度一致,Spearman ρ = 0.96。
团队把这一现象称为 text conditioning 的 scaling properties。研究同时说明,这并不是一个对所有模型都成立的理论定律,而是在固定架构与训练 recipe 下得到的经验标定。
这一标定带来两个直接价值。其一,Caption 信息量不再只是模糊的数据质量概念,而成为可控制、可测量的训练变量。在模型、图像和算力不变时,信息量能够预测模型最终达到的训练损失。其二,完成一次标定后,可以先用 GPG 或 ED 比较候选 Caption 方案,再决定是否投入成本更高的扩散模型训练。对未参与拟合的 6 个 Caption 变体,这两个指标仍能较准确预测其收敛损失。
Structured Prompt:把视觉变量组织进命名字段
前述实验指向一个更具体的问题:自然语言 prose 即使变长,如果新增信息没有被稳定、明确地组织起来,模型也难以继续受益。基于这一点,团队提出 Structured Prompt(SP),使用结构化 JSON 表示图像中的视觉变量。
Structured Prompt 包含三个层次:

- 全局层:画面意图、场景、氛围、风格、光照和摄影信息;
- 元素层:每个主体的身份、属性、动作、位置、可选深度和局部摄影信息;
- 关系层:不同元素之间的位置、遮挡、交互和语义关系。
团队强调,SP 的关键不只是用了 JSON 这种外观,而是让不同视觉变量进入稳定的命名字段,减少属性归属、空间关系和对象绑定上的歧义。在固定骨干重建实验中,随着 SP 字段逐步恢复,重建质量持续提高;在完整训练 sweep 中,字段覆盖增加也同步提高 GPG 和 ED,并降低收敛后的 diffusion loss。
为了在大规模训练数据上生成完整 SP,团队构建了一套 image-to-SP 标注流水线。通用视觉语言模型负责全局语义和局部内容,Sapiens 补充人体姿态证据,DepthAnything V2 提供相对深度,SAM 2.1 提供掩码与遮挡线索,最后再由视觉语言模型把这些信息统一整理为一致的完整 SP。
Diffusability 与 Promptability 被同时纳入系统设计
团队把一个 Caption 表示向扩散模型暴露并组织图像监督的能力称为 Diffusability。SP 提升的就是这一侧:在不改变扩散模型架构的情况下,让模型从文本条件中学习更多、更明确的视觉变量。
但训练阶段可以从配对图像中提取完整 SP,实际生成时只有用户的一句话,没有参考图像或 oracle 标注。系统还需要一个 LLM prompter,把用户请求扩展成详细、连贯、且不违反原始约束的 SP。团队把这种从用户请求实例化结构化条件的能力称为 Promptability。
文中给出的组织方式是:

Generation Quality = Diffusability × Promptability
团队说明,这里的乘号是一种组织视角,不是拟合得到的数学乘法公式。Diffusability 描述扩散模型能够从 Caption 表示中学到什么,Promptability 描述 LLM 在推理时能否真正填出高质量的 Caption 实例。
固定 diffuser 后,prompter 的规模和训练方式继续拉高结果
团队首先固定 SP schema 和 Qwen-Image diffuser,只替换零样本 LLM prompter。随着 Qwen3.5 从 0.8B 扩展到 397B,thinking 模式下的 GenEval++ 从 46.4% 提升到 86.8%。研究同时提到,除最小模型容易在思考过程中重复、无法输出有效 JSON 外,chain-of-thought 在其他尺度上都带来额外提升。
这部分结果说明,通用 LLM 的模型能力和推理能力,可以通过 Caption 接口直接转化成更好的图像生成表现。
不过,零样本 LLM 仍倾向生成信息不足、构图较简单的 SP。为提升 Promptability,团队又引入三阶段训练:
- SFT:学习扩散模型所期望的 SP 内容分布,而不只是 JSON 格式;
- Cold-start:从带有配对图像的 privileged reasoning traces 中蒸馏「如何仅根据用户请求推导 SP」;
- RFT:在 prompter 自己生成并渲染的 rollout 上继续优化,由 verifier 筛选高置信轨迹,再通过 image-conditioned teacher 的 on-policy self-distillation 提供稠密 token 监督。
消融实验显示,这三阶段承担的作用并不相同。SFT 带来最大的单阶段结构提升,cold-start 强化从用户请求到 SP 的推导,而 verifier-gated OPSD 在 prompter 自身分布上取得最强结果。

结构化字段也更适合迭代修正
Structured Prompt 还有一个直接优势:生成图像出错时,系统可以定位并修改对应的对象、属性、关系或布局字段,而不是重新改写整段自然语言 Prompt。
基于这一点,团队构建了 refine-render-judge 循环。每一轮中,prompter 根据用户请求和历史反馈生成或修订 SP,固定 diffuser 负责渲染图像,在线 judge 再针对 Prompt 遵循、结构和视觉质量给出 PASS 或 FAIL 以及具体问题。若失败,下一轮只围绕相关字段调整即可。
实验显示,增加迭代预算可以继续提升结构、对齐和 GSB 表现,但有效推理长度并不长。对于训练后的 prompter,即便允许最多 8 轮,平均也只使用 2.31 轮;从 Tmax = 4 增加到 8,收益已经很小。团队据此认为,文生图可以从迭代纠错中获益,但在当前设置下并不需要很长的 prompt-side reasoning trajectory,主要规格错误修复后,额外轮次会很快饱和。
在相同 Qwen-Image 条件下,结构化接口带来更强结果
最终系统由 SP-trained diffuser 与训练后的 LLM prompter 组成。论文称,该系统在几乎所有报告指标上领先所比较的开源权重模型,并在大多数评测上达到或超过所比较的闭源系统,优势在组合、推理和世界知识任务上尤其明显。
团队还设置了 matched control,用来排除「只是多训练了一些」这种解释。研究人员使用完全相同的 Qwen-Image 架构、训练图像、训练阶段和预算,额外训练了一套始终使用自由自然语言 Caption 的系统。

结果显示,Matched NL 的额外训练确实带来了一些提升,但远不足以复现 SP 系统的结果。团队据此认为,这部分收益不能简单归因于更大的 backbone 或更多训练,而与 prompter 和 diffuser 之间采用的结构化 Caption 接口密切相关。
研究把注意力从模型规模扩展到条件本身
这项工作的出发点并不复杂:对文生图模型来说,Caption 不是可有可无的元数据,而是图像内容进入文本条件学习的主要接口。
当 Caption 只是变长时,新增 token 可能只是改写和铺陈;当图像信息被准确提取、清晰绑定并稳定组织时,同一个生成模型才能从中学到更多。GPG 和 ED 把这种信息变成可测量的变量,Structured Prompt 提高 Diffusability,LLM scaling、post-training 和短程 agentic refinement 则提升 Promptability。
按照团队在论文中的表述,文生图下一步的 scaling 不应只关注负责渲染的模型有多大,也要关注传递给模型的文本条件,究竟携带了多少它真正能够学习和使用的图像信息。
本文来自微信公众号「机器之心」,由 MarsBit 发布。

