【论文阅读】TOWARDS ALIGNED LAYOUT GENERATION VIADIFFUSION MODEL WITH AESTHETIC CONSTRAINTS
1. 研究背景
自动化布局生成(Layout Generation)广泛应用于网页设计、UI 设计、城市规划、出版排版等领域。其任务分为:
-
无条件生成:完全从零生成布局;
-
有条件生成:在用户指定元素类别、大小、位置、未完成布局的情况下生成。
以往方法包括:
-
GAN、VAE:早期尝试,但生成质量有限;
-
Transformer 模型:能较好保持元素的对齐(alignment),但 FID 分数偏高;
-
扩散模型(Diffusion):近年主流,生成质量好、控制能力强,但容易出现 对齐差、元素重叠 等美学问题。
特别是:
-
离散扩散模型(Discrete Diffusion):通过逐步生成离散元素,能保持部分对齐性,但缺乏全局调整能力;
-
连续扩散模型(Continuous Diffusion):从随机布局逐步精炼到合理布局,灵活性更强,但 对齐差、元素重叠 更严重。

2. Method
LACE 在连续 DDPM 框架上,把每个元素用一个向量表示(类别 logits + 连续 bbox 四维),对这个向量序列做高斯噪声的前向/反向扩散;在训练中,不仅用标准的噪声预测损失,还在重建(reconstruction)上加可微分的美学约束(对齐 & 重叠),并用 mask 输入统一多任务;推理可用 DDIM 快速采样,并在必要时对几何属性做后处理优化。
前向过程:

反向过程与噪声预测:

从网络输出得到 x0:
实现注意:当 αˉt 非常小(极大噪声阶段),分母接近 0,数值不稳定 —— 在那些步骤通常不应用约束(见时间权重部分)。在实现中,按 batch 与 mask 做元素级的操作,确保 padding 元素不参与损失计算。
方法设计

元素向量的具体定义
-
布局被定义为:

-
ci:元素类别(one-hot 编码,N+1 类,其中 +1 表示 padding)
-
bi:元素边界框 (x, y, w, h),归一化到 [0,1]
-
-
为了统一长度,布局被 padding 到长度 L。
与离散扩散不同:
-
不再将边界框量化为离散格子,而是直接在连续空间中加入高斯噪声。
-
类别标签用连续向量表示(t>0 时不是 one-hot)。

Mask-based 条件建模

-
将 mask 作为额外的 feature channel(或 token),并注入 transformer;也可使用特殊 embedding 做 time/condition injection。保证在反向传播中 mask 的“已知”部分不被网络修改(或网络被告知这些是“常量”)。
RECONSTRUCTION AND AESTHETIC CONSTRAINTS
论文在这里的关键贡献:在 continuous diffusion 下利用可微分的**对齐(alignment)与重叠(overlap)**约束来改进视觉美学。

核心创新:在重建损失里引入 对齐约束 (Alignment Loss) 和 重叠约束 (Overlap Loss)。
对齐约束(Alignment)
论文给了两种对齐损失:local(局部)与global(全局)。先理解盒子坐标表示。

Local alignment(论文 Eq. (8)):



Global alignment(论文 Eq. (9))
论文认为真实设计中存在复杂的全局对齐模式(某些元素与多个元素对齐)。他们用训练集中真实 layout 的对齐 mask作为监督:
-
先定义对齐差矩阵(每个对齐类型 *):A
-

- global loss:


重叠约束 (Overlap Loss)
目标:减少元素之间的重叠(IoU),并额外惩罚“完全包含但中心非常靠近”的情形(因为 IoU 对完全包含可能产生平坦平面)。



时间依赖权重 (ωt)
-
在噪声较大的步骤,关闭约束,避免训练陷入局部最优;
-
在接近收敛的步骤再启用约束,细化布局质量。

后处理
即使模型训练有约束,生成结果可能还有小的错位:
-
在推理时,基于生成结果的 对齐模式(通过阈值 δ 筛选“近似对齐”元素),再进行一次 约束优化,进一步提高美观度。

4. 实验结果
-
指标:FID(视觉质量)、Alignment score、MaxIoU(避免重叠)。
-
结果:
-
LACE 在 FID 与对齐/重叠指标上均优于 SOTA;
-
特别是在 无条件生成 场景下显著超越 Transformer 和离散扩散模型。
-
3. Related Work
(1) 传统方法
-
能量优化模型:基于设计原则的能量目标函数(O’Donovan et al. 2014/2015);
-
深度生成模型:
-
LayoutVAE (Jyothi 2019)、LayoutGAN (Li 2020):基于 VAE/GAN 的有条件布局生成;
-
LayoutGAN++ (Kikuchi 2021):改进无条件生成,并提出 CLG-LO 框架对齐美学约束;
-
LayoutTransformer (Gupta 2021), VTN (Arroyo 2021):基于自回归 Transformer,提升多样性,但对条件生成不友好;
-
BLT (Kong 2022):双向 Transformer,支持条件生成,但需指定元素数 → 不能做补全;
-
LayoutFormer++ (Jiang 2023):引入解码策略,但需回溯修正错误生成 → 效率低,需重训以适配不同任务。
-
(2) Diffusion-based 方法
-
离散扩散 (Discrete Diffusion)
-
PLay (Cheng 2023):引导线对齐;
-
LayoutDM (Inoue 2023), LDGM (Hui 2023):统一多任务,采用属性特定 (attribute-specific) 的 mask-and-replace 策略;
-
LayoutDiffusion (Zhang 2023):扩大 Transformer 主干,显著提升质量和对齐,但依赖大规模架构。
-
-
连续扩散 (Continuous Diffusion)
-
He 2023:生成连续嵌入,但几何属性仍量化为离散 token → 不可微;
-
Chai 2023:DDPM 直接生成连续几何属性,条件为类别。优势:不需要 attribute-specific corruption;局限:未同时建模类别和几何属性,未引入美学约束。
-
(3) LACE 的差异化
-
同时生成 类别 + 几何属性,统一在连续空间;
-
引入 可微分美学约束(对齐 + 重叠) 提升视觉质量;
-
使用 mask 策略 统一五个任务;
-
无需扩大网络规模,仅依靠约束和训练策略提升质量。
4. 实验
(1) 数据集
-
PubLayNet:33 万文档布局,5 类元素 → 过滤 >25 元素,pad 至 25;
-
Rico:7.2 万 UI 布局,9.7k app,27 类 → 仅取 25 类频繁类,pad 至 25。
(2) 评价指标
-
FID:视觉质量(特征分布差异);
-
MaxIoU:元素对齐度量(条件生成场景);
-
Alignment:对齐度(归一化分数);
-
Overlap:重叠率(仅 PubLayNet 评估)。
(3) 任务设置
五类任务(统一由 mask 实现):
-
无条件生成 (U-Cond);
-
类别条件 → 生成大小和位置 (C→S+P);
-
类别+大小条件 → 生成位置 (C+S→P);
-
Completion:随机保留 0–20% 元素作为条件;
-
Refinement:在已有布局上加噪声,再修复。
(4) 对比模型
-
传统模型:LayoutVAE, LayoutGAN++, LayoutTransformer, BLT, RUITE, MaskGIT 等;
-
扩散模型:VQDiffusion, LayoutDM。
(5) 结果
-
LACE (local / global) 在四个任务中超越 SOTA:
-
FID 更低(质量高),
-
Alignment、Overlap 更优(美学更好);
-
-
全局对齐约束 在 PubLayNet 上优势明显(因文档布局有更多对齐模式);
-
Post-processing:显著提升 alignment,FID 保持稳定甚至略提升;
-
Refinement:利用连续扩散的“反噪声”特性,天然适合修复任务,性能优于 baseline。


4.3 Ablation Study
-
移除约束 → Alignment 变差,FID 略升;
-
保留约束 → Alignment 显著改善,FID 下降;
-
Post-process:
-
有约束 → Alignment 进一步提升,FID 不变;
-
无约束 → 效果有限,因为初始结果坐标差异过大,阈值检测不到。
-
-
任务统一性验证:单模型能匹配专用模型性能。

附录
-
A. 与 LayoutDM/ LayoutGAN++ 比较
-
直接加后处理 → 这两者 FID 反而升高;
-
LACE → FID 稳定,Alignment/Overlap 更优。
-


-
B. 实现细节
-
时序约束权重 ωt:在噪声过大时关闭约束,避免陷入局部最优;
-


-
-
后处理阈值 δ:经验选择 1/64 canvas 尺度;
-
架构:基于 LayoutDM 的 Transformer backbone(4 层、16 heads、FFN=2048、embedding=512/1024),+ 两个 FNN 编码/解码元素;
-
训练策略:两阶段
-
阶段 1:不加约束训练,优化 FID;
-
阶段 2:加约束,优化 Alignment 与 FID;
-
-
采样:1000 步 forward,推理用 DDIM 100 步。
-
5. 结论
-
贡献:提出连续扩散 + 美学约束,统一任务框架,性能优于 SOTA。
-
局限:
-
仅限矩形框 → 无法表达复杂形状;
-
无内容感知(背景、文本、图像语义);
-
固定标签集、元素数量有限。
-
-
未来方向:
-
引入任意形状元素,更贴近真实设计;
-
融合图像/文本条件,提升语义相关性;
-
用于下游任务,如 布局驱动图像生成、自动化网页设计。
-
LACE 是 第一个在连续空间同时生成类别 + 几何属性,并用可微分美学约束提升质量的统一扩散模型。相比 LayoutDM/LDGM 依赖离散化和特定 corruption 策略,LACE 更优雅简洁,同时在实验上更稳定有效。
更多推荐


所有评论(0)