01 / 文生图
从视觉理解到图像生成
文生图示例。点击图片查看原始英文提示词。
原始英文提示词:A Van Gogh style painting of a cyberpunk city at sunrise.
02 / 自监督后训练
图像本身
就是监督信号
Reconstruction Alignment (RecA)让预训练的统一多模态模型根据自身的视觉理解特征重建图像,以原图作为训练目标。
这一 语义重建目标实现了理解到生成的能力迁移:提升文生图与图像编辑能力,并沿用模型原有的推理接口。

理解图像
以预训练模型的视觉理解特征作为条件信号。
重建语义
通过语义信息瓶颈,让模型在重建过程中学习有意义的视觉结构。
迁移到生成
文生图与图像编辑继续使用原有推理接口。
训练范围。重建目标无需图像描述。理解与生成共享参数的模型同时保留图像到文本训练,以维持理解能力;解耦的理解模块可以冻结。论文评测涵盖Show-o, Harmon, OpenUni, and BAGEL. 各模型架构的复现指南 ↗
监督信号的差距
图像包含的信息比描述更丰富
文字描述往往遗漏细粒度属性、空间关系与视觉细节。视觉理解特征能提供更密集的监督信号。

理解与生成的差距
理解一个概念,未必能生成它
统一模型可能识别出一个视觉概念,却难以生成它。RecA 用语义重建连接这两种能力。

03 / 实验结果
更好的生成
更强的编辑
利用视觉理解进行生成模型后训练,在不同任务与架构上取得提升。
文生图
Harmon-1.5B → Harmon-1.5B + RecA
另一套独立的SFT → RecA配置先使用 GPT-4o-Image 蒸馏数据进行监督微调,再进行 RecA,达到0.90 GenEval / 88.15 DPG-Bench.
图像编辑
BAGEL → BAGEL + RecA
这一 BAGEL 实验使用10,000 张无标注图像、1,000 个训练步,总计27 A100 GPU-hours.
完整基准表格与分类结果



04 / 图像编辑
改变光线,调整细节
BAGEL-RecA 编辑示例。拖动分隔线,对比原图与编辑结果。












键盘操作:聚焦对比图后,使用方向键调整。体验 BAGEL-RecA ↗
@inproceedings{xie2026reconstruction,
title={Reconstruction alignment improves unified multimodal models},
author={Xie, Ji and Zettlemoyer, Luke and Wang, Xudong and others},
booktitle={International Conference on Learning Representations},
volume={2026},
pages={120095--120137},
year={2026}
}