图像生成模型调优新思路:让解码器“提前适应”生成器的潜变量

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
图像生成模型调优新思路:让解码器“提前适应”生成器的潜变量
9109点击    2026-10-10 12:34

图像生成模型调优新思路:让解码器“提前适应”生成器的潜变量


让图像生成模型先把图片压缩到潜空间,再由生成器在潜空间中作画,已成为常见路线。


为了挑选图像编码器和解码器,研究者往往先看“重建”——把原图编码后再解码,所得图片是否逼真。


但一个令人困惑的现象是,重建指标更好,并不能代表最终生成的图片更好。


论文《A Latent Distribution Perspective on Evaluating and Improving Latent Generative Models》追问:同一个解码器,为何在重建和生成时表现不同?


研究指出,两种任务送入解码器的潜变量来源不同。重建使用编码器从真实图片得到的潜变量;生成使用生成模型产出的潜变量。两者的分布存在差距,因此解码器在前者上的成绩,不能直接代表它处理后者的能力。


图像生成模型调优新思路:让解码器“提前适应”生成器的潜变量


△论文核心总览图:(a)重建与生成流程;(b)潜变量分布及GAR路径;(c)(d)rFID、GAR-FID与生成质量的相关性。


让重建逐步走向生成


为观察这一差距,作者提出“生成感知重建”(Generation-Aware Reconstruction,GAR):先编码真实图片,再向其潜变量加入不同程度的噪声,交由生成模型去噪,最后用解码器还原图片。


噪声程度逐渐提高时,解码器接收到的潜变量也逐步从“重建时所见”走向“生成时所见”。这条连续路径,让过去只比较两个终点的评估有了中间过程。


图像生成模型调优新思路:让解码器“提前适应”生成器的潜变量


△GAR的编码、加噪、生成模型去噪与解码流程。


图像生成模型调优新思路:让解码器“提前适应”生成器的潜变量


△编码器潜变量与生成潜变量在解码器不同层的分布对比。


图像生成模型调优新思路:让解码器“提前适应”生成器的潜变量


△GAR中间潜变量与重建、生成两端分布的距离变化。


基于这一路径,论文提出GAR-FID,用于衡量解码器在生成相关潜变量上的表现。在论文测试的不同视觉分词器与生成器组合中,传统重建FID(rFID)与生成FID(gFID)相关性弱,部分设置下甚至呈负相关;在指定噪声水平下,GAR-FID与gFID的排序相关性显著增强。


例如,在混合SiT-B/XL的测试设置中,GAR-FID在噪声水平0.8时与无引导生成gFID的Spearman相关系数为0.99。这里的相关性是所测试模型中的经验结果,不能理解为对任意生成模型都成立的保证。


图像生成模型调优新思路:让解码器“提前适应”生成器的潜变量


△rFID、iFID与GAR-FID对生成质量的相关性。


评估发现的问题,也能指导改进


GAR路径中间的潜变量还有一个优势:它们更接近生成时的分布,同时仍与原始图片保持对应。作者据此提出“解码器适配”:固定编码器和生成模型,只用这些中间潜变量微调解码器,让它练习处理实际生成时更可能遇到的输入。


在ImageNet-1k的256×256类别条件图像生成实验中,作者测试了四种规模的iMF模型。采用论文所述iMF官方评估协议、且不使用分类器自由引导时,适配后iMF-B/2的gFID从16.58降至12.21,iMF-XL/2从9.78降至7.47;其余两种规模也获得改善。此外,CFG-aware适配仅训练一轮,使带引导的iMF-XL/2 gFID从1.73降至1.50。由于只更新解码器权重,这一步不增加推理流程的额外计算。


图像生成模型调优新思路:让解码器“提前适应”生成器的潜变量


△解码器适配前后的生成FID:四种模型规模、有无CFG,以及iMF官方与OpenAI两套评估协议。


这项工作揭示了:评估视觉分词器时,除了看它能否准确“复原”输入,也应看解码器能否适应生成器真正提供的潜变量。GAR为观察这段分布变化提供了工具,解码器适配则展示了如何利用这一观察改善图像生成。


论文作者:Xianghong Fang、Wenjie Shu(共同第一作者)、Tongda Xu、Wenlong Mou、Dehan Kong、Tim G. J. Rudner。研究机构:多伦多大学;Tongda Xu为独立研究者。论文链接:https://arxiv.org/abs/2609.24088项目主页:https://sunset-clouds.github.io/Generation-Aware-Reconstruction/代码:https://github.com/sunset-clouds/Generation-Aware-Reconstruction


文章来自于微信公众号 “量子位”,作者 “量子位”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner