关键词
Image Generation,Learning Capacity,Latent Representation,Reconstruction Quality,Compact Representation,Caption Text,Compression Rate,Detailed Visualization,Fine-grained Details,High-level Semantics,Model Size,Diffusion Model,Latent Space,Fine Details,Language Model,Classification Categories,Evaluation Protocol,Image Patches,Peak Signal-to-noise Ratio,Fréchet Inception Distance,Qualitative Sample,Vision Transformer,Output Image,Reconstruction Performance,Text Encoder,Structural Similarity Index Measure,Variational Autoencoder,Image Captioning,Learning Image