Geometry Aligned Variational Transformer for Image-conditioned Layout Generation

Yunning Cao; Ye Ma; Min Zhou; Chuanbin Liu; Hongtao Xie; Tiezheng Ge; Yuning Jiang

doi:10.1145/3503161.3548332

ScienceGate Book Chapters

JOURNAL ARTICLE

Geometry Aligned Variational Transformer for Image-conditioned Layout Generation

Yunning Cao Ye Ma Min Zhou Chuanbin Liu Hongtao Xie Tiezheng Ge Yuning Jiang

Year: 2022 Journal: Proceedings of the 30th ACM International Conference on Multimedia Pages: 1561-1571

DOI: 10.1145/3503161.3548332

Get Full-Text PDF Get Analytical Report

Abstract

Layout generation is a novel task in computer vision, which combines the challenges in both object localization and aesthetic appraisal, widely used in advertisements, posters and slides design. An accurate and pleasant layout should consider both the intra-domain relationship within layout elements and the inter-domain relationship between layout elements and image. However, most previous methods simply focus on image-content-agnostic layout generation, without leveraging the complex visual information from the image. To this end, we explore a novel paradigm entitled image-conditioned layout generation, which aims to add text overlays to an image in a semantically coherent manner. Specifically, we propose an Image-Conditioned Variational Transformer (ICVT) that autoregressively generates various layouts in an image. First, self-attention mechanism is adopted to model the contextual relationship within layout elements, while cross-attention mechanism is used to fuse the visual information of conditional images. Subsequently, we take them as building blocks of conditional variational autoencoder (CVAE), which demonstrates appealing diversity. Second, in order to alleviate the gap between layout elements domain and visual domain, we design a Geometry Alignment module, in which the geometric information of the image is aligned with the layout representation. In addition, we construct a large-scale advertisement poster layout designing dataset with delicate layout and saliency map annotations. Experimental results show that our model can adaptively generate layouts in the non-intrusive area of the image, resulting in a harmonious layout design.

Keywords:

Computer science Image (mathematics) Overlay Artificial intelligence Computer vision Autoencoder Representation (politics) Page layout Domain (mathematical analysis) Transformer Deep learning Mathematics Engineering

Metrics

Cited By

2.28

FWCI (Field Weighted Citation Impact)

Refs

0.91

Citation Normalized Percentile

Is in top 1%

Is in top 10%

Citation History

Topics

Advanced Image and Video Retrieval Techniques

Physical Sciences → Computer Science → Computer Vision and Pattern Recognition

Multimodal Machine Learning Applications

Physical Sciences → Computer Science → Computer Vision and Pattern Recognition

Generative Adversarial Networks and Image Synthesis

Physical Sciences → Computer Science → Computer Vision and Pattern Recognition

Geometry Aligned Variational Transformer for Image-conditioned Layout Generation

Abstract

Metrics

Citation History

Topics

Related Documents

Self-refined variational transformer for image-conditioned layout generation

DLT: Conditioned layout generation with Joint Discrete-Continuous Diffusion Layout Transformer

Collaborative Control for Geometry-Conditioned PBR Image Generation

Collaborative Control for Geometry-Conditioned PBR Image Generation

Style-VT: Style Conditioned Chord Generation by Variational Transformer With Chord Substitution