Spatio-Temporal Graph Convolution Transformer for Video Question Answering

Jiahao Tang; Jianguo Hu; Wenjun Huang; Shengzhi Shen; Jiakai Pan; De-Ming Wang; Yanyu Ding

doi:10.1109/access.2024.3445636

ScienceGate Book Chapters

JOURNAL ARTICLE

Spatio-Temporal Graph Convolution Transformer for Video Question Answering

Jiahao Tang Jianguo Hu Wenjun Huang Shengzhi Shen Jiakai Pan De-Ming Wang Yanyu Ding

Year: 2024 Journal: IEEE Access Vol: 12 Pages: 131664-131680 Publisher: Institute of Electrical and Electronics Engineers

DOI: 10.1109/access.2024.3445636

Get Full-Text PDF Get Analytical Report

Abstract

Currently, video question answering (VideoQA) algorithms relying on video-text pretraining models employ intricate unimodal encoders and multimodal fusion Transformers, which often lead to decreased efficiency in tasks such as visual reasoning. Conversely, video question answering algorithms based on graph neural networks often exhibit suboptimal performance in video description and reasoning, attributed to their simplistic graph construction and cross-modal interaction designs, necessitating additional pretraining data to mitigate these performance disparities. In this work, we introduce the Spatio-temporal Graph Convolution Transformer (STCT) model for VideoQA. By leveraging Spatio-temporal Graph Convolution (STGC) and dynamic graph Transformers, our model explicitly captures the spatio-temporal relationships among visual objects, thereby facilitating dynamic interactions and enhancing visual reasoning capabilities. Moreover, our model introduces a novel cross-modal interaction approach utilizing dynamic graph attention mechanisms to adjust the attention weights of visual objects based on the posed question, thereby augmenting multimodal cooperative perception. By addressing the limitations of graph-based algorithms dependent on pretraining for performance enhancement through meticulously designed graph structures and cross-modal interaction mechanisms, our model achieves superior performance in visual description and reasoning tasks with simpler unimodal encoders and multimodal fusion modules. Comprehensive analyses and comparisons of the model’s performance across multiple datasets, including NExT-QA, MSVD-QA, and MSRVTT-QA datasets, have confirmed its robust capabilities in video reasoning and description.

Keywords:

Computer science Question answering Transformer Overlap–add method Convolution (computer science) Graph Artificial intelligence Theoretical computer science Mathematics Voltage Electrical engineering Fourier transform

Metrics

Cited By

1.59

FWCI (Field Weighted Citation Impact)

Refs

0.75

Citation Normalized Percentile

Is in top 1%

Is in top 10%

Citation History

Topics

Multimodal Machine Learning Applications

Physical Sciences → Computer Science → Computer Vision and Pattern Recognition

Human Pose and Action Recognition

Physical Sciences → Computer Science → Computer Vision and Pattern Recognition

Advanced Image and Video Retrieval Techniques

Physical Sciences → Computer Science → Computer Vision and Pattern Recognition

Spatio-Temporal Graph Convolution Transformer for Video Question Answering

Abstract

Metrics

Citation History

Topics

Related Documents

Video Graph Transformer for Video Question Answering

Question answering over spatio-temporal knowledge graph

Cross-Attentional Spatio-Temporal Semantic Graph Networks for Video Question Answering

Keyword-Aware Relative Spatio-Temporal Graph Networks for Video Question Answering

Contrastive Video Question Answering via Video Graph Transformer