ACM Transactions on Multimedia Computing Communications and Applicatio

Papers
(The H4-Index of ACM Transactions on Multimedia Computing Communications and Applicatio is 40. The table below lists those papers that are above that threshold based on CrossRef citation counts [max. 250 papers]. The publications cover those that have been published in the past four years, i.e., from 2022-08-01 to 2026-08-01.)
ArticleCitations
Hypercube Pooling for Visual Semantic Embedding554
Self-Adaptive Representation Learning Model for Multi-Modal Sentiment and Sarcasm Joint Analysis175
Category-Level Pose Estimation and Iterative Refinement for Monocular RGB-D Image173
ForgeFinder: Perceptive Multimodal Deepfake Detection via Multi-grained Forgery Localization127
Discriminative Action Snippet Propagation Network for Weakly Supervised Temporal Action Localization113
Fine-Grained Text-to-Video Temporal Grounding from Coarse Boundary91
Unsupervised Discovery and Manipulation of Continuous Disentangled Factors of Variation87
AED-PADA: Improving Generalizability of Adversarial Example Detection via Principal Adversarial Domain Adaptation86
Semi-supervised Learning for Mars Imagery Classification and Segmentation86
Enhanced Video Super-Resolution Network towards Compressed Data77
Towards Intelligent Attack Detection Using DNA Computing70
Psychology-Guided Environment Aware Network for Discovering Social Interaction Groups from Videos70
Establishing Trust and Security in Decentralized Metaverse: A Web 3.0 Approach69
CVLP-NaVD: Contrastive Visual-language Pre-training Models for Non-annotated Visual Description64
Upsampling Algorithm for V-PCC-Coded 3D Point Clouds61
A Siamese Inverted Residuals Network Image Steganalysis Scheme based on Deep Learning59
QuickCSGModeling: Quick CSG Operations Based on Fusing Signed Distance Fields for VR Modeling59
Tensorial Evolutionary Optimization for Natural Image Matting57
Exploring Talking Head Models with Adjacent Frame Prior for Speech-Preserving Facial Expression Manipulation56
High Feature Distinguishability for Adaptive Image-text Matching with Dual-stream Transformers55
JDAN: Joint Detection and Association Network for Real-Time Online Multi-Object Tracking55
Image Cropping with Content and Composition Attribute-aware Global Relation Reasoning52
Reconstruction-Free Image Compression for Machine Vision via Knowledge Transfer52
A Comprehensive Survey on Methods for Image Integrity51
Attentional Composition Networks for Long-Tailed Human Action Recognition51
Backdoor Two-Stream Video Models on Federated Learning49
Towards Generalizable Deepfake Detection by Primary Region Regularization48
Disentangled Multimodal Tuning and Interaction for Human Perception Understanding48
LAM-MD: A Large Action Model Integrated Multi-Agent Reinforcement Learning Framework for NOMA Networks48
BiC-Net: Learning Efficient Spatio-temporal Relation for Text-Video Retrieval47
Infrared and Visible Image Fusion via Text-Prior Guided Frequency-Domain Decomposition47
SEADUNet: A Multilingual Ancient Document Image Binarization using EMCAM Attention Mechanism and SCP47
Quantum Fourier Convolutional Network47
Joint Mixing Data Augmentation for Skeleton-Based Action Recognition44
Seeing in the Dark with Ambient Guidance44
From Recognition to Prediction: Leveraging Sequence Reasoning for Action Anticipation44
HTTP Adaptive Streaming: A Review on Current Advances and Future Challenges43
A novel image hashing with visual and structural feature maps for content authentication43
Point Cloud Quality Assessment: Dataset Construction and Learning-based No-reference Metric42
New Metrics and Dataset for Biological Development Video Generation41
Expanding-Window Zigzag Decodable Fountain Codes for Scalable Multimedia Transmission40
Visual-linguistic-stylistic Triple Reward for Cross-lingual Image Captioning40
0.06958794593811