The technical program of ACM ICMR 2026 runs from Wednesday 17 June to Friday 19 June 2026 at the KIT Royal Tropical Institute in Amsterdam. The week opens on Tuesday 16 June with LSC'26, workshops, tutorials and the SIGMM European Chapter Symposium. The week-at-a-glance schedule, including social events, is shown below.
Click the schedule to open it as a PDF. Parallel sessions running at the same time are shown side by side. The full session-by-session listing with paper titles and authors is below; the complete agenda is also on the Whova event page.
Full Agenda
The complete agenda, including all sessions, papers, demos, and social events, is hosted on the official ICMR 2026 Whova event page below. You can also open the agenda in a new tab.
Wednesday, 17 June 2026
Best Paper Candidates
- Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models
Zijie Zhou, Dandan Zhu, Hangxiangpan Wang, Heng Zhang, Huishen Jiao, Yi Zhao - Frozen LVLMs for Micro-Video Recommendation: A Systematic Study of Feature Extraction and Fusion
Huatuan Sun, Yunshan Ma, Changguang Wu, Yanxin Zhang, Pengfei Wang, Xiaoyu Du - Text4Radar-V2X: Text-guided 4D Radar for Cooperative 3D Object Detection
Xiangyuan Peng, Kay Bierzynski, Lorenzo Servadei, Robert Wille - Fine-Grained Cross-Modal Retrieval in Art via Region-Level Grounding of Symbolic Narratives
Mihai-Bogdan Bîndilă, Shenghui Wang, Gwenn Englebienne - Reflective Cross-Granularity Grounding with Preference Optimization for Long Video Understanding
Wei Feng, Xin Wang, Hong Chen, Yu-Wei Zhan, Zihan Song, Bin Huang, Kecheng Zheng, Wenwu Zhu
Multimedia Analysis, Representation, and Understanding 1
- Evidential Uncertainty Modulated Adaptive Predictive Contrastive Learning for Multimodal Fusion
Qiuyu Mei, Hong Yu, Shijie Yu, Yan Yang - Context-Aware Interpretable Representations for Retrieval and Graph Convolutional Network Classification
Thiago César Castilho Almeida, Gustavo Rosseto Letício, Vinicius Atsushi Sato Kawai, Daniel Carlos Guimarães Pedronette - SAM3-LiteText: An Anatomical Study of the SAM3 Text Encoder for Efficient Vision-Language Segmentation
Chengxi Zeng, Yuxuan Jiang, Ge Gao, Shuai Wang, Duolikun Danier, Bin Zhu, Stevan Rudinac, David Bull, Fan Zhang - RMPL: Relation-aware Multi-task Progressive Learning with Stage-wise Training for Multimedia Event Extraction
Yongkang Jin, Jianwen Luo, Jingjing Wang, Jianmin Yao, Yu Hong - Adaptive Spatial-Channel Masked Reconstruction Knowledge Distillation for Dense Prediction
Ziniu Liu, Shuheng Zhou, Jin Zeng, Mingqing Liu, Yulong Zhang, Hao Deng - SaF-AD: Saliency-Adaptive and Feature-Consistent Diffusion for Industrial Anomaly Detection
Yilong Liu, Yuanyang Zhang, Zirui Luo, Kaixi Xu, Yining Xu, Li Yao
Evaluation and Applications 1
- GAformer: Low-Light Image Enhancement Based on Gradient-Aware Kernel and Frequency-Modulated Transformer
Yifan Shuai, Ke Wang, Weiming Feng, Shuai Pang, Dehua Zhou, Yikui Zhai - NIGCL: Neuro-Image Geometric Contrastive Learning for Robust EEG-Based Visual Retrieval
Xueru Zhao, Yanrong Hao, Xin Wen, Mengni Zhou, Jing Bian, Rui Cao - Entropy-aware Mutual Student Co-training for Source-free Domain Adaptation in Medical Image Segmentation
Guangrun Chen, Xiaoli Yang, Litan Sun, Ming Jin, Xiaofeng Qu, Sijie Niu - Data-Centric Multimodal Pavement Distress Detection Using Intensity–Range Imagery
Wenhan Tao, Yongsheng Bai, Feng Wang, Jelena Tešić - Skeleton-Guided Spatio-Temporal Video Representation for Long-Term Action Quality Assessment
Zhiwei Hong, Qing Lei, Hongbo Zhang, Jixiang Du - Depth-Guided Perception and Policy-Driven Adaptation for Wind Turbine Anomaly Detection
Jing Guo, Baoqi Huang, Qing Miao, Bing Jia, Runze Yang - Ivy-Fake: A Unified Explainable Framework and Benchmark for Image and Video AIGC Detection
Changjiang Jiang, Wenhui Dong, Zhonghao Zhang, Fengchang Yu, Wei Peng, Xinbin Yuan, Yifei Bi, Ming Zhao, Zian Zhou, Chenyang Si, Caifeng Shan
Technical Demonstrations
- Real-Time Monitoring and Analysis of Rehabilitation Exercises from a Smartphone Camera Video Stream
Miriama Jánošová, Andrej Černek, Radovan Dvorský, Vasil Poposki, Petra Budikova, Jan Sedmidubsky - Keep Your Memories, Lose the Evidence: Privacy-Aware Lifelogging
Allie Tran - VideoCreator: An Agentic System for Multi-turn Video Production
Zhengyang Liang, Yan Shu, Cathal Gurrin, Nicu Sebe, Lizi Liao - TrackAnon: Towards Consistent Full-Body Anonymization
Emil Leidland, Duc-Tien Dang-Nguyen - Discovery of Visually Novel Content in Developing News Stories
Stefan Arzberger, Helmut Neuschmied, Werner Bailer - Realistic Virtual Flood Experience System Using 360° Videos and 3D City Models Constructed from Building Footprints
Tatsuro Banno, Koki Kawada, Mizuki Takenawa, Masatoshi Denda, Kiyoharu Aizawa - Context-Aware Visual Redaction Pipeline: Leveraging Vision-Language Models for High-Fidelity Content Inpainting
Arun George Zachariah, Barnaby Simkin, Nikki Pope, Jibin Varghese, Michael Boone
Thursday, 18 June 2026
User Interaction, Queries, and Perception
- On the Effectiveness of Integration Methods for Multimodal Dialogue Response Retrieval
Seongbo Jang, Seonghyeon Lee, Dongha Lee, Hwanjo Yu - What Drove Success at the 15th Video Browser Showdown? A Comprehensive Interaction-Logging Analysis
Bastian Jäckl, Omar Khan, Benjamin Verner, Zuzana Vopalkova, Udo Schlegel, Daniel Keim, Jakub Lokoc - A Pruning-based Question-Answering for Interactive Video Search: A Simple Baseline
Yu-Tong Cheng, Phuong Anh Nguyen, Chong-Wah Ngo - Agent-Based Query Reformulation: Simulating Feedback and Mitigating Negation Blindness in Interactive Image Retrieval
Hongyi Zhu, Shuai Wang, Jia-Hong Huang, Yixian Shen, Stevan Rudinac, Evangelos Kanoulas - Evaluating Keyframe Layouts for Visual Known-Item Search in Homogeneous Collections
Bastian Jäckl, Jiří Kruchina, Lucas Joos, Daniel Keim, Ladislav Peska, Jakub Lokoc - Optimization of Long-Running Media Aggregation Queries
Sigurður Þórarinsson, Björn Jónsson, Omar Khan
Multimedia Analysis, Representation, and Understanding 2
- AF-BEV: Object-Aware Adaptive Frustum-based BEV Aggregation for 3D Object Detection
Bingyu Zhu, Dongbo Yu, Yunbiao Wang, Jun Xiao, Haiyong Jiang - Semi-Automatic Correction of 3D Tubular Structure Skeletons via Component-Wise MST and Filtered Delaunay Triangulation
Ruoxuan Yang, Chuan Li - TAVEN: Task-driven Adaptive Viewpoint Exploration for Training-Free 3D Spatial Reasoning and Understanding
Shuyi Jiang, Zhihao Yuan, Na Zhao - SKG-VLA: Scene Knowledge Graph Priors for Structured Scene Semantics and Multimodal Reasoning for Decision Making
Zeyu Li, Lei Li - MixCache: Mixture-of-Cache for Video Diffusion Transformer Acceleration
Yuanxin Wei, Lansong Diao, Bujiao Chen, Shenggan Cheng, Zhengping Qian, Wenyuan Yu, Nong Xiao, Wei Lin, Jiangsu Du
Multimedia Retrieval Methods and Systems 1
- MMRet3D: A Multi-Modal Matching Framework for 3D Object Retrieval from Multi-View Images
Zeyu Li, Lei Li - AdRetr: Theme-Aware Advertisement Video Retrieval Beyond Keywords
Neha Choudhary, Abhiraj Painuly, Yaman Kumar, Varun Khurana, Poonam Goyal - GjPest4CMR: LLMs-Assisted Morphology-Aware Fine-grained Goji Pest Image-Text Retrieval
Wenkai Ma, Wentao Ma, Tan Wang, Yuwei Wang, Lu Liu, Junfei Yang, Xianbao Xu, Yuan Rao - MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
Fengbin Zhu, Zijing Cai, Yuzhe Wang, Pengyang Shao, Wenjie Wang, Fuli Feng, Richang Hong, Tat-Seng Chua - Calibrate and Aggregate: Cross-Modal Retrieval with Distribution Alignment and Token Reduction
Ziyi Wu, Jiahao Li, Mingyuan Jiu, Hongru Zhao, Hichem Sahbi, Mingliang Xu - NeuroAlign: Dynamic Dual-Stream Alignment of Perception and Cognition for Zero-Shot Brain-Image Retrieval
Yixing Ke, Dong Liang, Kun Shang - Reranking-based Analysis on Visual and Textual Query Contribution to Composed Image Retrieval
Huaying Zhang, Ren Togo, Takahiro Ogawa, Miki Haseyama - RFHNet: Relational and Frequency-Aware Hashing Network for Large-Scale Fine-Grained Food Image Retrieval
Junsong Wang, Weiqing Min, Guorui Sheng, Tao Yao, Lili Wang, Shuqiang Jiang
Doctoral Symposium
- User Influence Characterization and Market Event Attribution via GNN-LLM Collaboration in Financial Networks
Yunming Hui - Semantic-Anchored Multi-State Retrieval for Robust 3D Perception
Di Dai, Bo Liu, Liwei Wang - Object pose estimation for upper-limb prostheses grasping.
Ander Etxezarreta - Towards Scalable and Adaptive Multi-Teacher Distillation for Text-to-Video Retrieval
Toya Oyama
Trustworthy and Secure Multimedia
- BiRNet: Bilateral-Attentive Refinement Network for Tampering Detection Across Manipulation Paradigms
Zhiyao Xie, Tong Liu, Jiahao Huang, Nuno Lourenço, Xiaochen Yuan - Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models
Bin Zhu, Yinxuan Gui, Huiyan Qi, Jingjing Chen, Chong-Wah Ngo, Ee-Peng Lim - Privacy Protection Against Personalized Text-to-Image Synthesis via Cross-image Consistency Constraints
Guanyu Wang, Kailong Wang, Yihao Huang, Mingyi Zhou, Geguang Pu, Li Li - AIFIND: Artifact-Aware Interpreting Fine-Grained Alignment for Incremental Face Forgery Detection
Hao Wang, Beichen Zhang, Yanpei Gong, Shaoyi Fang, Zhaobo Qi, Yuanrong Xu, Xinyan Liu, Weigang Zhang - Privacy-Constrained Low-Bit Representation Learning for Person Image Retrieval
Junfeng Fang, Yan Zhang, Manzhou Li, Xinjin Ge, Yan Li, Weiyuan Cui - Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models
Xiaomeng Wang, Martha Larson, Zhengyu Zhao
Brave New Ideas
- Retrieval of LoRA Models based on Layer-Wise Weight Embedding without Metadata
Yuro Kanada, Yuma Oe, Huu-Long Pham, Makoto P. Kato, Hiroaki Ohshima, Sumio Fujita, Yoshiyuki Shoji - Beyond Optical Flow: Latent Micro-Motion as Visual Evidence in UAV Video
Bo-Wen Zhang, Zhou Wang, Songlu Chen, Chun Yang, Xiaobin Zhu, Xu-Cheng Yin - Towards Self-Evolving Knowledge Systems: Enhancing Multimodal Agentic RAG with Hyperbolic Flows
Tendai Mukande, Noel E. O Connor
Friday, 19 June 2026
Large-scale, Social, and Generative Multimedia Retrieval
- LP-VFedNN: A Lightweight and Lossless Privacy-Preserving Vertical Federated Learning Framework For Heterogeneous Neural Network Via Homomorphic Encryption and Intel SGX
Han Sun, Liji Wu, Zixin Wang, Baisong Li, Huiping Zhuang, Weiping Wang, Yaoyi Deng, Mingxuan Li, Hailong Zhang - Lookahead-R: Budget-Aware Tool Retrieval via Execution-Centric Planning
Zongze Wu, Yani Guo, Runnan Li - An Energy-Efficient Multimodal Retrieval Framework for Inference on Heterogeneous Edge Nodes
Junfeng Fang, Yan Zhang, Mingyu Liu, Zhaoxi Feng, Manzhou Li, Yan Li - Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval
Jiaxin Wu, Xiao-Yong Wei, Qing Li - Toward Generation-Centric Coding: Compressing Latents representation for TI2V Synthesis
Jianran Liu, Wen Ji, Xiaokai Meng, Wancai Zhang, Ying Wang
Grand Challenge
- The 2026 Grand Challenge on Multimedia Verification: Overview and Key Directions
Duc-Tien Dang-Nguyen, Kha-Luan Pham, Minh-Anh Pham, Silje Førsund, Henrik Vold, Minh-Triet Tran, Anh-Duy Tran - DeepVerify: The End-to-end Software for Evidence-Based Multi-Modal Online Information Verification with Explainable Reasoning
Hoang-Quoc Nguyen-Son, Tung-Duong Le-Duc, Quynh-Huong Dinh-Nguyen, Hai-Chau Nguyen-Le, Anh-Duy Tran, Minh-Son Dao - Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification
Hung Nguyen, Khang Nguyen, Hoang-Loc Cao, Phuc Ho, Van Pham, Hung Cao - MOSAIV: Multi-Agent LLM Swarms for Automated Multimedia News Verification
Muhammad Shahid Muneer, Khoa Tran, Van Tuan Nguyen, Simon Woo
Evaluation and Applications 2
- CompArt: Operationalizing Aesthetic Alignment in Text-to-Image Generation via Principles of Art
Zhe Jin, Tat-Seng Chua - Focal-RegionFace: Generating Fine-Grained Multi-attribute Descriptions for Arbitrarily Selected Face Focal Regions
Kaiwen Zheng, Junchen Fu, Songpei Xu, Yaoqin He, Joemon Jose, Hu Han, Xuri Ge - CLIP-SegFusion: An Attention-Guided Feature Fusion Framework for Multi-Level Detection on AI-Generated Artworks
Yuqian Zheng, Hyeongjin Ahn, Juyeob Lee, Eunil Park - Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling
Ke Zhang, Chu-Hsuan Hsueh, Kokolo Ikeda - RoDE: Linear Rectified Mixture of Diverse Experts for Food Large Multi-Modal Models
Pengkun Jiao, Xinlan Wu, Bin Zhu, Jingjing Chen, Chong-Wah Ngo, Yu-Gang Jiang - A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding
Shuai Wang, Hongyi Zhu, Jiahong Huang, Yixian Shen, Chengxi Zeng, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring - Asymmetric Pipeline for Dataset Construction and Situation-aware Generative Outfit Retrieval Leveraging Differences in Task Difficulty
Yuma Oe, Katsumi Tanaka, Yoshiyuki Shoji
Multimedia Retrieval Methods and Systems 2
- LSR²: Learning to Select Relational and Reasoning Feature for Multi-modal Re-identification
Peng Jin, Yuxuan Qiu, Zhaofa Wang, Xiaoyue Hu, Xiabing Zhou, Na Jiang - B-HFA: Parameter-Efficient Vision-Language Retrieval via Block-shared Adapters and Hierarchical Aggregation
Rui Xu, Lin Yao, Zhiyang Wu, Xuyun Zhang, Guowei Wu - Adaptive Knowledge-Language Alignment for Industrial Anomaly Detection and Segmentation
Shih-Chih Lin - Which LoRA Should Be Merged Next? Retrieving an Additional LoRA from a Target Image
Daichi Sugita, Huu-Long Pham, Makoto P. Kato, Hiroaki Ohshima, Sumio Fujita, Yoshiyuki Shoji - A Decomposed Retrieval-Edit-Rerank Framework for Chord Generation
Qiqi He, Dichucheng Li, Xiaoheng Sun, Anqi Huang - POSITIVE4Rec: Incorporating the Recency Effect with Positional Inductive Bias for Sequential Recommendation
Po-Chih Lin, Yixuan Dong, Fang-Yi Su, Haijie Yang, Zelin Zang, Hongliang Zhang, Wing-Kuen Ling, Fuji Yang
Multimedia Analysis, Representation, and Understanding 3
- VAR-3D: View-aware Auto-Regressive Model for Text-to-3D Generation via a 3D Tokenizer
Zongcheng Han, Yu Hong, Haoran Sun, Dongyan Cao - ICMF-Net: Interactive Cross-Modal Fusion with Attention and Selection Network for Remote Sensing Object Detection
Kun Yao, Hao Zeng, Yida Wang, Ming Ma - KAN or MLP? Point Cloud Shows the Way Forward
Yan Shi, Qingdong He, Yijun Liu, Jingyong Su - ESG-Rec: Enhancing Static-Graph Representations via Tri-view Contrastive Learning for Multimodal Recommendation
Wenfeng Li, Ru Wang, Fuyong Xu, Guoshuai Yang, Peiyu Liu
Online (MPV-only) Presentations
The following 251 papers will be presented online only, via Multimedia Presentation Videos (MPVs). See the Information for Presenters page for details on MPV preparation and submission.
- Graphs for Logic and Texts for Context: A Multi-Agent Orchestrated Hybrid RAG with Stepwise Question Decomposition
Feng Ding, Huailiang Peng, Hao Sun, Chi Zhang, Qiong Dai - Mitigating Semantic Bias in Multilingual Visual Document Retrieval via Language-Vision-Aware Late Interaction
Haowei Li, Haojie Wu, Jie Bao, Zhen Chen, Yong Liao - Describing-Verifying-Scoring: A Hierarchical Reasoning Framework for Zero-Shot Composed Image Retrieval
Guquan Jing, Peng Gao, Yujian Lee, Hui Zhang - Spherical Projected Bézier Flow: A Geometry-Constrained Manifold Transport Framework for Cross-Age Face Retrieval
Huaqing Song, Baichuan Lin, Shuofeng Sun, Lanchi Xie, Haibin Yan, Zhihui Li - PIRSA: Profile-Indexed Retrieval and Semantic Frame Alignment for Ambiguous Spoken Language Understanding
Xiaoqin Zhang, Xingpeng Wu, Yanjun Lu, Shuhan Nie, Tian Shi, Xianglong Liu, Xin Yang - PAMS-GNN: Popularity-Aware Multimodal Semantic GraphNeural Networks for Recommendation
Quanyou Li, Yunqi Cao, Le Yu, Wenxin Li, Jin Xu - DIR-RSCLIP: A Degradation-Invariant Cross-Modal Retrieval Network for Remote Sensing Images
Xiaotian Li, Chenyu Zhang, Changbai Chen, Zhongjie Zhu - BiOVQL: Brain-inspired One-stage Egocentric Visual Query Localization
Yifei Cao, Guolong Wang, Mingliang Hou, Jizhe Yu, Xianjie Zhang, Xiya Bu, Zhizhen Li, Yu Liu - M-STAR: Multi-view Semantic Topology Alignment with Reasoning from VLMs for Image-Text Retrieval
Xuewen He, Yuning Guo, Fumao Xu, Mingyong Li - Scaling Multimodal Retrieval and Generation for Long Documents through Visual Tiling and Context Compression
Yi Jin, Weichao Chen, Shengjie Zhao - Unsupervised Cross-Modal Semantic Invariance Hashing
Qiyou Huang, Meng Wang - RoATR: A Systematic Study of Audio-Text Retrieval Robustness Against Realistic Perturbations
Honglei Zhang, Pengfei Zhou, Ruohan Wang, Siyue Zhang, Yilei Shi - DeHub: Learning Hub-Resistant Representations for Text-Video Retrieval
Anjun Jia, Xiaowei Zhang - Empowering Vision Language Models for Training-Free Visual Search via Context-Aware Scanpath Simulation
Haoran Wang, Dan Wan - DyCa-GRPO:Calibrated and Efficient Learning-to-Rank for Multimodal Retrieval with Human Feedback
Ning Han, Xiubo Liang - CCRA: A Cross-modal Complementary Representation Alignment Framework for Bridging the Modality Gap
Xingchen Han, Ruihao Zhang, Ruiting Li, Yingxin Pei, Jiaqi Wang, Zhe Ji, Feiliang Ren, Yongkang Liu - PRISM-GCN: Principled Representation Integrationon Graphs for Multi-Behavior Recommendation
Xinwei Li, Gaoquan Liu, Changqiang Xu, Ruohong Huan, Xiaomin Zhao - MCHRAG: Multi-Centroid Hierarchical Indexing for Efficient Incremental RAG
Yuan Ren, Mingxue Liao, Gang Zhou, Jinxing Peng, Pin Lv - RankVR: Low-Rank Structure Perception and Value Recalibration for Robust Composed Image Retrieval
Jiale Huang, Zixu Li, Zhiheng Fu, Zhiwei Chen, Qinlei Huang, Yupeng Hu - Target-Enhanced Gated Transformer: A Multi-Behavior Recommendation Framework for Noise Suppression and Target Signal Preservation
Xing Zhang, Xu Cheng, Likang Wu, Yingyuan Xiao, Wenguang Zheng - IMAGINE: Adaptive Schema-Imagery Enhanced Composition for Composed Video Retrieval
Jiale Huang, Zixu Li, Zhiwei Chen, Zhiheng Fu, Chunxiao Wang, Yupeng Hu - CREAM: Collaborative Representation with Self-supervised Alignment for Multimedia Recommendation
Junhao Gao, Chao Yang, Bin Jiang - Contrastive Multimodal Fusion and Pseudo-Label method for Unsupervised Cross-Modal Hashing Retrieval
Qinze Zhu, Jiayi Yang, Yijie Zhu, Mingyong Li - From Noisy Candidates to Reliable Grounding in Weakly-Supervised Referring Expression Comprehension
Yunlong He, Ziqi Gu, Tong Zhang, Zhen Cui, Chunyan Xu - Fine-grained Text-Video Retrieval with Patch-level Temporal Difference and Aggregation
Jialong Hu, Zijie Song, Yang Wang, Zhenzhen Hu, Jia Li, Yixiao Ma, Richang Hong - Global-Regional Dual Hashing for Unsupervised Visual-Textual Retrieval via Concept Similarity Guidance
Yewen Li, Zongwei Tang, Xiaodong Wang - SCAN: Self-Calibrated Textual Anchoring for Dual-Granularity Video Screening in Text-Video Retrieval
Dixin Chen, Baoyao Yang, Haifeng Lin, Canrong Du, Wenbin Yao - Deconstructing Centrality: Scale-Hierarchy for Hubness in Text-Video Retrieval
Houlin Zhu, Libo Liu, Ruonan Zhang, Zhen Deng - Robust Graph Matching via Confidence-Guided Distillation and Random Node Masking
Zhoubo Xu, Zizhao Pang, Yu Meng, Huijie Cong - CARE: A Constraint-Aware Hypergraph Framework for Knowledge-Driven Event-Centric Retrieval
Mengxue Yang, Xitong Li, Ziyi Yang, Jingqi Zhang, Xiaruo Zhang, Ying Li - Cross-View Collaborative Recommendation with Multimodal and Multi-Scale User Behaviors
Yifan Huo, Ming Liu, Junhong Zheng, Lili He - Relational Retrieval: Leveraging Known-Novel Interactions for Generalized Category Discovery
Yulin Xu, Chunqi Guo, Yuanzhen Shuai, Jianyuan Ni - Instance-Adaptive Routing for Object Re-Identification with Heterogeneous Experts
Shuming Hu, Chuan Fu, Shuting He, Henghui Ding - Video Hashing with Robust Secondary Frames and Local Tangent Space Alignment for Copy Detection
Zixuan Yu, Xiaoping Liang, Zhenjun Tang - DTSR: High-Frequency Prior-Based Dynamic Texture Synthesis for Real-World Image Super-Resolution
Feiyi He, Zihan Cheng, Jielei Wang, Cencen Liu, Guoming Lu - Neural Representations for Animated GIFs
Yifei Wang, Gaozhi Liu, Sheng Li, Xinpeng Zhang, Zhenxing Qian - SatCLA: A Collaborative LLM-Driven Framework for Annotation of LEO Satellite Imagery
Guogen Zeng, Juan Luo, Peng Sun, Ying Qiao, Anping Liu - Semi-3DETR: Semi-Supervised Detection Transformer for 3D Object Detection
Na Dong, Gim Hee Lee - CodeMNER: Vision-Language Models are Better Multimodal Named Entity Recognizers via Progressive Vision-Code Alignment
Jiakang Yu, Shizhou Huang, Xiaode Chen, Hongtao Deng, Wang Gao, Xun Zhu - A<sup>2</sup>P-Net: Asymmetric Domain-Adaptive Prototype Network for Cross-Domain Multimodal Sensor Retrieval
Xin Qin, Wenjie Wang, Mengna Liu, Xu Cheng, Fan Shi, Shengyong Chen - Keep the General, Inject the Specific: Structured Dialogue Fine-Tuning for Knowledge Injection without Catastrophic Forgetting
Yijie Hong, Xiaofei Yin, Xinzhong Wang, Ya Guo, Huijia Zhu, Sufeng Duan - Improving Pseudo-Labeling and Representation Balance in Realistic Long-Tailed Semi-Supervised Learning
Zhengyu Ma, Qifeng Zhou - SubGAva: 3D Gaussian Primitive Subdivision for Photo-realistic and Animatable Human Avatars from Monocular Video
Pu Wang, Dehui Kong, Jinghua Li, Baocai Yin - Entropy Regularized Simple Multiple Kernel K-Means with Adaptive Deviation Correction
Xiaohong Jia, Zhiwei Xia, Baijing Wu, Yunchao Wei, Yao Zhao - OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling
Hongyu Chen, Liang Lin, Guangrun Wang - MAFNet: Multi-frequency Adaptive Fusion Network for Real-time Stereo Matching
Ao Xu, Rujin Zhao, Xiong Xu, Boceng Huang, Yujia Jia, Hongfeng Long, Fuxuan Chen, Zilong Cao, Fangyuan Chen - PURE: Probabilistic Utility for Robust Evidence in Multimodal Recommendation
Jinguo Hu, Yuelan Qi, Song Yu, Zhifang Liao, Wendong Zhang - From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation
Fengrui Liu, Ruiyang Huang, Qijian Zheng, Yuanfang Wang, Feng Liu - Parameter-Efficient Adaptation with Proxy Anchors for Cross-Domain Few-Shot Learning
Song Shi, Chengqiao Liu, Jinfang Jia - Real-Time Retrieval-Free Camera Pose Estimation via Sparse Cross-Modal 2D–3D Matching with Projection-Guided Refinement
Fan Wu, Amine Kacete, Jérôme Royan, Guillaume Moreau - KG-CPEN: Knowledge-Guided Compositional Prototype Evolution for Unbiased Scene Graph Generation
Yujun Hu, Changbo Wang, Gaoqi He - Anomaly Detection in Dynamic Networks with Hyperspherical Projection and DBN-based Anomaly Synthesis
Yifan Hong, Jiao Luo, Wang Jiawei, Yangchen Zeng, Yusen Wu - SSHF-CLIP: Semantic-Guided Scale Selection and Hybrid Fusion for Zero-Shot Anomaly Detection
Kaiyuan Jin, Wayit Abliz, Maihemuti Maimaiti, Zaokere Kadeer, Aishan Wumaier, Abdujelil Abdurahman, Panpan Zheng - Detail-Aware Camouflaged Object Detection via Multi-Granularity Collaborative Learning
Ye Wang, Kai Huang, Kai Zhao, Sumin Shen - TASEN: Topic-Aware Semantic Enhancement Network for Multimodal Named Entity Recognition
Guohui Ding, Chufei Wang, Hongfeng Wang, Zakovorotnyi Oleksandr - Egocentric Action Recognition with Retrieval-Augmented Learning
Yishan Zou, Chris Nugent, Matthew Burns, Shengli Wu, Mingzhu Xu, Meng Liu - GADRNet: Geometry-Prior-Guided Adaptive Distortion Rectification Network for Panoramic Depth Estimation
Guoxu Li, Cheng Han, Chao Zhang, Tongzhou Zhang, Shuang Yang - MOC-3D: Manifold-Order Consistency for Text-to-3D Generation
Chenyang Fan, Wen Yang, Junshi Cheng, Zihong Li, Wenfeng Zhang, Wei Hu, Yi Zhang, Pan Zeng - From Confrontion to Balance: A Kronecker-Constrained Spectral Entropy Joint Optimization Framework for Multimodal Sentiment Analysis
Feifei Xu, Puzhe Li, Dongyang Li, Bo Li, Luobing Huang, Wenjing Zhu, Zirui Xu, Yu Xie - Graph-Based Rotation-Robust Semantic Modeling for Oriented Object Detection in Remote Sensing Images
Hongning Liu, Xianchao Zhang, Hui Sun, Linlin Zong, Wenxin Liang, Xinyue Liu - Robust Multi-modal Knowledge Graph Completion via Modality-Specific Experts
Haiyan Liu, Xin Song, Ye Wang, Kai Chen, Yuying Liu, Bin Zhou, Hongkui Tu, Liqun Gao, Yue Qian - LaViSE: Language-aware Vision Scale Enhancement for Referring Remote Sensing Image Segmentation
Yan Li, Junjie Zheng, Zhouchao Fu, Shengjie Yang, Junjie Liao, Jianwei Zheng - Symmetry-Aware Causal Inference for Robust Neural PDE Solvers
Yuanming Xie, Yanzhuo Xiang, Haochen You, Nuoya Liu, Fangzhou Liu, Bo Zhao, Zhaolu Kang, Yue Li, Yuqi Li - Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation
Zijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang - Ref2Inpaint: 3D Gaussian Inpainting via Visibility-Aware Mask Refinement and VLM-Guided Reference Retrieval
Yining Xu, Yuanyang Zhang, Jingjiao You, Yingjie Huang, Jianbo Mei, Yilong Liu, Li Yao - Beyond Inconsistent Reasoning: Intermediate Process Direct Preference Optimization on Small Multi-modal Large Language Models for Visual Question Answering
Yongzhu Miao, Puzhen Su, Haoran Yin, Shasha Li, Jintao Tang, Ting Wang - Mitigating Multimodal Inconsistency via Cognitive Dual-Pathway Reasoning for Intent Recognition
Yifan Wang, Peiwu Wang, Yunxian Chi, Zhinan Gou, Kai Gao - OpenSGG-VL: Open-Vocabulary 3DSGG with Orthogonal Residual Fusion and Iterative Relation Refinement
Binbin Zhang, Fang Zhou, Liang Xiao, Zhiyong Su, Weiqing Li - TEA-Mamba: Textual Event-Aware Mamba for Multimodal Time Series Forecasting
Haowei Ran, Zheng Wang, Meijun Sun - SEEDCAP: SEMANTIC EXPANSION AND ENTITY-DRIVEN ZERO-SHOT IMAGE CAPTIONING
Binbin Li, Shupei Xiao, Dayan Wu, Gengqi Yang, Siyu Jia, Zisen Qi - AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive Videos
Jiagao Hu, Daiguo Zhou, Danzhen Fu, Fuhao Li, Zepeng Wang, Fei Wang, Wenhua Liao, Jiayi Xie, Haiyang Sun - CausalGS: Learning Physical Causality of 3D Dynamic Scenes with Gaussian Representations
Nengbo Lu, Minghua Pan - ExpV2S: Zero-Shot Expressive Video-to-Speech Synthesis via Latent Diffusion Model
Fang Zhang, Anqi Gou, Linli Xu - PRISM: Preference-Guided Semantic Reasoning with Vision-Language Models for Object Goal Navigation
Zijian Liu, Cong Pan, Chengjie Fan, Wanjie Cai, Xichen Ding, Jie Qin - Rectifying Multimodal Variance: UAPA-HCF for Weakly Supervised Violence Detection
Longkun Shi, Hanlin Hu, Haoze Zheng, Yuanyuan Liao, Turdi Tohti - Where & What Anomaly? A Framework for Pose-Agnostic Anomaly Detection and Zero-Shot Semantic Classification
Zhaokun Huang, Yonghong Song, Heyao Zhang - Learning A Bank of Transferable Prompts for Vision-Language Models
Jiong Wang, Zhongwei Huang, Chong Wang, Endai Huang, Ran Zhou, Haitao Gan, Yingying Zhu, Xiaoyu Shen - Decision-Invariant Sim-to-Real Vision-and-Language Navigation with Pseudo-Panoramic Observations
Yuanyu Zheng, Xumin Shen, Yunda Sun, Ying Shen, Lin Zhang - SGFR-Track: Uncertainty-Gated Spectral Feature Restoration for Online Multi-Object Tracking
Zheng Liang, Yisu Liu, Shuo Yang - Retrieval-Guided Contextual Inference for Training-Free Video Anomaly Detection in Low-Light Scenarios
Mengjingcheng Mo, Jiankang Zheng, Jiaxu Leng, Xinbo Gao - Agglomerative Model Meets Multi-Scale Adaptive Fusion for Cross-Modal Unsupervised Domain Adaptation
Zhixun Wang, Liqun Kuang, Song Wang, Shichao Jiao, Zhongyu Chen, Fengguang Xiong - CHM: Context Hiding and Misguidance for Robust Adversarial Attacks on Active Speaker Detection
Xiangyu Ye, Yatie Xiao, Qingxiao Guan, Zhenbang Liu - HIRNet: Hypergraph-Induced Iterative Reasoning Network for Crowd Counting
Ruihan Wang, Mengqi Lei, Siqi Li, Wei Bao - Unveiling PEFT Robustness to Noisy Labels in VLMs: A Gradient-Loss Decoupling Perspective
Tengfei Ma, Weiran Pan, Wei Wei - Decoupling Multimodal Perception and Reasoning for Image Reasoning Segmentation with Large Language Models
Yiqing Shen, Feng Chen - Beyond Post-hoc Fusion: Rethinking Cross-Modal Interaction Timing in Few-Shot Learning
Liang Yang, Hongyuan Xiao, Songtao He, Ye Lin, Zhenchang Zhang - GeoPro-Depth: Geometrically Consistent Prompting for Robust Metric Depth Completion
Xun Fang, Zixuan Hua, Lihua Zhang - A Unified Object-Centric Spatio-Temporal Graph Reasoning Framework for Audio-Visual Question Answering
Feifei Xu, Wenjing Zhu, Dongyang Li, Puzhe Li, Luobin Huang, Yu Xie, Zirui Xu - RainbowDreamer: Taming Semantic Controls for Attribute-Consistent Text-to-3D Generation
Weiyi Bu, Xiaodong Cun, Rui Yin, Jiantao Yuan, Wei Qi - Hierarchical Local–Global Context Modeling with Selective Modulation for Point Cloud Semantic Segmentation
Songtao Li, Di Zheng, Xihua Zou - C$^2$MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning
Yuntao Shou, Tao Meng, Wei Ai, Keqin Li - PanoAdapter: Efficient Adaptation of Depth Foundation Models for Immersive Multimedia via Spherical Rectification
Wei Xue, Zhiyong Huo - Teaching Audio-Language Models to Reason over Time
Yufeng Xu, Yunjia Li, Hai Wang, Wei Li - Structure Aware Distillation for Multimodal Intent Understanding Under Missing Modalities
Lanlan Lu, Qimeng Yang, Yi Liu, Xinjun Pei, Jinmiao Song - STeP-Net: A Spatio-Temporal Perception Network for Action Detection
Kunfang Song, Guowei Yan, Jiaqing Wang, Shufen Ruan, Yanwen Wang - Text-Guided Prototype Replay and Classifier Guidance for Incremental Few-Shot Semantic Segmentation
Luofeng Zhang, Shengzhe You, Qian Shao, Yanjing Lei, Yu Liu, Fei Gao - Towards Robust Sparse-View 3D Gaussian Splatting via Hierarchical Depth and Multi-View Consistency
Jianhui Zheng, Zhiyong Huo, Jiahao Zheng - CERA: Conflict-Explicit Reflective Agent for Multimodal Emotion Reasoning
Kejun Liu, Yuanyuan Liu, Ke Wang, Jiahao Zhang, Lei Xu, Chang Tang, Zhe Chen, Yibing Zhan - PCMA: Prompt-guided Cross-domain Multi-prototype Alignment for Source-Free Domain Adaptation
Kaicheng Peng, Ya Li - HB-Mamba: Hierarchical Bi-directional State Space Modeling for LiDAR Semantic Segmentation in Autonomous Driving
Wei Li, Haiyun Guo, Manli Tao, Honghui Dong, Ming Tang, Jinqiao Wang - LTA-Gait: In-Network Temporal Activation of Large Vision Models for Gait Recognition
Qichao Zhang, Genlang Chen, Chengcheng Jia, Jiajian Zhang - Adaptive Knowledge Generation via Reinforcement-Guided Pattern Completion for Zero-Shot Visual Question Answering
Zhihui Sun, Diwei Su, Xiuxing Li, Qixin Wang, Shihao Zhang, Xia Wu - GD-Head: Reconstructing High-quality 3D Avatar Head from a Single Image Using Geometry-guided Diffusion Models
Leyuan Liu, Xiaoqing Chen, Yufei Qian, Jingying Chen - HM-NVS: Hierarchical Multi-Modal Novel View Synthesis\with Uncertainty-Aware Progressive Refinement
Jiahao Chang, Haohua Zhao, Liqing Zhang - PSRNet: Progressive Semantic Refinement for Human Parsing via Text Conditioning and Embedding-Based Calibration
Ming Meng, Hanwen Liu, Xingxing Xiang, Long Ye, Lei Zhang, Zhaoxin Fan - From Diffusion to Rectified Flow: Rethinking Text-Based Segmentation
Zishen Qu, Xuesong Li, Hongwei Kang, Haijian Gu, Quan Meng, Tianrui Niu, Xin Yang, Ruidong Pan - Geometry-Guided Depth Correction for Metric Relative Pose Estimation
Shibin Xie, Hao Yin, Shuting Wang, Xiaokang Fang, Liang Jin, Haotian Liu, Yanting Zhang, Shen Cai - Learning Where to Embed: Noise-Aware Positional Embedding for Query Retrieval in Small-Object Detection
Yangchen Zeng, Zhenyu Yu, Dongming Jiang, Wenbo Zhang, Yifan Hong, Zhanhua Hu, Jiao Luo, Kangning Cui - Time-Surface Self-Attention: Restoring Temporal Connectivity in Spiking Transformers
Tiantian Xiao, Xi Wu, Hongbin Lv, Daoyuan Wang - RHVI-FDD: A Hierarchical Decoupling Framework for Low-Light Image Enhancement
Junhao Yang, Chunguo Wu, Bo Yang, Hongwei Ge, Yanchun Liang, Heow Pueh Lee - BSSNet: Block-Aware Serialized Spatial Learning for Robust Point Cloud Registration
Hang Li, Yulong Sun, Binhong Zhao, Feng Chen, Limei Hu - Event-Centric Structural Modeling for Zero-Shot Video Moment Retrieval
Xin Li, Yongxiu Xu, Yuyao Kong, Hongbo Xu, Gaopeng Gou, Yubin Wang - SliceCSRef: Dual-Level Semantic Alignment for Robust Speech Referring Expression Comprehension
Lihong Huang, Sheng-Hua Zhong, Qiao Yan, Zhijiao Xiao, Yan Liu - DenseSpeech: Dense Multi-Segment Temporal Grounding in Public Speaking Videos
Jiachen Tan, Tingting Zhang, Tao Zhou, Guangyao Su, Jianwei Fang, Bin Wu, Chunping Zheng - Evo-CuRL: Curriculum-Aware Reinforcement Learning over Code Lineage Graphs for Software Engineering Reasoning
Wei Tan, Yuanhao Li, Wenkai Liang - MoiréNet: Leveraging Directional Priors for Compact Dual-Domain Image Demoiréing
Shuwei Guo, Simin Luan, John See, Zeyd Boukhers, Miho Ohsaki, Kimiaki Shirahama, Cong Yang - QMTD: Query Vector Guided Multi-Scale Text Detection
Zhiqiang You, Yutong Jiang, Shenguang Huang, Zhangjie Liu, Gaode Wu, Haoyu Wang - ReNoRD: Learning from Relations under Noisy Pseudo Labels via Relational Distillation for Multimodal Sentiment
Tiantai Zhai, Yan Zhuang, Fuji Ren, Jiawen Deng, Liang Luo - Dual-view Driver Gaze Estimation via Mutual Enhancement
Chengzheng Fu, Rong Quan, Siyu Chen, Yiming Ni, Jie Qin - HD²FI-Net: Hierarchical Dual-Domain Fusion–Interaction Network for RGB-T Semantic Segmentation
Zhenrong Guo, Bowen Fei, Daqian Liu, Jiahao Zhang - STAR-GS: Spatio-Temporal Geometry Alignment and Generative Refinement for Sparse-View 4D Gaussian Splatting
Yunqi Gao, Zhanfeng Liao, Dongbo Zhou, Leyuan Liu - STEP: Stable Gradient Projection for Continual Learning
Longlong Zhai, Jiao Tian, Feng Yan, Lei Su, Yanjun Qin, Shaochen Jiang, Chong Peng, Panpan Zheng - GlassSplat: Geometric Consistency and Pruning for Reflection-Free 3D Scene Reconstruction
Jingjiao You, Yuanyang Zhang, Yining Xu, Yunjie Zhang, Li Yao, Cunjian Chen, Tien-Tsin Wong - VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
Lu Dong, Haiyu Zhang, Han Lin, Ziang Yan, Xiangyu Zeng, Hongjie Zhang, Yifei Huang, Yi Wang, Zhen-Hua Ling, Limin Wang, Yali Wang - DINOTrack: Leverage Differential Attention for Noise-Aware Visual Tracking with DINOv3
Wei Xu, Gu Geng, Di Yuan, Rui Chen, Qiao Liu - RaC-Stitch: Reliability-Aware Collaborative Smoothing for Unsupervised Video Stitching
Guoliang Liu, Zhengwei Miao, Jianlin Zhang, Haorui Zuo - Beyond Over-Editing: Important Weight Constrained Knowledge Editing in Large Language Models
Zifeng Zhu, Yixian Dai, Binghui Guo, Hongwei Zheng, Yifan Sun, Zhaoxin Fan - Toward General and Robust LLM-enhanced Text-attributed Graph Learning
Zihao Zhang, Xunkai Li, Rong-Hua Li, Zhenjun Li, Bing Zhou, Guoren Wang - BSR-CLIP: Background-Calibrated Structural Reasoning for Zero-Shot Visual-Language Anomaly Detection
Shengchang Wang, Yue Han, Yongquan Xue, Jiao Li, Sizhe Tan, Yunfei Zhang, Liejun Wang, Panpan Zheng - Query-Guided Conflict Inference and Incongruity-Aware Alignment for Implicit Hate Speech Detection in Videos
Shuo Liu, Jiakang Yu, Xun Zhu, Hongtao Deng, Yinxia Lou - YDANet: Leveraging YCbCr Color Space and Dual-Path Attention Network for Depth Completion
Jun Liu, Guoqiang Xiao, Michael S. Lew, Song Wu - TCRS-QA: Training-Free Chain-of-Thought Reasoning for Shot-Aware Storyline Question Answering in Long-Form Videos
Zhenpeng Zeng, Xiaoyu Wu, Xuxu Wang, Qian Yu, Yudong Wang, Zihao Liu - SIGaze: Toward Pixel-Level Single-Instance Gaze Object Prediction
Dongxing Duan, Xu Liu, Jingyuan Xu, Ruijie Liu, Dan Guo - SparseStreet: Sparse Gaussian Splatting for Real-Time Street Scene Simulation
Qingpo Wuwu, Xiaobao Wei, Peng Chen, Nan Huang, Zhongyu Zhao, Hao Wang, Ming Lu, Ningning Ma, Shanghang Zhang - TD-CoT: Bridging the Holistic-Atomic Gap for Training-Free Temporal Reversal Detection in Video LVLMs
Pengfei Huang, Xuezhen Hou - Efficient Music Denoising with Channel Attention and Multi-Scale Sequence Encoding
Seungmin Ha, Wei Li, Yulun Wu - Robust Exemplar Prompt Learning via Bi-directional Visual-Semantic Alignment for Multi-Object Tracking
Lingyan Liang, Zhibin Zhang, Gang Dong, Dongchao Wen, Kaihua Zhang - LDCS-Net: Local Dual-Context Attention Network for 3D Semantic Segmentation
Shuang Guo, Ying Zhou, Meina Song, Huilin Ai, Jia Long Li, Zi Yang Chen - CPD: Distilling Semantics in Feature Space via Class-Projection Interaction
Yingbin Wang, Jielei Wang, Qianxin Xia, Xuewan He, Guoming Lu - Locate Core, Refine Path: A Training-Free Closed-Loop Paradigm for Referring Video Object Segmentation
Jizhe Yu, Hao Zhang, Xiya Bu, Yuhang Duan, Xiaoshuai Wu, Yu Liu - Joint-Guided Spatial and Semantic Sensitive Diffusion Policy for Robotic Manipulation
Hongda Zhang, Siao Liu, Yi Liu, Chun Ouyang, Zhongxue Gan - LimbAug: Enhancing Virtual IMU Generalization in Human Activity Recognition via Learning Limb Movement Difference
Lingtao Huang, Chengshuo Xia - UniDGF: A Unified Detection-to-Generation Framework for Hierarchical Object Visual Recognition
Xinyu Nan, Lingtao Mao, Huangyu Dai, Zexin Zheng, Xinyu Sun, Zihan Liang, Ben Chen, Chenyi Lei - BL-UDA: Towards Unsupervised Domain-Adaptive Surgical Instrument Segmentation with Source Box Labels
Ziyuan Zhao, Yuhua Wang, Yifang Yin, Yichen Zhang, Xulei Yang, Jun Cheng, Roger Zimmermann, Cuntai Guan, S. Kevin Zhou - PEGE: Monocular 6D Pose Estimation with Geometry-Aware Enhancements for Small Objects
Qianlei Wang, Kexun Chen, Yuhuang He, Xiaolin Qin - Short-Length Hashing via Bit-Level Semantic Representation for Image-Text Retrieval
Qing Ma, Siyang Zhang, Yue Jiang, Cong Bai - StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models
Keli Liu, Zhendong Wang, Wengang Zhou, Houqiang Li - HSS-Net: Hybrid State Space Modeling for Efficient Unified Adverse Weather Restoration
Yueqi Zhu, Baiwen Zhang, Guo Cheng, Yongkang Zhang, Feiran Liu, Er Cao, Meng Xu - Stillness is Redundant: Motion-Aware KV Cache Retrieval for Efficient Video Understanding
Jingru Li, Haowen Zheng - Audit-and-Repair Indexing: Probabilistic Caption Indexes for Robust Multimodal Retrieval
Yangyang Liu - SA-Edit: Accelerating Editing Models via Test-time Spatial Acceleration
Yihao Song, Teng Hu, Ran Yi, Xiaoning Lei, Bin Sheng - Uncertainty-Gated Generative Compression for Structure-Preserving Multimedia Retrieval
Yiming Ding, Ziang Chen, Jianguo Wei - SHARP: Semantic Head-Aware Representation Pruning for Efficient MLLMs
Haifeng Ma, Mingyue Guo, Linhui Xiao, Qingfang Zheng, Qingming Huang - Self-Supervised Video Hashing with Consistent Short-Term and Long-Range Temporal Modeling
Shuang Hu, Likai Yang, Xiaoping Liang, Zhenjun Tang - GDT-VLM: Global Distribution Modeling for Visual Token Compression in Efficient Multimodal Large Language Models
Jiangtao Xie, Junjie Wu, Zhaolin Zhang, Qilong Wang, Peihua Li - Efficient Rationale-based Retrieval: On-policy Distillation from Generative Rerankers based on JEPA
Teng Chen, Sheng Xu, Feixiang Guo, Xiaoyu Wang, Qingqing Gu, Hongyan Li, Luo Ji - Ask-to-Retrieve: VQA-Guided Information-Gain Question Selection for Interactive Text-to-Image Retrieval
Shuaiwei Xie, Yating Yang, Bo Ma, Xi Zhou, Zhen Wang, Ahtamjan Ahmat - Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models
Rong Quan, Yantao Lai, Dong Liang, Jie Qin - FMD-AL: Cold-Start Active Learning based on Foundation Model
Huilin Ai, Ying Zhou, Zhonghua Peng, Ziyang Chen, Shuang Guo, Heng Xu, Zhiwei Yu, Jialong Li - VideoAgent: Personalized Synthesis of Scientific Videos
Xiao Liang, Bangxin Li, Zixuan Chen, Hanyue Zheng, Zhi Ma, Di Wang, Cong Tian, Quan Wang - FreSCo: Joint Frequency-Aware and Spatial Control for Image Zero-Shot Style Transfer
Tingrun Chen, Xudong Ling, Shicai Wei, Guiduo Duan, Yue Zhang - Retrieval-Augmented Camera Control for Video Diffusion
Lining Wang, Hongxun Yao, Jinyu Zhang - LayoutGD: Content-Aware Layout Generation via Graph-Enhanced Diffusion Model
Xudong Zhou, Guozheng Li, Chi Harold Liu - NeRAG: Neuro-Explicit Retrieval-Augmented Generation for Real-Time Interaction in Digital Humans
Yueqian Guo, Tianzhao Li, Xin Lv, Jiehaolin Chen, Zhaohan Wang, Yurun Chen, Sirui Xiao, Yezi He, Helin Li, Fan Zhang - Context Relation-Aware and Fine-Grained Token Interaction for Dialogue-Level Aspect-Based Sentiment Quadruple Analysis
Jiahui Liu, Tao Sun, Zimeng Xu, Zhipeng Shen, Yifan Kong, Jiaao Zhou - InterFold: Learning Interpretable Diffusion Manifolds Beyond Binary Samples
Alexander Vincent Lewi, Rainer Tan, Shengfeng He - Training for Identity, Inference for Controllability: A Unified Approach to Tuning-Free Face Personalization
Lianyu Pang, Ji Zhou, Qiping Wang, Baoquan Zhao, Zhenguo Yang, Qing Li, Xudong Mao - Sticker-Enriched Empathetic Response Generation: A Role-Aware Pairing Benchmark and A Novel Multimodal Framework
Wei Zhang, Changhong Jiang, Lulu Wang, Mingting Yu, Siyuan Zhao, Ronghan Li - Dual-Pathway Diffusion for Hand Correction in Synthetic Portraits: Global Context Aware and Local Structure Refinement
Yushe Cao, Luoxi Jing, Yuanze Wang, Dianxi Shi, Chun Yu, Junliang Xing - ExpPortrait: Novel Expression Generation for Fine-Grained Controllable Portrait Animation
Hualiang Wei, Wenhui Li - MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
Jianxuan Yang, Xiaoran Yang, Lipan Zhang, Xinyue Guo, Zhao Wang, Gongping Huang - Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation
Zehua Cheng, Wei Dai, Jiahao Sun - ComMark: Covert and Robust Black-Box Model Watermarking with Compressed Samples
Yunfei Yang, Xiaojun Chen, Zhendong Zhao, Yu Zhou, Xiaoyan Gu, Juan Cao - Multimodal Deepfake Detection with Quantum State Inspired Analytic Incremental Adaptability Learning
Jianbin Ye, Man Xiao, Bo Liu, Huaping Hu, Zijian Gao, Shaojing Fu, Kele Xu, Huaimin Wang - UAU-Net: Uncertainty-aware Representation Learning and Evidential Classification for Facial Action Unit Detection
Yuze Li, Zhilei Liu - Towards Generalized Image Manipulation Localization via Score-based Model
Yunfei Wang, Bo Du, Zhe Yang, Xin Liu, Zhiyu Lin, Tianxin Xu, Ji-Zhe Zhou - GMAE: Gated Multi-signal Adaptive Ensemble for Targeted Transfer Attacks on Commercial Large Vision-Language Models
Chengyin Hu, Yijun Chen, Tianle Liang, Yiwei Wei, Ang Li, Haitao Shi, Lingyan Bian, Xuelian Shi - Preserving Texture in Chaos: Texture-Aware Deep Unfolding for Secure Compressed Sensing
Hongying Zheng, Aijia Zhou, Di Xiao - Text Recovery Attacks and Defenses on Physical Envelopes
Yongfei Tao, Yi Zhang, Runze Liao, Jingwei Qu, Bingyao Huang - Mitigating Hallucinations in Vision-Language Models via Contextual Entropy Calibration
Xuanyu Yin, Daowan Peng, Wei Wei - Spatial-Frequency Domain Complementary Learning for Robust Cross-Modal Hashing
Gang Zhou, Shibiao Xu, Xiaolong Zheng - Semantic-Guided Fast Adversarial Training via Class Relationship Exploitation
Yu Chen, Ke Wang, Fan Yang, Qiang Xu, Jinwei Chi, Honghao Wei - MirageNet: A Secure, Efficient, and Scalable DNN Protection for Edge-Computing Multimedia Retrieval
Huadi Zheng, Cheng Li, Xin Zhou, Wei Wang, Yuanhang Yu, Feng Wang, Yan Ding - TSAD:Trace-Semantic Adaptive Disentanglement for Detecting and Grounding Multi-Modal Media Manipulation
Wenzheng Liu, Cheng Fu, Hujin Peng, Junlong Wu, Xianhong Chen, Lan Huang, Jing Xu, Yixi Tian, Menghan Liang, Xiaofeng Wang, Tan Deng, Wanwei Jiang, Xiang Li - Structure-Induced Safety Gaps in Multimodal Reasoning Systems
Meng Yang, Peirou Liang, Zhiqian Wu, Yong Liao - Content-Adaptive Implicit Neural Representations for Resolution-Agnostic Remote Sensing Watermarking
Minxi Li, Naen Xu, Hengyu An, Tianyu Du - HiChrom-MAE: Frequency-Chromaticity Masked Autoencoding for Palmprint Presentation Attack Detection
Qichao Xiong, Yiheng Huang, Junhong Chen, Zhanhong Liang, Lunke Fei - Enhancing Deepfake Detection Reliability via Risk-Regulated Dual-Threshold Interval Selection
Boyao Wei, Ruixia Liu, Yinglong Wang - FairFBC: Scalable Fair Fuzzy Clustering via Group-Balanced Anchor Graphs
Tongzheng Zhao, Yan Chen, Peng Wu, Chao Wen, Peng Zhou, Liang Du - Thinking in High-Frequency: Practical Defense for Deepfake Detectors Against Black-box Adversarial Attacks
Fuqiang Du, Min Yu, Jianguo Jiang, Yixin Zhang, Yachao Liang, Meng Zhang, Weiqing Huang - DocForensic: A VMamba-Wavelet Cross-Attention Network for Document Image Tampering Localization
Jiaxin Chen, Long Sun, Dengyong Zhang - ForgeryMoE: Mixture of Experts for Image Forgery Detection under JPEG Compression
Dan Wu, Saihui Hou, Kang Yang, Jian Zhao, Min Ren, Zhaofeng He - Risk-Aware Medical Question Answering as a Reliability-Critical Decision Process
Yueqin Luo, Yunfan Li - SNOC: Subtle Nested Objective Configuration for Joint Ultra-Low-Light Enhancement and Super-Resolution
Jiaxin Gao, Yaohua Liu, Danchen Cui, Zhihui Zhao - Benchmarking MLLM-based Web Understanding: Reasoning, Robustness and Safety
Junliang Liu, Jingyu Xiao, Wenxin Tang, Zhixian Wang, Zipeng Xie, Wenxuan Wang, Minrun Zhang, Shuangheng Yu - VFGS-Net: Frequency-Guided State-Space Learning for Topology-Preserving Retinal Vessel Segmentation
Ruiqi Song, Lei Liu, Ya-Nan Zhang, Chao Wang, Xiaoning Li, Nan Mu - Augmenting medical vision-language pretraining via domain-aware retrieval-augmented caption enrichment
Xiaoyang Wei, Camille Kurtz, Florence Cloppet - SAND: Semantic-Aware Anomaly Detection with Region-Consistent Memory for Noisy Training
Kaixi Xu, Yuanyang Zhang, Yilong Liu, Zirui Luo, Yutong He, Li Yao - CoMemRet: Wood Surface Anomaly Detection Based on Multiview Contrastive Learning and Memory Bank Retrieval
Bangling Wang, Fengqi Hao, Jinqiang Bai, Huijuan Hao, Xiangjun Dong, Dexin Ma, Hoiio Kong - GS³-ICL: Graph-Structured Sparse Selection with Invariance-Consistent Learning for multimodal SER
Yufan Zhou, Zhiyuan Ma, Lei Wang, Hongrui Ren, Zhuolun Zhong, Shangpeng Wang, Chenyuan Zhang, Haoran Yang - Chameleon: Benchmarking Detection and Backtracking on Commercial-Grade AI-Generated Videos
Xingming Liao, Meiyu Zeng, Canyu Chen, Nankai Lin, Zhuowei Wang, Aimin Yang - EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence
Yahui Li, Yinfeng Yu, Liejun Wang, Shengjie Shen - Coupling Frequency-domain Stepwise Enhancement and Statistical Moment Adjustment for Single Image Dehazing
Xiaowen Chen, Guoqiang Xiao, Michael S. Lew, Song Wu - OpenImplicit: Benchmarking Implicit Reasoning in MLLMs via Open-Ended Evaluation
Jidong Li, Xiaofei Yin, Ya Guo, Shuheng Zhou, Yi Tu, Haodong Zhao, Sufeng Duan, Gongshen Liu, Huijia Zhu - Decoupling Vocal and Rhythmic Conditioning for Music-Driven Singing Avatar Animation
Yiguo Jiang, Xiaodong Cun, Chenbin Feng, Jian Sun, Chi-Man Pun - TF-Count: A Training-Free Exemplar-Based Method for Class-Agnostic Cell Counting Using DINOv2
Xiuze Dong, Maosheng He, Zhao Wang, Zhiqiang Liang, Yifan He - Exploring Potential Knowledge Correlations of Disease Diagnosis with Partial Labels
Nian Ai, Daizong Liu, Pan Zhou - PhysFlow: Frequency-Selective Flow Matching with Dual-Stream Expert Fusion for Remote Photoplethysmography
Youchen Luo, Zhaodong Sun, Huiyu Yang, Wenye Geng, Yuwei Chen, Xiaobai Li - Sparse Implicit Connectivity Graphs with Scheduled Emotion History Sampling for Multimodal Emotion Recognition in Conversation
Feng Li, Wen Luo, Bing Wang, Yongwei Li - MDHL-FND: Multi-Domain Hierarchical LoRA for Fake News Detection
Linfeng Ke - DapQ-DiT: Distribution-Aware Post-Training Quantization for Efficient Generative Tasks in Diffusion Transformers
Lianwei Yang, Haokun Lin, Yichen Wu, Zhenan Sun, Qingyi Gu - Multi-Scale Perception and Channel-Gated Fusion Network for Aerial Image Detection
Jiaxin Chen, Zhixiang Zheng, Pei Yi, Dengyong Zhang, Yuxu Peng, Lei Wang - Synergizing Agentic Data Generation and Efficient Representation Learning for Medical Cross-Modal Understanding
Lemin Cheng - Anatomic-Decoupling Adaptation: A Unified Framework for Zero/Few-Shot Medical Anomaly Detection
Zhihuan Lin, Fei Wang, Weihong Cai, Hao Cai - MetaDB: Metadata-Guided Diffusion Bridge Model for High-Fidelity Medical Image Synthesis
Yanjun Chi, Keqiang Wang, Wei Huang, Wei Xu, Jiaen Liang, Jun Yu - Anime-2026: A Large-scale Anime Character Dataset for Anime-related AI Tasks
Shijie Xuyang, Bingzhe Yu, Minyi Zhao, Guangze Li, Jihong Guan, Shuigeng Zhou - ImageNetion: Retrieval-as-Policy for Creative Gollin Figure Completion via Generative Feedback
Dongjin Huang, Yichuan Liu, Jiantao Qu, Qinghang Wu - MMG-RAG: Multimodal Graph RAG for Medical Report Generation
Gang Liu, Xiaotian Tang, Jiacheng Gan, Tianyu Ren, Tingyao Liu, Shenjun Zhong - DynBrush: Structure-Aware and Style-Adaptive Transfer for Traditional Chinese Landscape Rendering
Hangshen Nong, Mingyuan Ge, Mingyong Li - ICSGDiff: A Multimodal Structure-Aware Diffusion Network for Restoring Ancient Bamboo Slips
Youxin Liao, Jiahao Zhang, Guang Long, Yueran Wang, Ying Qi, Chenyang Wang, Qiang Zhang, Shanxiong Chen - TR-GLP: A Two-Stage Framework with Temporal Reprogramming and Residual Graph Label Propagation for Short Video Fake News Detection
Junjiang Chen, Wenzhong Yang, Yabo Yin, Hongzhen Lv, Fuyuan Wei, Jingfeng He, Zongxu Luo, Junhang Wu - CB-CV: A Cluster-Based Cross-Validation Benchmark for Multimodal Video Out-of-Distribution Detection
Ji Zhang, Xiao Luo, Hang Zhou - LLM-Guided Secure Federated Visual Prompts with Deep Unfolding for MRI Reconstruction
Di Xiao, Yuhan Gou, Yu Ren, Shijia Xu, Yue Zhang - ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis
Aoduo Li, Haoran Lv, Hongjian Xu, Shengmin Li, Sihao Qin, Zimeng Li, Chi Man Pun, Xuhang Chen - Progressive High-Confidence Pseudo-Labeling for Unsupervised Cross-View Image Geo-Localization
Long Yu, Chunfang Yang, Ma Zhu, Xu Wang, Yang Pei - Explainable Multimodal Modeling with KANs for Urban EV Charging Demand Forecasting
Yi Zhao, Qianqian Ren, Boyuan Wang, Hui Xu - VietFashion: Benchmarking Sketch–Text Composed Image Retrieval for Cultural Outfits
Hoang-Nguyen Cao, Le-Hoang Bui, Dinh-Khoi Vo, Minh-Triet Tran, Trung-Nghia Le - Multi-Modal 3D Object Detection in Autonomous Driving: A New Survey
Peng Zhang, Xin Lin - TrackNetV6: A Unified Framework for Lightweight and Robust Fast-Moving Tiny Ball Tracking
Jizhe Yu, Xiya Bu, Yu Liu, Kaiping Xu, Yifei Cao, Zhizhen Li - ClearNight: Synergistic Dual-Prior Aggregation for Nighttime Image Dehazing
Yiqiang Zhou, Xindan Gao, Jifeng Guo, Yanfeng Qiao, Yan Chen, Guang Li, Lu Wang - HCG-MPB: Hierarchical Complementary Gating Mechanism with Multimodal Pattern Bank for Hateful Video Detection
Hongxia Sun, Wenzhong Yang, Yabo Yin, Fuyuan Wei, Junhang Wu, Junjiang Chen - TG-MUNet: A Lightweight Text-Guided Mamba Unet for Semi-Supervised Medical Image Segmentation
Feng Li, Chen Sun, Bing Wang, Zongyu Xie - Flickr-ABS: A Benchmark for Abstract Intent in Image–Text Retrieval
Tianyuan Li, Lei Wang, Yating Yang, Rui Dong, Ahtamjan Ahmat, Bangju Han, Zhijie Li - DDL-Net: A Task-Balanced Panoptic Perception Network with Channel-Reorganized Attention in Autonomous Driving
Bowei Fang, Yunyi Tang, Wentao Mu, Wenbo Liu, Fei Yan, Tao Deng - Blazer: Encrypted Video Traffic Identification for Mixed Segment Transmission Pattern based on LLM
Weitao Tang, Meijie Du, Die Hu, Shu Li, Zhao Li, Rong Yang, Qingyun Liu - Beyond Semantic Understanding: Physics-Informed Adaptation of Video Foundation Models for Precision Industrial Metrology
Jiahao Chang, Haohua Zhao, Liqing Zhang - Assessing Color Vision Test in Large Vision-language Models
Hongfei Ye, Bin Chen, Wenxi Liu, Yu Zhang, Zhao Li, Dandan Ni, Hongyang Chen - SPGR: Semantic Purification and Geometric Routing for Fake Short-Video Detection
Shaojie Hu, Yong Liu, Xiaoguang Zhang - SlimNet: High-Quality and Efficient Object Removal by Eliciting Latent Capabilities of Diffusion Models
Xiao Ma, Jin Yuan, Yao Zhang, Cheng Zhong, Zhongchao Shi, Jianping Fan, Guihua Zeng - SCORE: Soccer Curriculum for Ordinal Affect Recognition with Evidence
Xiaofeng Shen, Ze Rong, Haoyang Qin, Binhao Zhao, Yue Xu, Lei Ma - EC-RAG: Evidence-Centric Retrieval-Augmented Generation for Medical Visual Question Answering
Songming Li, Jun Long - VAV-R1: Difficulty-Aware Multimodal Reasoning for Video Anomaly Validation
Jiang Liu, Yuhang Liu, Juan Yang, Qianhao Ren, Yutong Wang, Zhongjiang He, Jingmin Xin, Hao Sun - HSAMoE: Hemiparetic-Side-Aware Mixture of Experts for EEG-Based Motor Imagery Classification in Stroke Patients
Min Feng, Sheng-hua Zhong, Tianhao Gao, Rongrong Lu - Efficient Video Anomaly Detection for Edge Devices via Background Feature Caching
Zhibo Zhang, Lin Zhao, Wenyan Xing, Di Wang, Chen Gong, Le Zhang - Centripetal-Scale Coupling and Sparsity-Guided Label Assignment for Tiny Object Detection in Steppe Rathole Monitoring
Lei Xu, Ru Li, Chunyu Zhao, Jiaqiang Zhang - FSGD-Det: Frequency-Spectrum-Guided Dehazing for Aerial Object Detection in Hazy Images
Min Dang, Gang Liu, Zhaolu Zheng, Luyi Qiu, Zihao Li, Jing Liu - Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach
Zijian Zhao, Dian Jin, Zijing Zhou - Uncovering Frequency Cues for Robust Event-Based UAV Detection
Xinyu Li, Wenjun Zhu, Xiaoyu Ji, Wenyuan Xu - TrinitySeg: A Benchmark and Baseline for Monochrome NIR Smoke Segmentation
Haowen Hua, Zeyi Shao, Shuwei Guo, John See, Zeyd Boukhers, Miho Ohsaki, Kimiaki Shirahama, Cong Yang - Stat-SAM: Learning Global Echo-Intensity Priors as Prompts for SAM in Ultrasound Image Segmentation
Juan Chen, Yang Wu, Lei Guo, Wenping Ge, Jie Ma - Topology-Guided Feature Integration for Structured Object Detection
Jiayi Ding, Libo Liu, Ruonan Zhang