The technical program of ACM ICMR 2026 runs from Wednesday 17 June to Friday 19 June 2026 at the KIT Royal Tropical Institute in Amsterdam. The week opens on Tuesday 16 June with LSC'26, workshops, tutorials and the SIGMM European Chapter Symposium. The week-at-a-glance schedule, including social events, is shown below.

Click the schedule to open it as a PDF. Parallel sessions running at the same time are shown side by side. The full session-by-session listing with paper titles and authors is below; the complete agenda is also on the Whova event page.

Full Agenda

The complete agenda, including all sessions, papers, demos, and social events, is hosted on the official ICMR 2026 Whova event page below. You can also open the agenda in a new tab.

Wednesday, 17 June 2026

Best Paper Candidates

  1. Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models
    Zijie Zhou, Dandan Zhu, Hangxiangpan Wang, Heng Zhang, Huishen Jiao, Yi Zhao
  2. Frozen LVLMs for Micro-Video Recommendation: A Systematic Study of Feature Extraction and Fusion
    Huatuan Sun, Yunshan Ma, Changguang Wu, Yanxin Zhang, Pengfei Wang, Xiaoyu Du
  3. Text4Radar-V2X: Text-guided 4D Radar for Cooperative 3D Object Detection
    Xiangyuan Peng, Kay Bierzynski, Lorenzo Servadei, Robert Wille
  4. Fine-Grained Cross-Modal Retrieval in Art via Region-Level Grounding of Symbolic Narratives
    Mihai-Bogdan Bîndilă, Shenghui Wang, Gwenn Englebienne
  5. Reflective Cross-Granularity Grounding with Preference Optimization for Long Video Understanding
    Wei Feng, Xin Wang, Hong Chen, Yu-Wei Zhan, Zihan Song, Bin Huang, Kecheng Zheng, Wenwu Zhu

Multimedia Analysis, Representation, and Understanding 1

  1. Evidential Uncertainty Modulated Adaptive Predictive Contrastive Learning for Multimodal Fusion
    Qiuyu Mei, Hong Yu, Shijie Yu, Yan Yang
  2. Context-Aware Interpretable Representations for Retrieval and Graph Convolutional Network Classification
    Thiago César Castilho Almeida, Gustavo Rosseto Letício, Vinicius Atsushi Sato Kawai, Daniel Carlos Guimarães Pedronette
  3. SAM3-LiteText: An Anatomical Study of the SAM3 Text Encoder for Efficient Vision-Language Segmentation
    Chengxi Zeng, Yuxuan Jiang, Ge Gao, Shuai Wang, Duolikun Danier, Bin Zhu, Stevan Rudinac, David Bull, Fan Zhang
  4. RMPL: Relation-aware Multi-task Progressive Learning with Stage-wise Training for Multimedia Event Extraction
    Yongkang Jin, Jianwen Luo, Jingjing Wang, Jianmin Yao, Yu Hong
  5. Adaptive Spatial-Channel Masked Reconstruction Knowledge Distillation for Dense Prediction
    Ziniu Liu, Shuheng Zhou, Jin Zeng, Mingqing Liu, Yulong Zhang, Hao Deng
  6. SaF-AD: Saliency-Adaptive and Feature-Consistent Diffusion for Industrial Anomaly Detection
    Yilong Liu, Yuanyang Zhang, Zirui Luo, Kaixi Xu, Yining Xu, Li Yao

Evaluation and Applications 1

  1. GAformer: Low-Light Image Enhancement Based on Gradient-Aware Kernel and Frequency-Modulated Transformer
    Yifan Shuai, Ke Wang, Weiming Feng, Shuai Pang, Dehua Zhou, Yikui Zhai
  2. NIGCL: Neuro-Image Geometric Contrastive Learning for Robust EEG-Based Visual Retrieval
    Xueru Zhao, Yanrong Hao, Xin Wen, Mengni Zhou, Jing Bian, Rui Cao
  3. Entropy-aware Mutual Student Co-training for Source-free Domain Adaptation in Medical Image Segmentation
    Guangrun Chen, Xiaoli Yang, Litan Sun, Ming Jin, Xiaofeng Qu, Sijie Niu
  4. Data-Centric Multimodal Pavement Distress Detection Using Intensity–Range Imagery
    Wenhan Tao, Yongsheng Bai, Feng Wang, Jelena Tešić
  5. Skeleton-Guided Spatio-Temporal Video Representation for Long-Term Action Quality Assessment
    Zhiwei Hong, Qing Lei, Hongbo Zhang, Jixiang Du
  6. Depth-Guided Perception and Policy-Driven Adaptation for Wind Turbine Anomaly Detection
    Jing Guo, Baoqi Huang, Qing Miao, Bing Jia, Runze Yang
  7. Ivy-Fake: A Unified Explainable Framework and Benchmark for Image and Video AIGC Detection
    Changjiang Jiang, Wenhui Dong, Zhonghao Zhang, Fengchang Yu, Wei Peng, Xinbin Yuan, Yifei Bi, Ming Zhao, Zian Zhou, Chenyang Si, Caifeng Shan

Technical Demonstrations

  1. Real-Time Monitoring and Analysis of Rehabilitation Exercises from a Smartphone Camera Video Stream
    Miriama Jánošová, Andrej Černek, Radovan Dvorský, Vasil Poposki, Petra Budikova, Jan Sedmidubsky
  2. Keep Your Memories, Lose the Evidence: Privacy-Aware Lifelogging
    Allie Tran
  3. VideoCreator: An Agentic System for Multi-turn Video Production
    Zhengyang Liang, Yan Shu, Cathal Gurrin, Nicu Sebe, Lizi Liao
  4. TrackAnon: Towards Consistent Full-Body Anonymization
    Emil Leidland, Duc-Tien Dang-Nguyen
  5. Discovery of Visually Novel Content in Developing News Stories
    Stefan Arzberger, Helmut Neuschmied, Werner Bailer
  6. Realistic Virtual Flood Experience System Using 360° Videos and 3D City Models Constructed from Building Footprints
    Tatsuro Banno, Koki Kawada, Mizuki Takenawa, Masatoshi Denda, Kiyoharu Aizawa
  7. Context-Aware Visual Redaction Pipeline: Leveraging Vision-Language Models for High-Fidelity Content Inpainting
    Arun George Zachariah, Barnaby Simkin, Nikki Pope, Jibin Varghese, Michael Boone

Thursday, 18 June 2026

User Interaction, Queries, and Perception

  1. On the Effectiveness of Integration Methods for Multimodal Dialogue Response Retrieval
    Seongbo Jang, Seonghyeon Lee, Dongha Lee, Hwanjo Yu
  2. What Drove Success at the 15th Video Browser Showdown? A Comprehensive Interaction-Logging Analysis
    Bastian Jäckl, Omar Khan, Benjamin Verner, Zuzana Vopalkova, Udo Schlegel, Daniel Keim, Jakub Lokoc
  3. A Pruning-based Question-Answering for Interactive Video Search: A Simple Baseline
    Yu-Tong Cheng, Phuong Anh Nguyen, Chong-Wah Ngo
  4. Agent-Based Query Reformulation: Simulating Feedback and Mitigating Negation Blindness in Interactive Image Retrieval
    Hongyi Zhu, Shuai Wang, Jia-Hong Huang, Yixian Shen, Stevan Rudinac, Evangelos Kanoulas
  5. Evaluating Keyframe Layouts for Visual Known-Item Search in Homogeneous Collections
    Bastian Jäckl, Jiří Kruchina, Lucas Joos, Daniel Keim, Ladislav Peska, Jakub Lokoc
  6. Optimization of Long-Running Media Aggregation Queries
    Sigurður Þórarinsson, Björn Jónsson, Omar Khan

Multimedia Analysis, Representation, and Understanding 2

  1. AF-BEV: Object-Aware Adaptive Frustum-based BEV Aggregation for 3D Object Detection
    Bingyu Zhu, Dongbo Yu, Yunbiao Wang, Jun Xiao, Haiyong Jiang
  2. Semi-Automatic Correction of 3D Tubular Structure Skeletons via Component-Wise MST and Filtered Delaunay Triangulation
    Ruoxuan Yang, Chuan Li
  3. TAVEN: Task-driven Adaptive Viewpoint Exploration for Training-Free 3D Spatial Reasoning and Understanding
    Shuyi Jiang, Zhihao Yuan, Na Zhao
  4. SKG-VLA: Scene Knowledge Graph Priors for Structured Scene Semantics and Multimodal Reasoning for Decision Making
    Zeyu Li, Lei Li
  5. MixCache: Mixture-of-Cache for Video Diffusion Transformer Acceleration
    Yuanxin Wei, Lansong Diao, Bujiao Chen, Shenggan Cheng, Zhengping Qian, Wenyuan Yu, Nong Xiao, Wei Lin, Jiangsu Du

Multimedia Retrieval Methods and Systems 1

  1. MMRet3D: A Multi-Modal Matching Framework for 3D Object Retrieval from Multi-View Images
    Zeyu Li, Lei Li
  2. AdRetr: Theme-Aware Advertisement Video Retrieval Beyond Keywords
    Neha Choudhary, Abhiraj Painuly, Yaman Kumar, Varun Khurana, Poonam Goyal
  3. GjPest4CMR: LLMs-Assisted Morphology-Aware Fine-grained Goji Pest Image-Text Retrieval
    Wenkai Ma, Wentao Ma, Tan Wang, Yuwei Wang, Lu Liu, Junfei Yang, Xianbao Xu, Yuan Rao
  4. MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
    Fengbin Zhu, Zijing Cai, Yuzhe Wang, Pengyang Shao, Wenjie Wang, Fuli Feng, Richang Hong, Tat-Seng Chua
  5. Calibrate and Aggregate: Cross-Modal Retrieval with Distribution Alignment and Token Reduction
    Ziyi Wu, Jiahao Li, Mingyuan Jiu, Hongru Zhao, Hichem Sahbi, Mingliang Xu
  6. NeuroAlign: Dynamic Dual-Stream Alignment of Perception and Cognition for Zero-Shot Brain-Image Retrieval
    Yixing Ke, Dong Liang, Kun Shang
  7. Reranking-based Analysis on Visual and Textual Query Contribution to Composed Image Retrieval
    Huaying Zhang, Ren Togo, Takahiro Ogawa, Miki Haseyama
  8. RFHNet: Relational and Frequency-Aware Hashing Network for Large-Scale Fine-Grained Food Image Retrieval
    Junsong Wang, Weiqing Min, Guorui Sheng, Tao Yao, Lili Wang, Shuqiang Jiang

Doctoral Symposium

  1. User Influence Characterization and Market Event Attribution via GNN-LLM Collaboration in Financial Networks
    Yunming Hui
  2. Semantic-Anchored Multi-State Retrieval for Robust 3D Perception
    Di Dai, Bo Liu, Liwei Wang
  3. Object pose estimation for upper-limb prostheses grasping.
    Ander Etxezarreta
  4. Towards Scalable and Adaptive Multi-Teacher Distillation for Text-to-Video Retrieval
    Toya Oyama

Trustworthy and Secure Multimedia

  1. BiRNet: Bilateral-Attentive Refinement Network for Tampering Detection Across Manipulation Paradigms
    Zhiyao Xie, Tong Liu, Jiahao Huang, Nuno Lourenço, Xiaochen Yuan
  2. Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models
    Bin Zhu, Yinxuan Gui, Huiyan Qi, Jingjing Chen, Chong-Wah Ngo, Ee-Peng Lim
  3. Privacy Protection Against Personalized Text-to-Image Synthesis via Cross-image Consistency Constraints
    Guanyu Wang, Kailong Wang, Yihao Huang, Mingyi Zhou, Geguang Pu, Li Li
  4. AIFIND: Artifact-Aware Interpreting Fine-Grained Alignment for Incremental Face Forgery Detection
    Hao Wang, Beichen Zhang, Yanpei Gong, Shaoyi Fang, Zhaobo Qi, Yuanrong Xu, Xinyan Liu, Weigang Zhang
  5. Privacy-Constrained Low-Bit Representation Learning for Person Image Retrieval
    Junfeng Fang, Yan Zhang, Manzhou Li, Xinjin Ge, Yan Li, Weiyuan Cui
  6. Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models
    Xiaomeng Wang, Martha Larson, Zhengyu Zhao

Brave New Ideas

  1. Retrieval of LoRA Models based on Layer-Wise Weight Embedding without Metadata
    Yuro Kanada, Yuma Oe, Huu-Long Pham, Makoto P. Kato, Hiroaki Ohshima, Sumio Fujita, Yoshiyuki Shoji
  2. Beyond Optical Flow: Latent Micro-Motion as Visual Evidence in UAV Video
    Bo-Wen Zhang, Zhou Wang, Songlu Chen, Chun Yang, Xiaobin Zhu, Xu-Cheng Yin
  3. Towards Self-Evolving Knowledge Systems: Enhancing Multimodal Agentic RAG with Hyperbolic Flows
    Tendai Mukande, Noel E. O Connor

Friday, 19 June 2026

Large-scale, Social, and Generative Multimedia Retrieval

  1. LP-VFedNN: A Lightweight and Lossless Privacy-Preserving Vertical Federated Learning Framework For Heterogeneous Neural Network Via Homomorphic Encryption and Intel SGX
    Han Sun, Liji Wu, Zixin Wang, Baisong Li, Huiping Zhuang, Weiping Wang, Yaoyi Deng, Mingxuan Li, Hailong Zhang
  2. Lookahead-R: Budget-Aware Tool Retrieval via Execution-Centric Planning
    Zongze Wu, Yani Guo, Runnan Li
  3. An Energy-Efficient Multimodal Retrieval Framework for Inference on Heterogeneous Edge Nodes
    Junfeng Fang, Yan Zhang, Mingyu Liu, Zhaoxi Feng, Manzhou Li, Yan Li
  4. Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval
    Jiaxin Wu, Xiao-Yong Wei, Qing Li
  5. Toward Generation-Centric Coding: Compressing Latents representation for TI2V Synthesis
    Jianran Liu, Wen Ji, Xiaokai Meng, Wancai Zhang, Ying Wang

Grand Challenge

  1. The 2026 Grand Challenge on Multimedia Verification: Overview and Key Directions
    Duc-Tien Dang-Nguyen, Kha-Luan Pham, Minh-Anh Pham, Silje Førsund, Henrik Vold, Minh-Triet Tran, Anh-Duy Tran
  2. DeepVerify: The End-to-end Software for Evidence-Based Multi-Modal Online Information Verification with Explainable Reasoning
    Hoang-Quoc Nguyen-Son, Tung-Duong Le-Duc, Quynh-Huong Dinh-Nguyen, Hai-Chau Nguyen-Le, Anh-Duy Tran, Minh-Son Dao
  3. Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification
    Hung Nguyen, Khang Nguyen, Hoang-Loc Cao, Phuc Ho, Van Pham, Hung Cao
  4. MOSAIV: Multi-Agent LLM Swarms for Automated Multimedia News Verification
    Muhammad Shahid Muneer, Khoa Tran, Van Tuan Nguyen, Simon Woo

Evaluation and Applications 2

  1. CompArt: Operationalizing Aesthetic Alignment in Text-to-Image Generation via Principles of Art
    Zhe Jin, Tat-Seng Chua
  2. Focal-RegionFace: Generating Fine-Grained Multi-attribute Descriptions for Arbitrarily Selected Face Focal Regions
    Kaiwen Zheng, Junchen Fu, Songpei Xu, Yaoqin He, Joemon Jose, Hu Han, Xuri Ge
  3. CLIP-SegFusion: An Attention-Guided Feature Fusion Framework for Multi-Level Detection on AI-Generated Artworks
    Yuqian Zheng, Hyeongjin Ahn, Juyeob Lee, Eunil Park
  4. Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling
    Ke Zhang, Chu-Hsuan Hsueh, Kokolo Ikeda
  5. RoDE: Linear Rectified Mixture of Diverse Experts for Food Large Multi-Modal Models
    Pengkun Jiao, Xinlan Wu, Bin Zhu, Jingjing Chen, Chong-Wah Ngo, Yu-Gang Jiang
  6. A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding
    Shuai Wang, Hongyi Zhu, Jiahong Huang, Yixian Shen, Chengxi Zeng, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring
  7. Asymmetric Pipeline for Dataset Construction and Situation-aware Generative Outfit Retrieval Leveraging Differences in Task Difficulty
    Yuma Oe, Katsumi Tanaka, Yoshiyuki Shoji

Multimedia Retrieval Methods and Systems 2

  1. LSR²: Learning to Select Relational and Reasoning Feature for Multi-modal Re-identification
    Peng Jin, Yuxuan Qiu, Zhaofa Wang, Xiaoyue Hu, Xiabing Zhou, Na Jiang
  2. B-HFA: Parameter-Efficient Vision-Language Retrieval via Block-shared Adapters and Hierarchical Aggregation
    Rui Xu, Lin Yao, Zhiyang Wu, Xuyun Zhang, Guowei Wu
  3. Adaptive Knowledge-Language Alignment for Industrial Anomaly Detection and Segmentation
    Shih-Chih Lin
  4. Which LoRA Should Be Merged Next? Retrieving an Additional LoRA from a Target Image
    Daichi Sugita, Huu-Long Pham, Makoto P. Kato, Hiroaki Ohshima, Sumio Fujita, Yoshiyuki Shoji
  5. A Decomposed Retrieval-Edit-Rerank Framework for Chord Generation
    Qiqi He, Dichucheng Li, Xiaoheng Sun, Anqi Huang
  6. POSITIVE4Rec: Incorporating the Recency Effect with Positional Inductive Bias for Sequential Recommendation
    Po-Chih Lin, Yixuan Dong, Fang-Yi Su, Haijie Yang, Zelin Zang, Hongliang Zhang, Wing-Kuen Ling, Fuji Yang

Multimedia Analysis, Representation, and Understanding 3

  1. VAR-3D: View-aware Auto-Regressive Model for Text-to-3D Generation via a 3D Tokenizer
    Zongcheng Han, Yu Hong, Haoran Sun, Dongyan Cao
  2. ICMF-Net: Interactive Cross-Modal Fusion with Attention and Selection Network for Remote Sensing Object Detection
    Kun Yao, Hao Zeng, Yida Wang, Ming Ma
  3. KAN or MLP? Point Cloud Shows the Way Forward
    Yan Shi, Qingdong He, Yijun Liu, Jingyong Su
  4. ESG-Rec: Enhancing Static-Graph Representations via Tri-view Contrastive Learning for Multimodal Recommendation
    Wenfeng Li, Ru Wang, Fuyong Xu, Guoshuai Yang, Peiyu Liu

Online (MPV-only) Presentations

The following 251 papers will be presented online only, via Multimedia Presentation Videos (MPVs). See the Information for Presenters page for details on MPV preparation and submission.

  1. Graphs for Logic and Texts for Context: A Multi-Agent Orchestrated Hybrid RAG with Stepwise Question Decomposition
    Feng Ding, Huailiang Peng, Hao Sun, Chi Zhang, Qiong Dai
  2. Mitigating Semantic Bias in Multilingual Visual Document Retrieval via Language-Vision-Aware Late Interaction
    Haowei Li, Haojie Wu, Jie Bao, Zhen Chen, Yong Liao
  3. Describing-Verifying-Scoring: A Hierarchical Reasoning Framework for Zero-Shot Composed Image Retrieval
    Guquan Jing, Peng Gao, Yujian Lee, Hui Zhang
  4. Spherical Projected Bézier Flow: A Geometry-Constrained Manifold Transport Framework for Cross-Age Face Retrieval
    Huaqing Song, Baichuan Lin, Shuofeng Sun, Lanchi Xie, Haibin Yan, Zhihui Li
  5. PIRSA: Profile-Indexed Retrieval and Semantic Frame Alignment for Ambiguous Spoken Language Understanding
    Xiaoqin Zhang, Xingpeng Wu, Yanjun Lu, Shuhan Nie, Tian Shi, Xianglong Liu, Xin Yang
  6. PAMS-GNN: Popularity-Aware Multimodal Semantic GraphNeural Networks for Recommendation
    Quanyou Li, Yunqi Cao, Le Yu, Wenxin Li, Jin Xu
  7. DIR-RSCLIP: A Degradation-Invariant Cross-Modal Retrieval Network for Remote Sensing Images
    Xiaotian Li, Chenyu Zhang, Changbai Chen, Zhongjie Zhu
  8. BiOVQL: Brain-inspired One-stage Egocentric Visual Query Localization
    Yifei Cao, Guolong Wang, Mingliang Hou, Jizhe Yu, Xianjie Zhang, Xiya Bu, Zhizhen Li, Yu Liu
  9. M-STAR: Multi-view Semantic Topology Alignment with Reasoning from VLMs for Image-Text Retrieval
    Xuewen He, Yuning Guo, Fumao Xu, Mingyong Li
  10. Scaling Multimodal Retrieval and Generation for Long Documents through Visual Tiling and Context Compression
    Yi Jin, Weichao Chen, Shengjie Zhao
  11. Unsupervised Cross-Modal Semantic Invariance Hashing
    Qiyou Huang, Meng Wang
  12. RoATR: A Systematic Study of Audio-Text Retrieval Robustness Against Realistic Perturbations
    Honglei Zhang, Pengfei Zhou, Ruohan Wang, Siyue Zhang, Yilei Shi
  13. DeHub: Learning Hub-Resistant Representations for Text-Video Retrieval
    Anjun Jia, Xiaowei Zhang
  14. Empowering Vision Language Models for Training-Free Visual Search via Context-Aware Scanpath Simulation
    Haoran Wang, Dan Wan
  15. DyCa-GRPO:Calibrated and Efficient Learning-to-Rank for Multimodal Retrieval with Human Feedback
    Ning Han, Xiubo Liang
  16. CCRA: A Cross-modal Complementary Representation Alignment Framework for Bridging the Modality Gap
    Xingchen Han, Ruihao Zhang, Ruiting Li, Yingxin Pei, Jiaqi Wang, Zhe Ji, Feiliang Ren, Yongkang Liu
  17. PRISM-GCN: Principled Representation Integrationon Graphs for Multi-Behavior Recommendation
    Xinwei Li, Gaoquan Liu, Changqiang Xu, Ruohong Huan, Xiaomin Zhao
  18. MCHRAG: Multi-Centroid Hierarchical Indexing for Efficient Incremental RAG
    Yuan Ren, Mingxue Liao, Gang Zhou, Jinxing Peng, Pin Lv
  19. RankVR: Low-Rank Structure Perception and Value Recalibration for Robust Composed Image Retrieval
    Jiale Huang, Zixu Li, Zhiheng Fu, Zhiwei Chen, Qinlei Huang, Yupeng Hu
  20. Target-Enhanced Gated Transformer: A Multi-Behavior Recommendation Framework for Noise Suppression and Target Signal Preservation
    Xing Zhang, Xu Cheng, Likang Wu, Yingyuan Xiao, Wenguang Zheng
  21. IMAGINE: Adaptive Schema-Imagery Enhanced Composition for Composed Video Retrieval
    Jiale Huang, Zixu Li, Zhiwei Chen, Zhiheng Fu, Chunxiao Wang, Yupeng Hu
  22. CREAM: Collaborative Representation with Self-supervised Alignment for Multimedia Recommendation
    Junhao Gao, Chao Yang, Bin Jiang
  23. Contrastive Multimodal Fusion and Pseudo-Label method for Unsupervised Cross-Modal Hashing Retrieval
    Qinze Zhu, Jiayi Yang, Yijie Zhu, Mingyong Li
  24. From Noisy Candidates to Reliable Grounding in Weakly-Supervised Referring Expression Comprehension
    Yunlong He, Ziqi Gu, Tong Zhang, Zhen Cui, Chunyan Xu
  25. Fine-grained Text-Video Retrieval with Patch-level Temporal Difference and Aggregation
    Jialong Hu, Zijie Song, Yang Wang, Zhenzhen Hu, Jia Li, Yixiao Ma, Richang Hong
  26. Global-Regional Dual Hashing for Unsupervised Visual-Textual Retrieval via Concept Similarity Guidance
    Yewen Li, Zongwei Tang, Xiaodong Wang
  27. SCAN: Self-Calibrated Textual Anchoring for Dual-Granularity Video Screening in Text-Video Retrieval
    Dixin Chen, Baoyao Yang, Haifeng Lin, Canrong Du, Wenbin Yao
  28. Deconstructing Centrality: Scale-Hierarchy for Hubness in Text-Video Retrieval
    Houlin Zhu, Libo Liu, Ruonan Zhang, Zhen Deng
  29. Robust Graph Matching via Confidence-Guided Distillation and Random Node Masking
    Zhoubo Xu, Zizhao Pang, Yu Meng, Huijie Cong
  30. CARE: A Constraint-Aware Hypergraph Framework for Knowledge-Driven Event-Centric Retrieval
    Mengxue Yang, Xitong Li, Ziyi Yang, Jingqi Zhang, Xiaruo Zhang, Ying Li
  31. Cross-View Collaborative Recommendation with Multimodal and Multi-Scale User Behaviors
    Yifan Huo, Ming Liu, Junhong Zheng, Lili He
  32. Relational Retrieval: Leveraging Known-Novel Interactions for Generalized Category Discovery
    Yulin Xu, Chunqi Guo, Yuanzhen Shuai, Jianyuan Ni
  33. Instance-Adaptive Routing for Object Re-Identification with Heterogeneous Experts
    Shuming Hu, Chuan Fu, Shuting He, Henghui Ding
  34. Video Hashing with Robust Secondary Frames and Local Tangent Space Alignment for Copy Detection
    Zixuan Yu, Xiaoping Liang, Zhenjun Tang
  35. DTSR: High-Frequency Prior-Based Dynamic Texture Synthesis for Real-World Image Super-Resolution
    Feiyi He, Zihan Cheng, Jielei Wang, Cencen Liu, Guoming Lu
  36. Neural Representations for Animated GIFs
    Yifei Wang, Gaozhi Liu, Sheng Li, Xinpeng Zhang, Zhenxing Qian
  37. SatCLA: A Collaborative LLM-Driven Framework for Annotation of LEO Satellite Imagery
    Guogen Zeng, Juan Luo, Peng Sun, Ying Qiao, Anping Liu
  38. Semi-3DETR: Semi-Supervised Detection Transformer for 3D Object Detection
    Na Dong, Gim Hee Lee
  39. CodeMNER: Vision-Language Models are Better Multimodal Named Entity Recognizers via Progressive Vision-Code Alignment
    Jiakang Yu, Shizhou Huang, Xiaode Chen, Hongtao Deng, Wang Gao, Xun Zhu
  40. A<sup>2</sup>P-Net: Asymmetric Domain-Adaptive Prototype Network for Cross-Domain Multimodal Sensor Retrieval
    Xin Qin, Wenjie Wang, Mengna Liu, Xu Cheng, Fan Shi, Shengyong Chen
  41. Keep the General&#x002C; Inject the Specific: Structured Dialogue Fine-Tuning for Knowledge Injection without Catastrophic Forgetting
    Yijie Hong, Xiaofei Yin, Xinzhong Wang, Ya Guo, Huijia Zhu, Sufeng Duan
  42. Improving Pseudo-Labeling and Representation Balance in Realistic Long-Tailed Semi-Supervised Learning
    Zhengyu Ma, Qifeng Zhou
  43. SubGAva: 3D Gaussian Primitive Subdivision for Photo-realistic and Animatable Human Avatars from Monocular Video
    Pu Wang, Dehui Kong, Jinghua Li, Baocai Yin
  44. Entropy Regularized Simple Multiple Kernel K-Means with Adaptive Deviation Correction
    Xiaohong Jia, Zhiwei Xia, Baijing Wu, Yunchao Wei, Yao Zhao
  45. OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling
    Hongyu Chen, Liang Lin, Guangrun Wang
  46. MAFNet: Multi-frequency Adaptive Fusion Network for Real-time Stereo Matching
    Ao Xu, Rujin Zhao, Xiong Xu, Boceng Huang, Yujia Jia, Hongfeng Long, Fuxuan Chen, Zilong Cao, Fangyuan Chen
  47. PURE: Probabilistic Utility for Robust Evidence in Multimodal Recommendation
    Jinguo Hu, Yuelan Qi, Song Yu, Zhifang Liao, Wendong Zhang
  48. From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation
    Fengrui Liu, Ruiyang Huang, Qijian Zheng, Yuanfang Wang, Feng Liu
  49. Parameter-Efficient Adaptation with Proxy Anchors for Cross-Domain Few-Shot Learning
    Song Shi, Chengqiao Liu, Jinfang Jia
  50. Real-Time Retrieval-Free Camera Pose Estimation via Sparse Cross-Modal 2D&#x002013;3D Matching with Projection-Guided Refinement
    Fan Wu, Amine Kacete, Jérôme Royan, Guillaume Moreau
  51. KG-CPEN: Knowledge-Guided Compositional Prototype Evolution for Unbiased Scene Graph Generation
    Yujun Hu, Changbo Wang, Gaoqi He
  52. Anomaly Detection in Dynamic Networks with Hyperspherical Projection and DBN-based Anomaly Synthesis
    Yifan Hong, Jiao Luo, Wang Jiawei, Yangchen Zeng, Yusen Wu
  53. SSHF-CLIP: Semantic-Guided Scale Selection and Hybrid Fusion for Zero-Shot Anomaly Detection
    Kaiyuan Jin, Wayit Abliz, Maihemuti Maimaiti, Zaokere Kadeer, Aishan Wumaier, Abdujelil Abdurahman, Panpan Zheng
  54. Detail-Aware Camouflaged Object Detection via Multi-Granularity Collaborative Learning
    Ye Wang, Kai Huang, Kai Zhao, Sumin Shen
  55. TASEN: Topic-Aware Semantic Enhancement Network for Multimodal Named Entity Recognition
    Guohui Ding, Chufei Wang, Hongfeng Wang, Zakovorotnyi Oleksandr
  56. Egocentric Action Recognition with Retrieval-Augmented Learning
    Yishan Zou, Chris Nugent, Matthew Burns, Shengli Wu, Mingzhu Xu, Meng Liu
  57. GADRNet: Geometry-Prior-Guided Adaptive Distortion Rectification Network for Panoramic Depth Estimation
    Guoxu Li, Cheng Han, Chao Zhang, Tongzhou Zhang, Shuang Yang
  58. MOC-3D: Manifold-Order Consistency for Text-to-3D Generation
    Chenyang Fan, Wen Yang, Junshi Cheng, Zihong Li, Wenfeng Zhang, Wei Hu, Yi Zhang, Pan Zeng
  59. From Confrontion to Balance: A Kronecker-Constrained Spectral Entropy Joint Optimization Framework for Multimodal Sentiment Analysis
    Feifei Xu, Puzhe Li, Dongyang Li, Bo Li, Luobing Huang, Wenjing Zhu, Zirui Xu, Yu Xie
  60. Graph-Based Rotation-Robust Semantic Modeling for Oriented Object Detection in Remote Sensing Images
    Hongning Liu, Xianchao Zhang, Hui Sun, Linlin Zong, Wenxin Liang, Xinyue Liu
  61. Robust Multi-modal Knowledge Graph Completion via Modality-Specific Experts
    Haiyan Liu, Xin Song, Ye Wang, Kai Chen, Yuying Liu, Bin Zhou, Hongkui Tu, Liqun Gao, Yue Qian
  62. LaViSE: Language-aware Vision Scale Enhancement for Referring Remote Sensing Image Segmentation
    Yan Li, Junjie Zheng, Zhouchao Fu, Shengjie Yang, Junjie Liao, Jianwei Zheng
  63. Symmetry-Aware Causal Inference for Robust Neural PDE Solvers
    Yuanming Xie, Yanzhuo Xiang, Haochen You, Nuoya Liu, Fangzhou Liu, Bo Zhao, Zhaolu Kang, Yue Li, Yuqi Li
  64. Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation
    Zijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang
  65. Ref2Inpaint: 3D Gaussian Inpainting via Visibility-Aware Mask Refinement and VLM-Guided Reference Retrieval
    Yining Xu, Yuanyang Zhang, Jingjiao You, Yingjie Huang, Jianbo Mei, Yilong Liu, Li Yao
  66. Beyond Inconsistent Reasoning: Intermediate Process Direct Preference Optimization on Small Multi-modal Large Language Models for Visual Question Answering
    Yongzhu Miao, Puzhen Su, Haoran Yin, Shasha Li, Jintao Tang, Ting Wang
  67. Mitigating Multimodal Inconsistency via Cognitive Dual-Pathway Reasoning for Intent Recognition
    Yifan Wang, Peiwu Wang, Yunxian Chi, Zhinan Gou, Kai Gao
  68. OpenSGG-VL: Open-Vocabulary 3DSGG with Orthogonal Residual Fusion and Iterative Relation Refinement
    Binbin Zhang, Fang Zhou, Liang Xiao, Zhiyong Su, Weiqing Li
  69. TEA-Mamba: Textual Event-Aware Mamba for Multimodal Time Series Forecasting
    Haowei Ran, Zheng Wang, Meijun Sun
  70. SEEDCAP: SEMANTIC EXPANSION AND ENTITY-DRIVEN ZERO-SHOT IMAGE CAPTIONING
    Binbin Li, Shupei Xiao, Dayan Wu, Gengqi Yang, Siyu Jia, Zisen Qi
  71. AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive Videos
    Jiagao Hu, Daiguo Zhou, Danzhen Fu, Fuhao Li, Zepeng Wang, Fei Wang, Wenhua Liao, Jiayi Xie, Haiyang Sun
  72. CausalGS: Learning Physical Causality of 3D Dynamic Scenes with Gaussian Representations
    Nengbo Lu, Minghua Pan
  73. ExpV2S: Zero-Shot Expressive Video-to-Speech Synthesis via Latent Diffusion Model
    Fang Zhang, Anqi Gou, Linli Xu
  74. PRISM: Preference-Guided Semantic Reasoning with Vision-Language Models for Object Goal Navigation
    Zijian Liu, Cong Pan, Chengjie Fan, Wanjie Cai, Xichen Ding, Jie Qin
  75. Rectifying Multimodal Variance: UAPA-HCF for Weakly Supervised Violence Detection
    Longkun Shi, Hanlin Hu, Haoze Zheng, Yuanyuan Liao, Turdi Tohti
  76. Where & What Anomaly? A Framework for Pose-Agnostic Anomaly Detection and Zero-Shot Semantic Classification
    Zhaokun Huang, Yonghong Song, Heyao Zhang
  77. Learning A Bank of Transferable Prompts for Vision-Language Models
    Jiong Wang, Zhongwei Huang, Chong Wang, Endai Huang, Ran Zhou, Haitao Gan, Yingying Zhu, Xiaoyu Shen
  78. Decision-Invariant Sim-to-Real Vision-and-Language Navigation with Pseudo-Panoramic Observations
    Yuanyu Zheng, Xumin Shen, Yunda Sun, Ying Shen, Lin Zhang
  79. SGFR-Track: Uncertainty-Gated Spectral Feature Restoration for Online Multi-Object Tracking
    Zheng Liang, Yisu Liu, Shuo Yang
  80. Retrieval-Guided Contextual Inference for Training-Free Video Anomaly Detection in Low-Light Scenarios
    Mengjingcheng Mo, Jiankang Zheng, Jiaxu Leng, Xinbo Gao
  81. Agglomerative Model Meets Multi-Scale Adaptive Fusion for Cross-Modal Unsupervised Domain Adaptation
    Zhixun Wang, Liqun Kuang, Song Wang, Shichao Jiao, Zhongyu Chen, Fengguang Xiong
  82. CHM: Context Hiding and Misguidance for Robust Adversarial Attacks on Active Speaker Detection
    Xiangyu Ye, Yatie Xiao, Qingxiao Guan, Zhenbang Liu
  83. HIRNet: Hypergraph-Induced Iterative Reasoning Network for Crowd Counting
    Ruihan Wang, Mengqi Lei, Siqi Li, Wei Bao
  84. Unveiling PEFT Robustness to Noisy Labels in VLMs: A Gradient-Loss Decoupling Perspective
    Tengfei Ma, Weiran Pan, Wei Wei
  85. Decoupling Multimodal Perception and Reasoning for Image Reasoning Segmentation with Large Language Models
    Yiqing Shen, Feng Chen
  86. Beyond Post-hoc Fusion: Rethinking Cross-Modal Interaction Timing in Few-Shot Learning
    Liang Yang, Hongyuan Xiao, Songtao He, Ye Lin, Zhenchang Zhang
  87. GeoPro-Depth: Geometrically Consistent Prompting for Robust Metric Depth Completion
    Xun Fang, Zixuan Hua, Lihua Zhang
  88. A Unified Object-Centric Spatio-Temporal Graph Reasoning Framework for Audio-Visual Question Answering
    Feifei Xu, Wenjing Zhu, Dongyang Li, Puzhe Li, Luobin Huang, Yu Xie, Zirui Xu
  89. RainbowDreamer: Taming Semantic Controls for Attribute-Consistent Text-to-3D Generation
    Weiyi Bu, Xiaodong Cun, Rui Yin, Jiantao Yuan, Wei Qi
  90. Hierarchical Local&#x002013;Global Context Modeling with Selective Modulation for Point Cloud Semantic Segmentation
    Songtao Li, Di Zheng, Xihua Zou
  91. C$^2$MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning
    Yuntao Shou, Tao Meng, Wei Ai, Keqin Li
  92. PanoAdapter: Efficient Adaptation of Depth Foundation Models for Immersive Multimedia via Spherical Rectification
    Wei Xue, Zhiyong Huo
  93. Teaching Audio-Language Models to Reason over Time
    Yufeng Xu, Yunjia Li, Hai Wang, Wei Li
  94. Structure Aware Distillation for Multimodal Intent Understanding Under Missing Modalities
    Lanlan Lu, Qimeng Yang, Yi Liu, Xinjun Pei, Jinmiao Song
  95. STeP-Net: A Spatio-Temporal Perception Network for Action Detection
    Kunfang Song, Guowei Yan, Jiaqing Wang, Shufen Ruan, Yanwen Wang
  96. Text-Guided Prototype Replay and Classifier Guidance for Incremental Few-Shot Semantic Segmentation
    Luofeng Zhang, Shengzhe You, Qian Shao, Yanjing Lei, Yu Liu, Fei Gao
  97. Towards Robust Sparse-View 3D Gaussian Splatting via Hierarchical Depth and Multi-View Consistency
    Jianhui Zheng, Zhiyong Huo, Jiahao Zheng
  98. CERA: Conflict-Explicit Reflective Agent for Multimodal Emotion Reasoning
    Kejun Liu, Yuanyuan Liu, Ke Wang, Jiahao Zhang, Lei Xu, Chang Tang, Zhe Chen, Yibing Zhan
  99. PCMA: Prompt-guided Cross-domain Multi-prototype Alignment for Source-Free Domain Adaptation
    Kaicheng Peng, Ya Li
  100. HB-Mamba: Hierarchical Bi-directional State Space Modeling for LiDAR Semantic Segmentation in Autonomous Driving
    Wei Li, Haiyun Guo, Manli Tao, Honghui Dong, Ming Tang, Jinqiao Wang
  101. LTA-Gait: In-Network Temporal Activation of Large Vision Models for Gait Recognition
    Qichao Zhang, Genlang Chen, Chengcheng Jia, Jiajian Zhang
  102. Adaptive Knowledge Generation via Reinforcement-Guided Pattern Completion for Zero-Shot Visual Question Answering
    Zhihui Sun, Diwei Su, Xiuxing Li, Qixin Wang, Shihao Zhang, Xia Wu
  103. GD-Head: Reconstructing High-quality 3D Avatar Head from a Single Image Using Geometry-guided Diffusion Models
    Leyuan Liu, Xiaoqing Chen, Yufei Qian, Jingying Chen
  104. HM-NVS: Hierarchical Multi-Modal Novel View Synthesis\with Uncertainty-Aware Progressive Refinement
    Jiahao Chang, Haohua Zhao, Liqing Zhang
  105. PSRNet: Progressive Semantic Refinement for Human Parsing via Text Conditioning and Embedding-Based Calibration
    Ming Meng, Hanwen Liu, Xingxing Xiang, Long Ye, Lei Zhang, Zhaoxin Fan
  106. From Diffusion to Rectified Flow: Rethinking Text-Based Segmentation
    Zishen Qu, Xuesong Li, Hongwei Kang, Haijian Gu, Quan Meng, Tianrui Niu, Xin Yang, Ruidong Pan
  107. Geometry-Guided Depth Correction for Metric Relative Pose Estimation
    Shibin Xie, Hao Yin, Shuting Wang, Xiaokang Fang, Liang Jin, Haotian Liu, Yanting Zhang, Shen Cai
  108. Learning Where to Embed: Noise-Aware Positional Embedding for Query Retrieval in Small-Object Detection
    Yangchen Zeng, Zhenyu Yu, Dongming Jiang, Wenbo Zhang, Yifan Hong, Zhanhua Hu, Jiao Luo, Kangning Cui
  109. Time-Surface Self-Attention: Restoring Temporal Connectivity in Spiking Transformers
    Tiantian Xiao, Xi Wu, Hongbin Lv, Daoyuan Wang
  110. RHVI-FDD: A Hierarchical Decoupling Framework for Low-Light Image Enhancement
    Junhao Yang, Chunguo Wu, Bo Yang, Hongwei Ge, Yanchun Liang, Heow Pueh Lee
  111. BSSNet: Block-Aware Serialized Spatial Learning for Robust Point Cloud Registration
    Hang Li, Yulong Sun, Binhong Zhao, Feng Chen, Limei Hu
  112. Event-Centric Structural Modeling for Zero-Shot Video Moment Retrieval
    Xin Li, Yongxiu Xu, Yuyao Kong, Hongbo Xu, Gaopeng Gou, Yubin Wang
  113. SliceCSRef: Dual-Level Semantic Alignment for Robust Speech Referring Expression Comprehension
    Lihong Huang, Sheng-Hua Zhong, Qiao Yan, Zhijiao Xiao, Yan Liu
  114. DenseSpeech: Dense Multi-Segment Temporal Grounding in Public Speaking Videos
    Jiachen Tan, Tingting Zhang, Tao Zhou, Guangyao Su, Jianwei Fang, Bin Wu, Chunping Zheng
  115. Evo-CuRL: Curriculum-Aware Reinforcement Learning over Code Lineage Graphs for Software Engineering Reasoning
    Wei Tan, Yuanhao Li, Wenkai Liang
  116. Moir&#x00E9;Net: Leveraging Directional Priors for Compact Dual-Domain Image Demoir&#x00E9;ing
    Shuwei Guo, Simin Luan, John See, Zeyd Boukhers, Miho Ohsaki, Kimiaki Shirahama, Cong Yang
  117. QMTD: Query Vector Guided Multi-Scale Text Detection
    Zhiqiang You, Yutong Jiang, Shenguang Huang, Zhangjie Liu, Gaode Wu, Haoyu Wang
  118. ReNoRD: Learning from Relations under Noisy Pseudo Labels via Relational Distillation for Multimodal Sentiment
    Tiantai Zhai, Yan Zhuang, Fuji Ren, Jiawen Deng, Liang Luo
  119. Dual-view Driver Gaze Estimation via Mutual Enhancement
    Chengzheng Fu, Rong Quan, Siyu Chen, Yiming Ni, Jie Qin
  120. HD&#x00B2;FI-Net: Hierarchical Dual-Domain Fusion&#x002013;Interaction Network for RGB-T Semantic Segmentation
    Zhenrong Guo, Bowen Fei, Daqian Liu, Jiahao Zhang
  121. STAR-GS: Spatio-Temporal Geometry Alignment and Generative Refinement for Sparse-View 4D Gaussian Splatting
    Yunqi Gao, Zhanfeng Liao, Dongbo Zhou, Leyuan Liu
  122. STEP: Stable Gradient Projection for Continual Learning
    Longlong Zhai, Jiao Tian, Feng Yan, Lei Su, Yanjun Qin, Shaochen Jiang, Chong Peng, Panpan Zheng
  123. GlassSplat: Geometric Consistency and Pruning for Reflection-Free 3D Scene Reconstruction
    Jingjiao You, Yuanyang Zhang, Yining Xu, Yunjie Zhang, Li Yao, Cunjian Chen, Tien-Tsin Wong
  124. VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
    Lu Dong, Haiyu Zhang, Han Lin, Ziang Yan, Xiangyu Zeng, Hongjie Zhang, Yifei Huang, Yi Wang, Zhen-Hua Ling, Limin Wang, Yali Wang
  125. DINOTrack: Leverage Differential Attention for Noise-Aware Visual Tracking with DINOv3
    Wei Xu, Gu Geng, Di Yuan, Rui Chen, Qiao Liu
  126. RaC-Stitch: Reliability-Aware Collaborative Smoothing for Unsupervised Video Stitching
    Guoliang Liu, Zhengwei Miao, Jianlin Zhang, Haorui Zuo
  127. Beyond Over-Editing: Important Weight Constrained Knowledge Editing in Large Language Models
    Zifeng Zhu, Yixian Dai, Binghui Guo, Hongwei Zheng, Yifan Sun, Zhaoxin Fan
  128. Toward General and Robust LLM-enhanced Text-attributed Graph Learning
    Zihao Zhang, Xunkai Li, Rong-Hua Li, Zhenjun Li, Bing Zhou, Guoren Wang
  129. BSR-CLIP: Background-Calibrated Structural Reasoning for Zero-Shot Visual-Language Anomaly Detection
    Shengchang Wang, Yue Han, Yongquan Xue, Jiao Li, Sizhe Tan, Yunfei Zhang, Liejun Wang, Panpan Zheng
  130. Query-Guided Conflict Inference and Incongruity-Aware Alignment for Implicit Hate Speech Detection in Videos
    Shuo Liu, Jiakang Yu, Xun Zhu, Hongtao Deng, Yinxia Lou
  131. YDANet: Leveraging YCbCr Color Space and Dual-Path Attention Network for Depth Completion
    Jun Liu, Guoqiang Xiao, Michael S. Lew, Song Wu
  132. TCRS-QA: Training-Free Chain-of-Thought Reasoning for Shot-Aware Storyline Question Answering in Long-Form Videos
    Zhenpeng Zeng, Xiaoyu Wu, Xuxu Wang, Qian Yu, Yudong Wang, Zihao Liu
  133. SIGaze: Toward Pixel-Level Single-Instance Gaze Object Prediction
    Dongxing Duan, Xu Liu, Jingyuan Xu, Ruijie Liu, Dan Guo
  134. SparseStreet: Sparse Gaussian Splatting for Real-Time Street Scene Simulation
    Qingpo Wuwu, Xiaobao Wei, Peng Chen, Nan Huang, Zhongyu Zhao, Hao Wang, Ming Lu, Ningning Ma, Shanghang Zhang
  135. TD-CoT: Bridging the Holistic-Atomic Gap for Training-Free Temporal Reversal Detection in Video LVLMs
    Pengfei Huang, Xuezhen Hou
  136. Efficient Music Denoising with Channel Attention and Multi-Scale Sequence Encoding
    Seungmin Ha, Wei Li, Yulun Wu
  137. Robust Exemplar Prompt Learning via Bi-directional Visual-Semantic Alignment for Multi-Object Tracking
    Lingyan Liang, Zhibin Zhang, Gang Dong, Dongchao Wen, Kaihua Zhang
  138. LDCS-Net: Local Dual-Context Attention Network for 3D Semantic Segmentation
    Shuang Guo, Ying Zhou, Meina Song, Huilin Ai, Jia Long Li, Zi Yang Chen
  139. CPD: Distilling Semantics in Feature Space via Class-Projection Interaction
    Yingbin Wang, Jielei Wang, Qianxin Xia, Xuewan He, Guoming Lu
  140. Locate Core&#x002C; Refine Path: A Training-Free Closed-Loop Paradigm for Referring Video Object Segmentation
    Jizhe Yu, Hao Zhang, Xiya Bu, Yuhang Duan, Xiaoshuai Wu, Yu Liu
  141. Joint-Guided Spatial and Semantic Sensitive Diffusion Policy for Robotic Manipulation
    Hongda Zhang, Siao Liu, Yi Liu, Chun Ouyang, Zhongxue Gan
  142. LimbAug: Enhancing Virtual IMU Generalization in Human Activity Recognition via Learning Limb Movement Difference
    Lingtao Huang, Chengshuo Xia
  143. UniDGF: A Unified Detection-to-Generation Framework for Hierarchical Object Visual Recognition
    Xinyu Nan, Lingtao Mao, Huangyu Dai, Zexin Zheng, Xinyu Sun, Zihan Liang, Ben Chen, Chenyi Lei
  144. BL-UDA: Towards Unsupervised Domain-Adaptive Surgical Instrument Segmentation with Source Box Labels
    Ziyuan Zhao, Yuhua Wang, Yifang Yin, Yichen Zhang, Xulei Yang, Jun Cheng, Roger Zimmermann, Cuntai Guan, S. Kevin Zhou
  145. PEGE: Monocular 6D Pose Estimation with Geometry-Aware Enhancements for Small Objects
    Qianlei Wang, Kexun Chen, Yuhuang He, Xiaolin Qin
  146. Short-Length Hashing via Bit-Level Semantic Representation for Image-Text Retrieval
    Qing Ma, Siyang Zhang, Yue Jiang, Cong Bai
  147. StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models
    Keli Liu, Zhendong Wang, Wengang Zhou, Houqiang Li
  148. HSS-Net: Hybrid State Space Modeling for Efficient Unified Adverse Weather Restoration
    Yueqi Zhu, Baiwen Zhang, Guo Cheng, Yongkang Zhang, Feiran Liu, Er Cao, Meng Xu
  149. Stillness is Redundant: Motion-Aware KV Cache Retrieval for Efficient Video Understanding
    Jingru Li, Haowen Zheng
  150. Audit-and-Repair Indexing: Probabilistic Caption Indexes for Robust Multimodal Retrieval
    Yangyang Liu
  151. SA-Edit: Accelerating Editing Models via Test-time Spatial Acceleration
    Yihao Song, Teng Hu, Ran Yi, Xiaoning Lei, Bin Sheng
  152. Uncertainty-Gated Generative Compression for Structure-Preserving Multimedia Retrieval
    Yiming Ding, Ziang Chen, Jianguo Wei
  153. SHARP: Semantic Head-Aware Representation Pruning for Efficient MLLMs
    Haifeng Ma, Mingyue Guo, Linhui Xiao, Qingfang Zheng, Qingming Huang
  154. Self-Supervised Video Hashing with Consistent Short-Term and Long-Range Temporal Modeling
    Shuang Hu, Likai Yang, Xiaoping Liang, Zhenjun Tang
  155. GDT-VLM: Global Distribution Modeling for Visual Token Compression in Efficient Multimodal Large Language Models
    Jiangtao Xie, Junjie Wu, Zhaolin Zhang, Qilong Wang, Peihua Li
  156. Efficient Rationale-based Retrieval: On-policy Distillation from Generative Rerankers based on JEPA
    Teng Chen, Sheng Xu, Feixiang Guo, Xiaoyu Wang, Qingqing Gu, Hongyan Li, Luo Ji
  157. Ask-to-Retrieve: VQA-Guided Information-Gain Question Selection for Interactive Text-to-Image Retrieval
    Shuaiwei Xie, Yating Yang, Bo Ma, Xi Zhou, Zhen Wang, Ahtamjan Ahmat
  158. Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models
    Rong Quan, Yantao Lai, Dong Liang, Jie Qin
  159. FMD-AL: Cold-Start Active Learning based on Foundation Model
    Huilin Ai, Ying Zhou, Zhonghua Peng, Ziyang Chen, Shuang Guo, Heng Xu, Zhiwei Yu, Jialong Li
  160. VideoAgent: Personalized Synthesis of Scientific Videos
    Xiao Liang, Bangxin Li, Zixuan Chen, Hanyue Zheng, Zhi Ma, Di Wang, Cong Tian, Quan Wang
  161. FreSCo: Joint Frequency-Aware and Spatial Control for Image Zero-Shot Style Transfer
    Tingrun Chen, Xudong Ling, Shicai Wei, Guiduo Duan, Yue Zhang
  162. Retrieval-Augmented Camera Control for Video Diffusion
    Lining Wang, Hongxun Yao, Jinyu Zhang
  163. LayoutGD: Content-Aware Layout Generation via Graph-Enhanced Diffusion Model
    Xudong Zhou, Guozheng Li, Chi Harold Liu
  164. NeRAG: Neuro-Explicit Retrieval-Augmented Generation for Real-Time Interaction in Digital Humans
    Yueqian Guo, Tianzhao Li, Xin Lv, Jiehaolin Chen, Zhaohan Wang, Yurun Chen, Sirui Xiao, Yezi He, Helin Li, Fan Zhang
  165. Context Relation-Aware and Fine-Grained Token Interaction for Dialogue-Level Aspect-Based Sentiment Quadruple Analysis
    Jiahui Liu, Tao Sun, Zimeng Xu, Zhipeng Shen, Yifan Kong, Jiaao Zhou
  166. InterFold: Learning Interpretable Diffusion Manifolds Beyond Binary Samples
    Alexander Vincent Lewi, Rainer Tan, Shengfeng He
  167. Training for Identity&#x002C; Inference for Controllability: A Unified Approach to Tuning-Free Face Personalization
    Lianyu Pang, Ji Zhou, Qiping Wang, Baoquan Zhao, Zhenguo Yang, Qing Li, Xudong Mao
  168. Sticker-Enriched Empathetic Response Generation: A Role-Aware Pairing Benchmark and A Novel Multimodal Framework
    Wei Zhang, Changhong Jiang, Lulu Wang, Mingting Yu, Siyuan Zhao, Ronghan Li
  169. Dual-Pathway Diffusion for Hand Correction in Synthetic Portraits: Global Context Aware and Local Structure Refinement
    Yushe Cao, Luoxi Jing, Yuanze Wang, Dianxi Shi, Chun Yu, Junliang Xing
  170. ExpPortrait: Novel Expression Generation for Fine-Grained Controllable Portrait Animation
    Hualiang Wei, Wenhui Li
  171. MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
    Jianxuan Yang, Xiaoran Yang, Lipan Zhang, Xinyue Guo, Zhao Wang, Gongping Huang
  172. Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation
    Zehua Cheng, Wei Dai, Jiahao Sun
  173. ComMark: Covert and Robust Black-Box Model Watermarking with Compressed Samples
    Yunfei Yang, Xiaojun Chen, Zhendong Zhao, Yu Zhou, Xiaoyan Gu, Juan Cao
  174. Multimodal Deepfake Detection with Quantum State Inspired Analytic Incremental Adaptability Learning
    Jianbin Ye, Man Xiao, Bo Liu, Huaping Hu, Zijian Gao, Shaojing Fu, Kele Xu, Huaimin Wang
  175. UAU-Net: Uncertainty-aware Representation Learning and Evidential Classification for Facial Action Unit Detection
    Yuze Li, Zhilei Liu
  176. Towards Generalized Image Manipulation Localization via Score-based Model
    Yunfei Wang, Bo Du, Zhe Yang, Xin Liu, Zhiyu Lin, Tianxin Xu, Ji-Zhe Zhou
  177. GMAE: Gated Multi-signal Adaptive Ensemble for Targeted Transfer Attacks on Commercial Large Vision-Language Models
    Chengyin Hu, Yijun Chen, Tianle Liang, Yiwei Wei, Ang Li, Haitao Shi, Lingyan Bian, Xuelian Shi
  178. Preserving Texture in Chaos: Texture-Aware Deep Unfolding for Secure Compressed Sensing
    Hongying Zheng, Aijia Zhou, Di Xiao
  179. Text Recovery Attacks and Defenses on Physical Envelopes
    Yongfei Tao, Yi Zhang, Runze Liao, Jingwei Qu, Bingyao Huang
  180. Mitigating Hallucinations in Vision-Language Models via Contextual Entropy Calibration
    Xuanyu Yin, Daowan Peng, Wei Wei
  181. Spatial-Frequency Domain Complementary Learning for Robust Cross-Modal Hashing
    Gang Zhou, Shibiao Xu, Xiaolong Zheng
  182. Semantic-Guided Fast Adversarial Training via Class Relationship Exploitation
    Yu Chen, Ke Wang, Fan Yang, Qiang Xu, Jinwei Chi, Honghao Wei
  183. MirageNet: A Secure&#x002C; Efficient&#x002C; and Scalable DNN Protection for Edge-Computing Multimedia Retrieval
    Huadi Zheng, Cheng Li, Xin Zhou, Wei Wang, Yuanhang Yu, Feng Wang, Yan Ding
  184. TSAD:Trace-Semantic Adaptive Disentanglement for Detecting and Grounding Multi-Modal Media Manipulation
    Wenzheng Liu, Cheng Fu, Hujin Peng, Junlong Wu, Xianhong Chen, Lan Huang, Jing Xu, Yixi Tian, Menghan Liang, Xiaofeng Wang, Tan Deng, Wanwei Jiang, Xiang Li
  185. Structure-Induced Safety Gaps in Multimodal Reasoning Systems
    Meng Yang, Peirou Liang, Zhiqian Wu, Yong Liao
  186. Content-Adaptive Implicit Neural Representations for Resolution-Agnostic Remote Sensing Watermarking
    Minxi Li, Naen Xu, Hengyu An, Tianyu Du
  187. HiChrom-MAE: Frequency-Chromaticity Masked Autoencoding for Palmprint Presentation Attack Detection
    Qichao Xiong, Yiheng Huang, Junhong Chen, Zhanhong Liang, Lunke Fei
  188. Enhancing Deepfake Detection Reliability via Risk-Regulated Dual-Threshold Interval Selection
    Boyao Wei, Ruixia Liu, Yinglong Wang
  189. FairFBC: Scalable Fair Fuzzy Clustering via Group-Balanced Anchor Graphs
    Tongzheng Zhao, Yan Chen, Peng Wu, Chao Wen, Peng Zhou, Liang Du
  190. Thinking in High-Frequency: Practical Defense for Deepfake Detectors Against Black-box Adversarial Attacks
    Fuqiang Du, Min Yu, Jianguo Jiang, Yixin Zhang, Yachao Liang, Meng Zhang, Weiqing Huang
  191. DocForensic: A VMamba-Wavelet Cross-Attention Network for Document Image Tampering Localization
    Jiaxin Chen, Long Sun, Dengyong Zhang
  192. ForgeryMoE: Mixture of Experts for Image Forgery Detection under JPEG Compression
    Dan Wu, Saihui Hou, Kang Yang, Jian Zhao, Min Ren, Zhaofeng He
  193. Risk-Aware Medical Question Answering as a Reliability-Critical Decision Process
    Yueqin Luo, Yunfan Li
  194. SNOC: Subtle Nested Objective Configuration for Joint Ultra-Low-Light Enhancement and Super-Resolution
    Jiaxin Gao, Yaohua Liu, Danchen Cui, Zhihui Zhao
  195. Benchmarking MLLM-based Web Understanding: Reasoning&#x002C; Robustness and Safety
    Junliang Liu, Jingyu Xiao, Wenxin Tang, Zhixian Wang, Zipeng Xie, Wenxuan Wang, Minrun Zhang, Shuangheng Yu
  196. VFGS-Net: Frequency-Guided State-Space Learning for Topology-Preserving Retinal Vessel Segmentation
    Ruiqi Song, Lei Liu, Ya-Nan Zhang, Chao Wang, Xiaoning Li, Nan Mu
  197. Augmenting medical vision-language pretraining via domain-aware retrieval-augmented caption enrichment
    Xiaoyang Wei, Camille Kurtz, Florence Cloppet
  198. SAND: Semantic-Aware Anomaly Detection with Region-Consistent Memory for Noisy Training
    Kaixi Xu, Yuanyang Zhang, Yilong Liu, Zirui Luo, Yutong He, Li Yao
  199. CoMemRet: Wood Surface Anomaly Detection Based on Multiview Contrastive Learning and Memory Bank Retrieval
    Bangling Wang, Fengqi Hao, Jinqiang Bai, Huijuan Hao, Xiangjun Dong, Dexin Ma, Hoiio Kong
  200. GS&#x00B3;-ICL: Graph-Structured Sparse Selection with Invariance-Consistent Learning for multimodal SER
    Yufan Zhou, Zhiyuan Ma, Lei Wang, Hongrui Ren, Zhuolun Zhong, Shangpeng Wang, Chenyuan Zhang, Haoran Yang
  201. Chameleon: Benchmarking Detection and Backtracking on Commercial-Grade AI-Generated Videos
    Xingming Liao, Meiyu Zeng, Canyu Chen, Nankai Lin, Zhuowei Wang, Aimin Yang
  202. EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence
    Yahui Li, Yinfeng Yu, Liejun Wang, Shengjie Shen
  203. Coupling Frequency-domain Stepwise Enhancement and Statistical Moment Adjustment for Single Image Dehazing
    Xiaowen Chen, Guoqiang Xiao, Michael S. Lew, Song Wu
  204. OpenImplicit: Benchmarking Implicit Reasoning in MLLMs via Open-Ended Evaluation
    Jidong Li, Xiaofei Yin, Ya Guo, Shuheng Zhou, Yi Tu, Haodong Zhao, Sufeng Duan, Gongshen Liu, Huijia Zhu
  205. Decoupling Vocal and Rhythmic Conditioning for Music-Driven Singing Avatar Animation
    Yiguo Jiang, Xiaodong Cun, Chenbin Feng, Jian Sun, Chi-Man Pun
  206. TF-Count: A Training-Free Exemplar-Based Method for Class-Agnostic Cell Counting Using DINOv2
    Xiuze Dong, Maosheng He, Zhao Wang, Zhiqiang Liang, Yifan He
  207. Exploring Potential Knowledge Correlations of Disease Diagnosis with Partial Labels
    Nian Ai, Daizong Liu, Pan Zhou
  208. PhysFlow: Frequency-Selective Flow Matching with Dual-Stream Expert Fusion for Remote Photoplethysmography
    Youchen Luo, Zhaodong Sun, Huiyu Yang, Wenye Geng, Yuwei Chen, Xiaobai Li
  209. Sparse Implicit Connectivity Graphs with Scheduled Emotion History Sampling for Multimodal Emotion Recognition in Conversation
    Feng Li, Wen Luo, Bing Wang, Yongwei Li
  210. MDHL-FND: Multi-Domain Hierarchical LoRA for Fake News Detection
    Linfeng Ke
  211. DapQ-DiT: Distribution-Aware Post-Training Quantization for Efficient Generative Tasks in Diffusion Transformers
    Lianwei Yang, Haokun Lin, Yichen Wu, Zhenan Sun, Qingyi Gu
  212. Multi-Scale Perception and Channel-Gated Fusion Network for Aerial Image Detection
    Jiaxin Chen, Zhixiang Zheng, Pei Yi, Dengyong Zhang, Yuxu Peng, Lei Wang
  213. Synergizing Agentic Data Generation and Efficient Representation Learning for Medical Cross-Modal Understanding
    Lemin Cheng
  214. Anatomic-Decoupling Adaptation: A Unified Framework for Zero/Few-Shot Medical Anomaly Detection
    Zhihuan Lin, Fei Wang, Weihong Cai, Hao Cai
  215. MetaDB: Metadata-Guided Diffusion Bridge Model for High-Fidelity Medical Image Synthesis
    Yanjun Chi, Keqiang Wang, Wei Huang, Wei Xu, Jiaen Liang, Jun Yu
  216. Anime-2026: A Large-scale Anime Character Dataset for Anime-related AI Tasks
    Shijie Xuyang, Bingzhe Yu, Minyi Zhao, Guangze Li, Jihong Guan, Shuigeng Zhou
  217. ImageNetion: Retrieval-as-Policy for Creative Gollin Figure Completion via Generative Feedback
    Dongjin Huang, Yichuan Liu, Jiantao Qu, Qinghang Wu
  218. MMG-RAG: Multimodal Graph RAG for Medical Report Generation
    Gang Liu, Xiaotian Tang, Jiacheng Gan, Tianyu Ren, Tingyao Liu, Shenjun Zhong
  219. DynBrush: Structure-Aware and Style-Adaptive Transfer for Traditional Chinese Landscape Rendering
    Hangshen Nong, Mingyuan Ge, Mingyong Li
  220. ICSGDiff: A Multimodal Structure-Aware Diffusion Network for Restoring Ancient Bamboo Slips
    Youxin Liao, Jiahao Zhang, Guang Long, Yueran Wang, Ying Qi, Chenyang Wang, Qiang Zhang, Shanxiong Chen
  221. TR-GLP: A Two-Stage Framework with Temporal Reprogramming and Residual Graph Label Propagation for Short Video Fake News Detection
    Junjiang Chen, Wenzhong Yang, Yabo Yin, Hongzhen Lv, Fuyuan Wei, Jingfeng He, Zongxu Luo, Junhang Wu
  222. CB-CV: A Cluster-Based Cross-Validation Benchmark for Multimodal Video Out-of-Distribution Detection
    Ji Zhang, Xiao Luo, Hang Zhou
  223. LLM-Guided Secure Federated Visual Prompts with Deep Unfolding for MRI Reconstruction
    Di Xiao, Yuhan Gou, Yu Ren, Shijia Xu, Yue Zhang
  224. ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis
    Aoduo Li, Haoran Lv, Hongjian Xu, Shengmin Li, Sihao Qin, Zimeng Li, Chi Man Pun, Xuhang Chen
  225. Progressive High-Confidence Pseudo-Labeling for Unsupervised Cross-View Image Geo-Localization
    Long Yu, Chunfang Yang, Ma Zhu, Xu Wang, Yang Pei
  226. Explainable Multimodal Modeling with KANs for Urban EV Charging Demand Forecasting
    Yi Zhao, Qianqian Ren, Boyuan Wang, Hui Xu
  227. VietFashion: Benchmarking Sketch&#x002013;Text Composed Image Retrieval for Cultural Outfits
    Hoang-Nguyen Cao, Le-Hoang Bui, Dinh-Khoi Vo, Minh-Triet Tran, Trung-Nghia Le
  228. Multi-Modal 3D Object Detection in Autonomous Driving: A New Survey
    Peng Zhang, Xin Lin
  229. TrackNetV6: A Unified Framework for Lightweight and Robust Fast-Moving Tiny Ball Tracking
    Jizhe Yu, Xiya Bu, Yu Liu, Kaiping Xu, Yifei Cao, Zhizhen Li
  230. ClearNight: Synergistic Dual-Prior Aggregation for Nighttime Image Dehazing
    Yiqiang Zhou, Xindan Gao, Jifeng Guo, Yanfeng Qiao, Yan Chen, Guang Li, Lu Wang
  231. HCG-MPB: Hierarchical Complementary Gating Mechanism with Multimodal Pattern Bank for Hateful Video Detection
    Hongxia Sun, Wenzhong Yang, Yabo Yin, Fuyuan Wei, Junhang Wu, Junjiang Chen
  232. TG-MUNet: A Lightweight Text-Guided Mamba Unet for Semi-Supervised Medical Image Segmentation
    Feng Li, Chen Sun, Bing Wang, Zongyu Xie
  233. Flickr-ABS: A Benchmark for Abstract Intent in Image&#x002013;Text Retrieval
    Tianyuan Li, Lei Wang, Yating Yang, Rui Dong, Ahtamjan Ahmat, Bangju Han, Zhijie Li
  234. DDL-Net: A Task-Balanced Panoptic Perception Network with Channel-Reorganized Attention in Autonomous Driving
    Bowei Fang, Yunyi Tang, Wentao Mu, Wenbo Liu, Fei Yan, Tao Deng
  235. Blazer: Encrypted Video Traffic Identification for Mixed Segment Transmission Pattern based on LLM
    Weitao Tang, Meijie Du, Die Hu, Shu Li, Zhao Li, Rong Yang, Qingyun Liu
  236. Beyond Semantic Understanding: Physics-Informed Adaptation of Video Foundation Models for Precision Industrial Metrology
    Jiahao Chang, Haohua Zhao, Liqing Zhang
  237. Assessing Color Vision Test in Large Vision-language Models
    Hongfei Ye, Bin Chen, Wenxi Liu, Yu Zhang, Zhao Li, Dandan Ni, Hongyang Chen
  238. SPGR: Semantic Purification and Geometric Routing for Fake Short-Video Detection
    Shaojie Hu, Yong Liu, Xiaoguang Zhang
  239. SlimNet: High-Quality and Efficient Object Removal by Eliciting Latent Capabilities of Diffusion Models
    Xiao Ma, Jin Yuan, Yao Zhang, Cheng Zhong, Zhongchao Shi, Jianping Fan, Guihua Zeng
  240. SCORE: Soccer Curriculum for Ordinal Affect Recognition with Evidence
    Xiaofeng Shen, Ze Rong, Haoyang Qin, Binhao Zhao, Yue Xu, Lei Ma
  241. EC-RAG: Evidence-Centric Retrieval-Augmented Generation for Medical Visual Question Answering
    Songming Li, Jun Long
  242. VAV-R1: Difficulty-Aware Multimodal Reasoning for Video Anomaly Validation
    Jiang Liu, Yuhang Liu, Juan Yang, Qianhao Ren, Yutong Wang, Zhongjiang He, Jingmin Xin, Hao Sun
  243. HSAMoE: Hemiparetic-Side-Aware Mixture of Experts for EEG-Based Motor Imagery Classification in Stroke Patients
    Min Feng, Sheng-hua Zhong, Tianhao Gao, Rongrong Lu
  244. Efficient Video Anomaly Detection for Edge Devices via Background Feature Caching
    Zhibo Zhang, Lin Zhao, Wenyan Xing, Di Wang, Chen Gong, Le Zhang
  245. Centripetal-Scale Coupling and Sparsity-Guided Label Assignment for Tiny Object Detection in Steppe Rathole Monitoring
    Lei Xu, Ru Li, Chunyu Zhao, Jiaqiang Zhang
  246. FSGD-Det: Frequency-Spectrum-Guided Dehazing for Aerial Object Detection in Hazy Images
    Min Dang, Gang Liu, Zhaolu Zheng, Luyi Qiu, Zihao Li, Jing Liu
  247. Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach
    Zijian Zhao, Dian Jin, Zijing Zhou
  248. Uncovering Frequency Cues for Robust Event-Based UAV Detection
    Xinyu Li, Wenjun Zhu, Xiaoyu Ji, Wenyuan Xu
  249. TrinitySeg: A Benchmark and Baseline for Monochrome NIR Smoke Segmentation
    Haowen Hua, Zeyi Shao, Shuwei Guo, John See, Zeyd Boukhers, Miho Ohsaki, Kimiaki Shirahama, Cong Yang
  250. Stat-SAM: Learning Global Echo-Intensity Priors as Prompts for SAM in Ultrasound Image Segmentation
    Juan Chen, Yang Wu, Lei Guo, Wenping Ge, Jie Ma
  251. Topology-Guided Feature Integration for Structured Object Detection
    Jiayi Ding, Libo Liu, Ruonan Zhang