Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Yaowei Wang — most-cited papers & profile · Multimodal
← authors
·
overview
Yaowei Wang
46
papers ·
162
citations ·
48
h-index
Shenzhen Institute of Information Technology · Henan University of Science and Technology · Harbin Institute of Technology · Peng Cheng Laboratory
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
SgVA-CLIP: Semantic-guided Visual Adapting of Vision-Language Models for Few-shot Image Classification
2022 · 4 citations
Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking
2026
TGV-KV: Text-Grounded KV Eviction for Vision-Language Models
2026
CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering
2026
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
2026
From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
2026
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
2026
CLIP-Guided Adaptable Self-Supervised Learning for Human-Centric Visual Tasks
2026
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
2025
CAI: Caption-Sensitive Attention Intervention for Mitigating Object Hallucination in Large Vision-Language Models
2025
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
2024
CATCH: Complementary Adaptive Token-level Contrastive Decoding to Mitigate Hallucinations in LVLMs
2024
Top co-authors
Baohang Li
· 2
Bin Chen
· 2
Bing Qin
· 2
Changsheng Xu
· 2
Fang Peng
· 2
Jinpeng Wang
· 2
Kui Jiang
· 2
Libo Qin
· 2
Linhui Xiao
· 2
Qiming Li
· 2
Ruihan Chen
· 2
Shu-Tao Xia
· 2
Topics
Vision-Language Models
Video-Language
Benchmarks
Visual QA & Reasoning
Audio-Visual
Image-Text Retrieval
Embodied & Agents