Awesome Large Language Models
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Yaowei Wang — most-cited papers & profile · Large Language Models
← authors
·
overview
Yaowei Wang
30
papers ·
158
citations ·
48
h-index
Shenzhen Institute of Information Technology · Henan University of Science and Technology · Harbin Institute of Technology · Peng Cheng Laboratory
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Fine-Grained Object Classification via Self-Supervised Pose Alignment
2022 · 95 citations
Boosting Crowd Counting via Multifaceted Attention
2022 · 14 citations
Conformer: Local Features Coupling Global Representations for Visual Recognition
2021 · 12 citations
DilateFormer: Multi-Scale Dilated Transformer for Visual Recognition
2023 · 12 citations
Motion-aware Latent Diffusion Models for Video Frame Interpolation
2024 · 8 citations
Learning to Share in Multi-Agent Reinforcement Learning
2021 · 6 citations
CiteTracker: Correlating Image and Text for Visual Tracking
2023 · 5 citations
SgVA-CLIP: Semantic-guided Visual Adapting of Vision-Language Models for Few-shot Image Classification
2022 · 4 citations
LSVOS Challenge Report: Large-scale Complex and Long Video Object Segmentation
2024 · 1 citations
Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation
2026
A Step Toward Federated Pretraining of Multimodal Large Language Models
2026
MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages
2025
Spatial Understanding from Videos: Structured Prompts Meet Simulation Data
2025
Optimus-3: Dual-Router Aligned Mixture-of-Experts Agent with Dual-Granularity Reasoning-Aware Policy Optimization
2025
CAI: Caption-Sensitive Attention Intervention for Mitigating Object Hallucination in Large Vision-Language Models
2025
Topics
Object Detection
Tracking
Segmentation
Video Understanding
Visual Language
Diffusion Models
Conditioning & Control
Image Generation
Navigation
cs.LG