Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Roy Miles — most-cited papers & profile · Multimodal
← authors
·
overview
Roy Miles
7
papers ·
1
citations
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering
2026
Satground: A Spatially-aware Approach For Visual Grounding In Remote Sensing
2025
Retouchllm: Training-free Code-based Image Retouching With Vision Language Models
2025
ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs
2024
Top co-authors
Ismail Elezi
· 2
Jiankang Deng
· 2
Kaicheng Yang
· 1
Peirou Liang
· 1
Tae-Hyun Oh
· 1
Xiang An
· 1
Yin Xie
· 1
Yongle Zhao
· 1
Yumeng Wang
· 1
Ziyong Feng
· 1
Topics
Visual QA & Reasoning
Benchmarks
Vision-Language Models
Video-Language
Instruction Tuning