Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Tiantian Geng — most-cited papers & profile · Multimodal
← authors
·
overview
Tiantian Geng
4
papers ·
0
citations
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models
2026
\textscNaVIDA: Vision-Language Navigation with Inverse Dynamics Augmentation
2026
R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios
2025
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
2024
Top co-authors
Feng Zheng
· 3
Teng Wang
· 3
Cui Yakun
· 1
Hewei Pan
· 1
Jinming Duan
· 1
Jinrui Zhang
· 1
Lu Zhu
· 1
Ping Lu
· 1
Qingni Wang
· 1
Rongtao Xu
· 1
Sirui Han
· 1
Weiye Zhu
· 1
Topics
Video-Language
Vision-Language Models
Benchmarks
Visual QA & Reasoning
Audio-Visual
Embodied & Agents