Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Zhou Yu — most-cited papers & profile · Multimodal
← authors
·
overview
Zhou Yu
48
papers ·
445
citations ·
34
h-index
Columbia University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Multi-modal Factorized Bilinear Pooling with Co-Attention Learning for Visual Question Answering
2017 · 102 citations
Deep Modular Co-Attention Networks for Visual Question Answering
2019 · 99 citations
Multimodal Unified Attention Networks for Vision-and-Language Interactions
2019 · 34 citations
Multimodal Transformer with Multi-View Visual Representation for Image Captioning
2019 · 30 citations
Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models
2025 · 17 citations
UC2: Universal Cross-lingual Cross-modal Vision-and-Language Pre-training
2021 · 7 citations
Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering
2023 · 6 citations
ROSITA: Enhancing Vision-and-Language Semantic Alignments via Cross- and Intra-modal Knowledge Integration
2021 · 4 citations
Unsupervised Vision-and-Language Pre-training via Retrieval-based Multi-Granular Alignment
2022 · 1 citations
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
2026
HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos
2026
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
2025
Beyond Bilinear: Generalized Multimodal Factorized High-order Pooling for Visual Question Answering
2017
Parameter-Efficient Transfer Learning for Audio-Visual-Language Tasks
2023
Top co-authors
Jun Yu
· 8
Dacheng Tao
· 4
Zhenwei Shao
· 3
Jianping Fan
· 2
Meng Wang
· 2
Minghao Chen
· 2
Mingyang Zhou
· 2
Qi Tian
· 2
Yan Yang
· 2
Amanpreet Singh
· 1
Hongyuan Zhang
· 1
Jiajun Ding
· 1
Topics
Vision-Language Models
Visual QA & Reasoning
Video-Language
Benchmarks
Image-Text Retrieval
Audio-Visual
Embodied & Agents