Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Dacheng Tao — most-cited papers & profile · Multimodal
← authors
·
overview
Dacheng Tao
161
papers ·
1133
citations ·
155
h-index
The University of Sydney · Nanyang Technological University · UNSW Sydney
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Multi-modal Factorized Bilinear Pooling with Co-Attention Learning for Visual Question Answering
2017 · 102 citations
Deep Modular Co-Attention Networks for Visual Question Answering
2019 · 99 citations
Multimodal Unified Attention Networks for Vision-and-Language Interactions
2019 · 34 citations
Unified Discrete Diffusion for Simultaneous Vision-Language Generation
2022 · 8 citations
CLAMP: Prompt-based Contrastive Learning for Connecting Language and Animal Pose
2022 · 3 citations
ESceme: Vision-and-Language Navigation with Episodic Scene Memory
2023 · 1 citations
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
2024 · 1 citations
From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering
2025
Review Of Hallucination Understanding In Large Language And Vision Models
2025
Adavideorag: Omni-contextual Adaptive Retrieval-augmented Efficient Long Video Understanding
2025
Optmerge: Unifying Multimodal LLM Capabilities And Modalities Via Model Merging
2025
Dynamic Contrastive Distillation for Image-Text Retrieval
2022
Cross-Modal Contrastive Learning for Robust Reasoning in VQA
2022
Top co-authors
Chaoyue Wang
· 3
Zhou Yu
· 3
Dadong Wang
· 2
Daqing Liu
· 2
Jing Zhang
· 2
Jun Yu
· 2
Qi Tian
· 2
Yuhao Cui
· 2
Aishan Liu
· 1
Baohang Zhou
· 1
Chuanxia Zheng
· 1
Chun Yuan
· 1
Topics
Vision-Language Models
Visual QA & Reasoning
Video-Language
Image-Text Retrieval
Benchmarks
Audio-Visual
Embodied & Agents