Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Siliang Tang — most-cited papers & profile · Multimodal
← authors
·
overview
Siliang Tang
23
papers ·
121
citations ·
29
h-index
Zhejiang University of Science and Technology · Zhejiang University of Technology · Zhejiang University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Fine-Grained Semantically Aligned Vision-Language Pre-Training
2022 · 29 citations
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
2023 · 11 citations
Gradient-Regulated Meta-Prompt Learning for Generalizable Vision-Language Models
2023 · 7 citations
HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation
2025 · 6 citations
BOSS: Bottom-up Cross-modal Semantic Composition with Hybrid Counterfactual Training for Robust Content-based Image Retrieval
2022 · 5 citations
Continual Vision-Language Representation Learning with Off-Diagonal Information
2023 · 2 citations
Unified Generative and Discriminative Training for Multi-modal Large Language Models
2024 · 2 citations
Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
2025
Auto-Encoding Morph-Tokens for Multimodal LLM
2024
Top co-authors
Yueting Zhuang
· 7
Juncheng Li
· 5
Kaihang Pan
· 4
Wenqiao Zhang
· 4
Hanwang Zhang
· 3
Longhui Wei
· 3
Mengze Li
· 3
Qi Tian
· 3
Tat-Seng Chua
· 3
Jun Xiao
· 2
Minghe Gao
· 2
Zhiqi Ge
· 2
Topics
Vision-Language Models
Video-Language
Visual QA & Reasoning
Image-Text Retrieval
cs.CV
Audio-Visual
Instruction Tuning
cs.MM