Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Jianlong Fu — most-cited papers & profile · Multimodal
← authors
·
overview
Jianlong Fu
23
papers ·
605
citations ·
48
h-index
Microsoft Research Asia (China)
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers
2020 · 286 citations
CLIP-ViP: Adapting Pre-trained Image-Text Model to Video-Language Representation Alignment
2022 · 53 citations
Long-Form Video-Language Pre-Training with Multimodal Temporal Contrastive Learning
2022 · 33 citations
Seeing Out of tHe bOx: End-to-End Pre-training for Vision-Language Representation Learning
2021 · 25 citations
Unified Multi-Modal Latent Diffusion for Joint Subject and Text Conditional Image Generation
2023 · 17 citations
Probing Inter-modality: Visual Parsing with Self-Attention for Vision-Language Pre-training
2021 · 9 citations
SINC: Self-Supervised In-Context Learning for Vision-Language Tasks
2023 · 1 citations
Top co-authors
Bei Liu
· 5
Dongmei Fu
· 2
Hongwei Xue
· 2
Houqiang Li
· 2
Jiebo Luo
· 2
Ruihua Song
· 2
Yuchong Sun
· 2
Yupan Huang
· 2
Zhaoyang Zeng
· 2
Zhicheng Huang
· 2
Bei Liu
· 1
Cheng Yu Yeo
· 1
Topics
Vision-Language Models
Image-Text Retrieval
Video-Language
Visual QA & Reasoning
Benchmarks