Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Le Zhuo — most-cited papers & profile · Multimodal
← authors
·
overview
Le Zhuo
5
papers ·
13
citations ·
4
h-index
Chinese University of Hong Kong · Shanghai Artificial Intelligence Laboratory
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
2023 · 3 citations
TIDE : Temporal-Aware Sparse Autoencoders for Interpretable Diffusion Transformers in Image Generation
2025
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
2024
Topics
Diffusion Models
Audio Generation
3D & NeRF Generation
Conditioning & Control
Speech Recognition
Audio Understanding
Multimodal Audio
Model Architecture
Efficiency
Training Techniques