Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Cheng Lu — most-cited papers & profile · Multimodal
← authors
·
overview
Cheng Lu
20
papers ·
91
citations ·
0
h-index
Ministry of Education · Southern Medical University · Southeast University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Speech Emotion Recognition via an Attentive Time-Frequency Neural Network
2022 · 44 citations
VFlow: More Expressive Generative Flows with Variational Data Augmentation
2020 · 14 citations
PAVITS: Exploring Prosody-aware VITS for End-to-End Emotional Voice Conversion
2024 · 11 citations
Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling
2022 · 6 citations
Discriminative Multi-modality Speech Recognition
2020 · 3 citations
Contrastive Energy Prediction for Exact Energy-Guided Diffusion Sampling in Offline Reinforcement Learning
2023 · 3 citations
Learning to Detect Head Movement in Unconstrained Remote Gaze Estimation in the Wild
2020 · 2 citations
On Calibrating Diffusion Probabilistic Models
2023 · 2 citations
Score Regularized Policy Optimization through Diffusion Behavior
2023 · 2 citations
Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models
2024 · 1 citations
Deep Two-Stream Video Inference for Human Body Pose and Shape Estimation
2021 · 1 citations
Improving Speaker-independent Speech Emotion Recognition Using Dynamic Joint Distribution Adaptation
2024 · 1 citations
Speech Swin-Transformer: Exploring a Hierarchical Transformer with Shifted Windows for Speech Emotion Recognition
2024 · 1 citations
GIP-RAG: An Evidence-Grounded Retrieval-Augmented Framework for Interpretable Gene Interaction and Pathway Impact Analysis
2026
NavigScene: Bridging Local Perception and Global Navigation for Beyond-Visual-Range Autonomous Driving
2025
Topics
Speech Recognition
Audio Understanding
3D Vision
Training & Sampling
Offline RL
Model-Based RL
Text-to-Speech
Diffusion Models
Image Restoration
Tracking