Awesome Speech Audio
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Xize Cheng — most-cited papers & profile · Speech Audio
← authors
·
overview
Xize Cheng
15
papers ·
10
citations ·
8
h-index
Zhejiang University of Science and Technology · Zhejiang University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model
2025 · 4 citations
Wav2SQL: Direct Generalizable Speech-To-SQL Parsing
2023 · 1 citations
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
2024 · 1 citations
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
2025
AV-TranSpeech: Audio-Visual Robust Speech-to-Speech Translation
2023
OpenSR: Open-Modality Speech Recognition via Maintaining Multi-Modality Alignment
2023
TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation
2023
Text-to-Song: Towards Controllable Music Generation Incorporating Vocals and Accompaniment
2024
ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
2024
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
2024
Top co-authors
Zhou Zhao
· 10
Rongjie Huang
· 6
Jialong Zuo
· 4
Shengpeng Ji
· 4
Huadai Liu
· 3
Xinyu Duan
· 3
Zehan Wang
· 3
Jinzheng He
· 2
Qian Chen
· 2
Qian Yang
· 2
Tao Jin
· 2
Wen Wang
· 2
Topics
Audio Generation
Multimodal Audio
Text-to-Speech
Voice Cloning
Speech Recognition
Audio Understanding
Speech Translation
Music Generation
Speaker Analysis
Speech Enhancement