Awesome Speech Audio
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Yu Pan — most-cited papers & profile · Speech Audio
← authors
·
overview
Yu Pan
34
papers ·
13
citations ·
11
h-index
Open University of China · Zhejiang University · Zhejiang University of Finance and Economics · Shanxi Normal University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
PSCodec: A Series of High-Fidelity Low-bitrate Neural Speech Codecs Leveraging Prompt Encoders
2024 · 2 citations
ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech
2025 · 1 citations
PromptVC: Flexible Stylistic Voice Conversion in Latent Space Driven by Natural Language Prompts
2023 · 1 citations
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
2024 · 1 citations
From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation
2026
JAL-Turn: Joint Acoustic-Linguistic Modeling for Real-Time and Robust Turn-Taking Detection in Full-Duplex Spoken Dialogue Systems
2026
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
2025
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
2025
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
2024
Fast query-by-example speech search using separable model
2021
LMEC: Learnable Multiplicative Absolute Position Embedding Based Conformer for Speech Recognition
2022
HYBRIDFORMER: improving SqueezeFormer with hybrid attention and NSR mechanism
2023
GEmo-CLAP: Gender-Attribute-Enhanced Contrastive Language-Audio Pretraining for Accurate Speech Emotion Recognition
2023
GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition
2024
Takin: A Cohort of Superior Quality Zero-shot Speech Generation Models
2024
Top co-authors
Lei Ma
· 9
Jianjun Zhao
· 8
Hongbin Zhou
· 7
Lei Xie
· 4
Xiang Zhang
· 3
Yuan Feng
· 2
Bin Lin
· 1
Chen Wang
· 1
Liang Zhang
· 1
Shi Qiu
· 1
Sijing Chen
· 1
Wen Fei
· 1
Topics
Audio Generation
Speech Recognition
Voice Cloning
Text-to-Speech
Speech Enhancement
Speech Translation
Audio Understanding
Speaker Analysis
Multimodal Audio
cs.CL