Awesome Speech Audio
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Haohan Guo — most-cited papers & profile · Speech Audio
← authors
·
overview
Haohan Guo
18
papers ·
71
citations ·
10
h-index
Chinese University of Hong Kong
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data
2024 · 23 citations
Feature reinforcement with word embedding and parsing information in neural TTS
2019 · 13 citations
Phonetic Posteriorgrams based Many-to-Many Singing Voice Conversion via Adversarial Training
2020 · 10 citations
A Multi-Scale Time-Frequency Spectrogram Discriminator for GAN-based Non-Autoregressive TTS
2022 · 8 citations
Conversational End-to-End TTS for Voice Agent
2020 · 5 citations
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
2024 · 4 citations
Exploiting Syntactic Features in a Parsed Tree to Improve End-to-End TTS
2019 · 2 citations
Towards High-Quality Neural TTS for Low-Resource Languages by Learning Compact Speech Representations
2022 · 2 citations
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
2024 · 2 citations
ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
2025
Improving Adversarial Waveform Generation based Singing Voice Conversion with Harmonic Signals
2022
A Multi-Stage Multi-Codebook VQ-VAE Approach to High-Performance Neural TTS
2022
QS-TTS: Towards Semi-Supervised Text-to-Speech Synthesis via Vector-Quantized Self-Supervised Speech Representation Learning
2023
Addressing Index Collapse of Large-Codebook Speech Tokenizer with Dual-Decoding Product-Quantized Variational Auto-Encoder
2024
Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation
2024
Top co-authors
Helen Meng
· 10
Xixin Wu
· 10
Fenglong Xie
· 6
Dongchao Yang
· 4
Frank K. Soong
· 4
Lei He
· 3
Jiawen Kang
· 2
Lei Xie
· 2
Lei Xie
· 2
Adam Michalski
· 1
Alexis Moinet
· 1
\'Alvaro Mart\'in-Cortinas
· 1
Topics
Audio Generation
Text-to-Speech
Speech Enhancement
Music Generation
Speech Recognition
Audio Understanding
Voice Cloning
Speech Translation
Multimodal Audio