Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Shuang Xu — most-cited papers & profile · Multimodal
← authors
·
overview
Shuang Xu
12
papers ·
149
citations ·
33
h-index
Xidian University · Northwestern Polytechnical University · Southwest Jiaotong University · Dalian Minzu University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Multilingual End-to-End Speech Recognition with A Single Transformer on Low-Resource Languages
2018 · 62 citations
Syllable-Based Sequence-to-Sequence Speech Recognition with the Transformer in Mandarin Chinese
2018 · 28 citations
A Comparison of Label-Synchronous and Frame-Synchronous End-to-End Models for Speech Recognition
2020 · 16 citations
"Listen, Understand and Translate": Triple Supervision Decouples End-to-end Speech-to-text Translation
2020 · 13 citations
Consecutive Decoding for Speech-to-text Translation
2020 · 13 citations
A Comparison of Modeling Units in Sequence-to-Sequence Speech Recognition with the Transformer on Mandarin Chinese
2018 · 12 citations
MFIF-GAN: A New Generative Adversarial Network for Multi-Focus Image Fusion
2020 · 4 citations
Single-channel Speech Dereverberation via Generative Adversarial Training
2018 · 1 citations
MrCoM: A Meta-Regularized World-Model Generalizing Across Multi-Scenarios
2025
Seedream 4.0: Toward Next-generation Multimodal Image Generation
2025
Improving Cross-Modal Understanding in Visual Dialog via Contrastive Learning
2022
Knowledge Transfer from Pre-trained Language Models to Cif-based Speech Recognizers via Hierarchical Distillation
2023
Topics
Speech Recognition
Speech Translation
Text-to-Speech
cs.LG
cs.AI
Vision-Language
Model Architecture
Training Techniques
Efficiency
Speech Enhancement