Awesome Generative Models
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β all topics
overview
Audio & Speech Processing
loadingβ¦
π€
Ask AI
Awesome Audio & Speech Processing β curated papers, datasets & benchmarks Β· Awesome Generative Models
β all topics
overview
Audio & Speech Processing
14 papers tagged Audio & Speech Processing β re-sort below
Papers
π₯ Trending (default)
π Most cited
π Newest first
π€ A β Z by title
14 papers Β· trending (default)
numbers = π₯ heat
Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition
(2026)
Xugang Lu et al.
4.39
AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning
(2026)
Benjamin Robson et al.
4.39
Segmental DTW: A Parallelizable Alternative to Dynamic Time Warping
(2026)
TJ Tsai
4.39
A Geometry-Limited Identification Floor and Its Consequences for Voice-Clone Attribution in Professional Voice Actors
(2026)
Shuhei Kato
4.39
AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis
(2026)
Zhenqi Jia et al.
4.39
Nonlinear Bias-Compensated Adaptive Filter and Its Application for Time-Series Prediction
(2026)
Yi Peng et al.
4.39
Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering
(2026)
Junyu Dai et al.
4.39
Local Multimodal Music Alignment from Global Supervision
(2026)
Irmak Bukey et al.
2.00
Probing Speaker Identity Sensitivity in Audio Deepfake Detectors
(2026)
Daniyal Kabir Dar et al.
2.00
CODA: Cascaded Online Discontinuity-Aware Alignment for Real-Time Image-Based Score Following
(2026)
Yining Yang et al.
2.00
MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond
(2026)
Lorenzo Concina et al.
2.00
IQ-JEPA: A Joint-Embedding Predictive Architecture with a Hermitian Vision Transformer for Sound Speed and Attenuation Estimation from Ultrasound IQ Data
(2026)
Masashi Sode et al.
2.00
Novel Phase-Noise-Tolerant Variational-Autoencoder-Based Equalization Suitable for Space-Division-Multiplexed Transmission
(2025)
Vincent Lauinger et al.
1.44
Contrastive Speaker Embedding With Sequential Disentanglement
(2023)
Youzhi Tu et al.
β