LibrispeechMix
Emerging13papers using it
2021first seen
LibriSpeechMix is a dataset used to evaluate multi-speaker automatic speech recognition (ASR) by simulating overlapping conversations in English.
Papers using LibrispeechMix (13)
- H-SAGE: Holistic Speaker-Aware Guided Experts for MoE-based Multi-Talker ASRGrounding Spoken LLMs in Multi-Speaker Audio via Diarization ConditioningCALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASRGLAD: Global-Local Aware Dynamic Mixture-of-Experts for Multi-Talker ASRA Sidecar Separator Can Convert a Single-Talker Speech Recognition
System to a Multi-Talker OneSA-SOT: Speaker-Aware Serialized Output Training for Multi-Talker ASRCross-Speaker Encoding Network for Multi-Talker Speech RecognitionUnified Modeling of Multi-Talker Overlapped Speech Recognition and
Diarization with a Sidecar SeparatorMulti-turn RNN-T for streaming recognition of multi-party speechStreaming Speaker-Attributed ASR with Token-Level Speaker EmbeddingsSelf-supervised learning with bi-label masked speech prediction for
streaming multi-talker speech recognitionEmpowering Whisper as a Joint Multi-Talker and Target-Talker Speech
Recognition SystemStreaming Multi-Talker ASR with Token-Level Serialized Output Training