LibriMix
Emerging28papers using it
2022first seen
LibriMix is a dataset that contains mixed speech recordings of multiple talkers and is used to evaluate multi-talker automatic speech recognition (MT-ASR) systems.
Papers using LibriMix (28)
- Unifying Diarization, Separation, and ASR with Multi-Speaker EncoderSerialized Output Prompting for Large Language Model-based Multi-Talker Speech RecognitionDistilling LLM Semantic Priors into Encoder-Only Multi-Talker ASR with Talker-Count RoutingSLM-SS: Speech Language Model for Generative Speech SeparationAdapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech RecognitionCMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language ModelsAn Investigation on Speaker Augmentation for End-to-End Speaker ExtractionUniversal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity DetectionA Sidecar Separator Can Convert a Single-Talker Speech Recognition
System to a Multi-Talker OneAdvancing Multi-talker ASR Performance with Large Language ModelsListen only to me! How well can target speech extraction handle false
alarms?Exploring Self-Attention Mechanisms for Speech SeparationEEND-SS: Joint End-to-End Neural Speaker Diarization and Speech
Separation for Flexible Number of SpeakersNoise-Aware Speech Separation with Contrastive LearningUnified Modeling of Multi-Talker Overlapped Speech Recognition and
Diarization with a Sidecar SeparatorEEND-DEMUX: End-to-End Neural Speaker Diarization via Demultiplexed
Speaker EmbeddingsUSEF-TSE: Universal Speaker Embedding Free Target Speaker ExtractionMixCycle: Unsupervised Speech Separation via Cyclic Mixture Permutation
Invariant TrainingIndividualized Conditioning and Negative Distances for Speaker
SeparationMonaural Multi-Speaker Speech Separation Using Efficient Transformer ModelUSED: Universal Speaker Extraction and DiarizationSelective HuBERT: Self-Supervised Pre-Training for Target Speaker in
Clean and Mixture SpeechTarget Speech Extraction with Pre-trained Self-supervised Learning
ModelsSerialized Output Training by Learned DominanceEmpowering Whisper as a Joint Multi-Talker and Target-Talker Speech
Recognition SystemSerialized Speech Information Guidance with Overlapped Encoding
Separation for Multi-Speaker Automatic Speech RecognitionHypothesis Clustering and Merging: Novel MultiTalker Speech Recognition
with Speaker TokensMultiple Choice Learning for Efficient Speech Separation with Many
Speakers