AMI
Emerging43papers using it
2021first seen
The AMI Meeting Corpus consists of 100 hours of meeting recordings. The recordings use a range of signals synchronized to a common timeline. These include close-talking and far-field microphones, individual and room-view video cameras, and output from a slide projector and an electronic whiteboard. During the meetings,
Papers using AMI (43)
- Scaling Multi-Talker ASR with Speaker-Agnostic Activity StreamsSoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech TranscriptionFast and Robust On-Device Speaker Diarization: Relative Minimum Cluster Size for Stride-Accelerated PipelinesNon-Autoregressive Minimum Bayes' Risk Decoding for Fast Speech RecognitionGrounding Spoken LLMs in Multi-Speaker Audio via Diarization ConditioningTeaching the Teachers: Boosting unsupervised domain adaptation in speech recognition by ensemble updateBiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech RecognitionTowards Robust Overlapping Speech Detection: A Speaker-Aware Progressive Approach Using WavLMA Differentiable Alignment Framework for Sequence-to-Sequence Modeling via Optimal TransportAdapting GPT, GPT-2 and BERT Language Models for Speech RecognitionInjecting Text in Self-Supervised Speech PretrainingSupervised Hierarchical Clustering using Graph Neural Networks for
Speaker DiarizationAdvancing Multi-talker ASR Performance with Large Language ModelsGPU-accelerated Guided Source Separation for Meeting TranscriptionTranscribe-to-Diarize: Neural Speaker Diarization for Unlimited Number
of Speakers using End-to-End Speaker-Attributed ASRFAST-RIR: Fast neural diffuse room impulse response generatorMulti-Variant Consistency based Self-supervised Learning for Robust
Automatic Speech RecognitionConcurrent Speaker Detection: A multi-microphone Transformer-Based
ApproachAdapting self-supervised models to multi-talker speech recognition using
speaker embeddingsProgressive unsupervised domain adaptation for ASR using ensemble models
and multi-stage trainingAsk2Mask: Guided Data Selection for Masked Speech ModelingAdapting Multi-Lingual ASR Models for Handling Multiple TalkersSURT 2.0: Advances in Transducer-based Multi-talker Speech RecognitionEnd-to-end Multichannel Speaker-Attributed ASR: Speaker Guided Decoder
and Input Feature AnalysisXLSR-Transducer: Streaming ASR for Self-Supervised Pretrained ModelsSelf-Supervised Metric Learning With Graph Clustering For Speaker
DiarizationAll-neural beamformer for continuous speech separationEffective Cross-Utterance Language Modeling for Conversational Speech
RecognitionSpeech-enhanced and Noise-aware Networks for Robust Speech RecognitionCycleGAN-Based Unpaired Speech DereverberationTree-constrained Pointer Generator with Graph Neural Network Encodings
for Contextual Speech RecognitionESSumm: Extractive Speech Summarization from Untranscribed MeetingG-Augment: Searching for the Meta-Structure of Data Augmentation
Policies for ASRSpectral Clustering-aware Learning of Embeddings for Speaker DiarisationMultitask Detection of Speaker Changes, Overlapping Speech and Voice
Activity Using wav2vec 2.0Speech separation with large-scale self-supervised learningLeveraging Cross-Utterance Context For ASR DecodingEnd-to-End Supervised Hierarchical Graph Clustering for Speaker
DiarizationOn Speaker Attribution with SURTSpeaker Embeddings With Weakly Supervised Voice Activity Detection For
Efficient Speaker DiarizationLS-EEND: Long-Form Streaming End-to-End Neural Diarization with Online Attractor ExtractionImproving Automatic Speech Recognition with Decoder-Centric
Regularisation in Encoder-Decoder ModelsOnline speaker diarization of meetings guided by speech separation