VoxConverse
Emerging9papers using it
2022first seen
Dataset Card for the Voxconverse dataset VoxConverse is an audio-visual diarisation dataset consisting of multispeaker clips of human speech, extracted from YouTube videos. Updates and additional information about the dataset can be found on the dataset website. Note: This dataset has been preprocessed using diarizers.
Papers using VoxConverse (9)
- Whisper Speaker Identification: Leveraging Pre-Trained Multilingual
Transformers for Robust Speaker EmbeddingsFast and Robust On-Device Speaker Diarization: Relative Minimum Cluster Size for Stride-Accelerated PipelinesSupervised Hierarchical Clustering using Graph Neural Networks for
Speaker DiarizationTarget-Speaker Voice Activity Detection via Sequence-to-Sequence
PredictionTarget Speaker Voice Activity Detection with Transformers and Its
Integration with End-to-End Neural DiarizationMulti-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker DiarizationProfile-Error-Tolerant Target-Speaker Voice Activity DetectionEnd-to-End Supervised Hierarchical Graph Clustering for Speaker
DiarizationSpeaker Embeddings With Weakly Supervised Voice Activity Detection For
Efficient Speaker Diarization