MuAViC
Emerging4papers using it
2023first seen
MuAViC is an audio-visual speech recognition dataset that contains multilingual video data in 9 languages and is used to evaluate the performance of models in noisy conditions.
Papers using MuAViC (4)
- mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech
RecognitionMuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition
and Robust Speech-to-Text TranslationXLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for
Noise-Robust Speech PerceptionMultilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast
Conformer