← all datasets

CoVoST

Emerging
3papers using it
2022first seen

CoVoST 2, a large-scale multilingual speech translation corpus covering translations from 21 languages into English and from English into 15 languages. The dataset is created using Mozilla’s open source Common Voice database of crowdsourced voice recordings. Note that in order to limit the required storage for preparin

Papers using CoVoST (3)

CoVoST dataset — papers, benchmarks & downloads · Speech Audio