AudioCaps
Emerging19papers using it
2022first seen
audiocaps HuggingFace mirror of official data repo.
Papers using AudioCaps (19)
- GLAP: General contrastive audio-text pretraining across domains and languagesFORTE: FOL-guided Optimal Refinement for Text-audio rEtrievalFast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation DistillationWavFlow: Audio Generation in Waveform SpaceSemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic LatentsAudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio GenerationSAM: A Mamba-2 State-Space Audio-Language ModelIMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion ModelingAudioTurbo: Fast Text-to-Audio Generation with Rectified DiffusionAudioLDM: Text-to-Audio Generation with Latent Diffusion ModelsText-to-Audio Generation using Instruction-Tuned LLM and Latent
Diffusion ModelAudiobox: Unified Audio Generation with Natural Language PromptsJoint Speech Recognition and Audio CaptioningRetrieval-Augmented Text-to-Audio GenerationConsistencyTTA: Accelerating Diffusion-Based Text-to-Audio Generation
with Consistency DistillationVoiceLDM: Text-to-Speech with Environmental ContextBalanced SNR-Aware Distillation for Guided Text-to-Audio GenerationEnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for
Automated Audio CaptioningLanguage-based Audio Retrieval with Co-Attention Networks