AudioCaps
Emerging15papers using it
2021first seen
Papers using AudioCaps (15)
- FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precisione5-omni: Explicit Cross-modal Alignment for Omni-modal EmbeddingsLAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz DivergenceDiffGAP: A Lightweight Diffusion Module in Contrastive Space for
Bridging Cross-Model GapFORTE: FOL-guided Optimal Refinement for Text-audio rEtrievalAC/DC: LLM-based Audio Comprehension via Dialogue ContinuationTraining-free Multimodal Guidance For Video To Audio GenerationMitigating Audiovisual Mismatch In Visual-guide Audio CaptioningONE-PEACE: Exploring One General Representation Model Toward Unlimited
ModalitiesText-to-Audio Grounding: Building Correspondence Between Captions and
Sound EventsAccommodating Audio Modality in CLIP for Multimodal ProcessingAudio-Visual LLM for Video UnderstandingZero-Shot Audio Captioning Using Soft and Hard PromptsMINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley
Audio Content Planning and GenerationEnhancing Audio-Language Models through Self-Supervised Post-Training
with Text-Audio Pairs