MMSU
Emerging7papers using it
2025first seen
[ICLR 2026] MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark Overview of MMSU MMSU (Massive Multi-task Spoken Language Understanding and Reasoning Benchmark) is a comprehensive benchmark for evaluating fine-grained spoken language understanding and reasoning in multimodal models. It syst
Papers using MMSU (7)
- DIFFA-2: A Practical Diffusion Large Language Model for General Audio UnderstandingALARM: Audio-Language Alignment for Reasoning ModelsClosing the Modality Reasoning Gap for Speech Large Language ModelsMiMo-Audio: Audio Language Models are Few-Shot LearnersTASU: Text-Only Alignment for Speech UnderstandingAQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement LearningDIFFA: Large Language Diffusion Models Can Listen and Understand