WeMath
Emerging5papers using it
12HF downloads
0HF likes
2025first seen
The 'WeMath' dataset/benchmark is used to evaluate the reasoning capabilities of Multimodal Large Language Models (MLLMs) in complex textual tasks.
Papers using WeMath (5)
- First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-TrainingGeoSym127K: Scalable Symbolically-verifiable Synthesis for Multimodal Geometric ReasoningAdvancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement LearningAthena: Enhancing Multimodal Reasoning with Data-efficient Process Reward ModelsAdvancing Multimodal Reasoning via Reinforcement Learning with Cold Start