MiniF-2F
Emerging5papers using it
2024first seen
The 'MiniF-2F' dataset/benchmark is used to evaluate the performance of Large Language Models (LLMs) in automated theorem proving tasks.
Papers using MiniF-2F (5)
- Leanabell-Prover-V2: Verifier-integrated Reasoning for Formal Theorem Proving via Reinforcement LearningGoedel-Prover-V2: Scaling Formal Theorem Proving with Scaffolded Data Synthesis and Self-CorrectionScaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-ProversKimina-Prover Preview: Towards Large Formal Reasoning Models with
Reinforcement LearningDeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for
Reinforcement Learning and Monte-Carlo Tree Search