MBPP
Emerging15papers using it
2024first seen
Dataset Card for Mostly Basic Python Problems (mbpp) Dataset Summary The benchmark consists of around 1,000 crowd-sourced Python programming problems, designed to be solvable by entry level programmers, covering programming fundamentals, standard library functionality, and so on. Each problem consists of a task descrip
Papers using MBPP (15)
- SePO: Self-Evolving Prompt Agent for System Prompt OptimizationEvoagentx: An Automated Framework For Evolving Agentic WorkflowsAutoResearch: An Execution-Grounded Multi-Agent Framework for Reliable Research Workflow AutomationPoison with Style: A Practical Poisoning Attack on Code Large Language ModelsSLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory SlicingWho Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM AgentsTDPGen: Optimizing Agentic Code Generation via Test-Driven Planning and Hierarchical ReActACE: Self-Evolving LLM Coding Framework via Adversarial Unit Test Generation and Preference OptimizationThink Anywhere in Code GenerationGuided Collaboration in Heterogeneous LLM-Based Multi-Agent Systems via Entropy-Based Understanding Assessment and Experience RetrievalAdaptive Confidence Gating In Multi-agent Collaboration For Efficient And Optimized Code GenerationFrom Implicit Exploration to Structured Reasoning: Leveraging Guideline and Refinement for LLMsQ*: Improving Multi-step Reasoning for LLMs with Deliberative PlanningDivide-and-Conquer Meets Consensus: Unleashing the Power of Functions in Code GenerationFALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system