HumanEval
Emerging20papers using it
3,986HF downloads
96HF likes
2024first seen
HumanEval-X is a benchmark for the evaluation of the multilingual ability of code generative models. It consists of 820 high-quality human-crafted data samples (each with test cases) in Python, C++, Java, JavaScript, and Go, and can be used for various tasks.
π€ Hugging Faceβ apache-2.0
Papers using HumanEval (20)
- ACECODER: Acing Coder RL via Automated Test-Case SynthesisGroup-Aware Reinforcement Learning for Output Diversity in Large Language ModelsWarm Up Before You Train: Unlocking General Reasoning in Resource-Constrained SettingsSLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory SlicingLEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement LearningPopuLoRA: Co-Evolving LLM Populations for Reasoning Self-PlayBeyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code GenerationSampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte CarloMIST-RL: Mutation-based Incremental Suite Testing via Reinforcement LearningReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement LearningExecution-Grounded Credit Assignment for GRPO in Code GenerationReasoning with Sampling: Your Base Model is Smarter Than You ThinkCosmoCore Affective Dream-Replay Reinforcement Learning for Code GenerationLearning to Reason as Action Abstractions with Scalable Mid-Training RLPrior Prompt Engineering for Reinforcement Fine-TuningOptimal Policy Minimum Bayesian RiskFALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization systemRLHF Workflow: From Reward Modeling to Online RLHFPolicy Filtration for RLHF to Mitigate Noise in Reward ModelsCPL: Critical Plan Step Learning Boosts LLM Generalization in Reasoning
Tasks