HumanEval
Emerging27papers using it
2024first seen
HumanEval-X is a benchmark for the evaluation of the multilingual ability of code generative models. It consists of 820 high-quality human-crafted data samples (each with test cases) in Python, C++, Java, JavaScript, and Go, and can be used for various tasks.
Papers using HumanEval (27)
- AutoResearch: An Execution-Grounded Multi-Agent Framework for Reliable Research Workflow AutomationHow Generation Architecture Shapes Code Complexity in Multi-Agent LLM Systems: A Paired Study on HumanEvalFASE: Fast Adaptive Semantic Entropy for Code QualitySmarter Saboteurs, Better Fixers: Scaling & Security in Linear Multi-Agent WorkflowsStrategies for Guiding LLMs to Use Software Design Patterns: A Case of SingletonPoison with Style: A Practical Poisoning Attack on Code Large Language ModelsHonest Lying: Understanding Memory Confabulation in Reflexive AgentsG-Designer: Architecting Multi-agent Communication Topologies via Graph Neural NetworksSafesieve: From Heuristics To Experience In Progressive Pruning For Llm-based Multi-agent CommunicationSLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory SlicingOmniCode: A Benchmark for Evaluating Software Engineering AgentsTDPGen: Optimizing Agentic Code Generation via Test-Driven Planning and Hierarchical ReActR2V Agent: Teaching SLMs When to Ask for HelpGraph-of-Agents: A Graph-based Framework for Multi-Agent LLM CollaborationCARD: Towards Conditional Design of Multi-agent Topological StructuresThink Anywhere in Code GenerationAdaptive Confidence Gating In Multi-agent Collaboration For Efficient And Optimized Code GenerationMAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMsA Multi-Agent Framework for Stateful Inference-Time SearchFrom Implicit Exploration to Structured Reasoning: Leveraging Guideline and Refinement for LLMsAgentGroupChat-V2: Divide-and-Conquer Is What LLM-Based Multi-Agent System NeedNexus: A Lightweight and Scalable Multi-Agent Framework for Complex Tasks AutomationGuided Code Generation with LLMs: A Multi-Agent Framework for Complex Code TasksLeveraging Metamemory Mechanisms for Enhanced Data-Free Code Generation
in LLMsDivide-and-Conquer Meets Consensus: Unleashing the Power of Functions in Code GenerationCPL: Critical Plan Step Learning Boosts LLM Generalization in Reasoning
TasksFALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system