ClassEval
Canonical12papers using it
1,892HF downloads
12HF likes
2023first seen
Dataset Card for FudanSELab ClassEval Dataset Summary We manually build ClassEval of 100 class-level Python coding tasks, consists of 100 classes and 412 methods, and average 33.1 test cases per class. For 100 class-level tasks, diversity is maintained by encompassing these tasks over a wide spectrum of topics, includi
π€ Hugging Faceβ mit
Papers using ClassEval (12)
- ClassEval-T: Evaluating Large Language Models in Class-Level Code
TranslationCangjieBench: Benchmarking LLMs on a Low-Resource General-Purpose Programming LanguageScaling Test-Driven Code Generation from Functions to Classes: An Empirical StudyAutomated Test Suite Enhancement Using Large Language Models with Few-shot PromptingFrom Human to Machine Refactoring: Assessing GPT-4's Impact on Python Class Quality and ReadabilityEvaluating Software Process Models for Multi-Agent Class-Level Code GenerationTALM: Dynamic Tree-Structured Multi-Agent Framework with Long-Term Memory for Scalable Code GenerationClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code GenerationReasoning Runtime Behavior of a Program with LLM: How Far Are We?CoCoST: Automatic Complex Code Generation with Online Searching and
Correctness TestingTaskEval: Assessing Difficulty of Code Generation Tasks for Large Language ModelsStrategic Optimization and Challenges of Large Language Models in
Object-Oriented Programming