Codeforces
Emerging28papers using it
2022first seen
The 'Codeforces' dataset is a benchmark that contains competitive programming problems used to evaluate the reasoning and problem-solving capabilities of large language models in a competitive programming context.
Papers using Codeforces (28)
- A Showdown of ChatGPT vs DeepSeek in Solving Programming TasksVerus-SpecGym: An Agentic Environment for Evaluating Specification AutoformalizationCompetitive Programming with Large Reasoning ModelsCodeElo: Benchmarking Competition-level Code Generation of LLMs with
Human-comparable Elo RatingsMokav: Execution-driven Differential Testing with LLMsSelf-Questioning Language ModelsVeriContest: A Competitive-Programming Benchmark for Verifiable Code GenerationSolvita: Enhancing Large Language Models for Competitive Programming via Agentic EvolutionReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement LearningDePro: Understanding the Role of LLMs in Debugging Competitive Programming CodeComplexity-based code embeddingsDRIVE: Data Curation Best Practices for Reinforcement Learning with Verifiable Reward in Competitive Code GenerationDRIVE: Data Curation Best Practices for Reinforcement Learning with
Verifiable Reward in Competitive Code GenerationA Systematic Study of Time Limit Exceeded Errors in Online Programming AssignmentsPromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model ReasoningCan LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and ExposureLiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive
Programming?Can LLMs Generate High-Quality Test Cases for Algorithm Problems?
TestCase-Eval: A Systematic Evaluation of Fault Coverage and ExposurePromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model
ReasoningCode Generation with Small Language Models: A Codeforces-Based StudyProBench: Benchmarking Large Language Models in Competitive ProgrammingVeCoGen: Automating Generation of Formally Verified C Code with Large
Language ModelsCompetition-Level Code Generation with AlphaCodeLiveCodeBench: Holistic and Contamination Free Evaluation of Large
Language Models for CodeCompetition-Level Problems are Effective LLM EvaluatorsAre Large Language Models a Threat to Programming Platforms? An
Exploratory StudyTag Prediction of Competitive Programming Problems using Deep Learning
TechniquesBenchmarking Language Model Creativity: A Case Study on Code Generation