ScienceWorld
Emerging13papers using it
2025first seen
ScienceWorld is a benchmark dataset used to evaluate the performance and generalization of large language model agents in complex interactive decision-making tasks.
Papers using ScienceWorld (13)
- RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon AgentsRetrospex: Language Agent Meets Offline Reinforcement Learning CriticBeyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon PlanningPolicy-Conditioned Counterfactual Credit for Verifiable Reinforcement Learning of Long-Horizon Language AgentsMilestone-Guided Policy Learning for Long-Horizon Language AgentsHierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM AgentsThink Fast and Slow: Step-Level Cognitive Depth Adaptation for LLM AgentsExploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy OptimizationDifferentiable Evolutionary Reinforcement LearningEPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement LearningReward Is Enough: LLMs Are In-Context Reinforcement LearnersUnleashing Embodied Task Planning Ability in LLMs via Reinforcement LearningDivide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning