ALFWorld
Emerging55papers using it
24HF downloads
0HF likes
2024first seen
ALFWorld is a dataset/benchmark that evaluates the performance of large language models (LLMs) as autonomous agents in multi-turn tasks by providing a structured environment for reinforcement learning.
Papers using ALFWorld (55)
- RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon AgentsGTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent TrainingSEEA-R1: Tree-Structured Reinforcement Fine-Tuning for Self-Evolving Embodied AgentsRetrospex: Language Agent Meets Offline Reinforcement Learning CriticBeyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon PlanningWhen Does Muon Help Agentic Reinforcement Learning?3SPO: State-Score-Supervised Policy Optimization for LLM AgentsSemantic Consistency Policy Optimization for Reinforcement Learning of LLM AgentsHera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM AgentsStepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement LearningGraph-Enhanced Policy Optimization in LLM Agent TrainingLearn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement LearningGroup-in-Group Policy Optimization for LLM Agent TrainingProcess Reward Models for LLM Agents: Practical Framework and DirectionsSIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent TrainingPolicy-Conditioned Counterfactual Credit for Verifiable Reinforcement Learning of Long-Horizon Language AgentsWhen Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent TrainingT$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement LearningSelective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RLMilestone-Guided Policy Learning for Long-Horizon Language AgentsSkill1: Unified Evolution of Skill-Augmented Agents via Reinforcement LearningStraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory AbstractionEvolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within AgentsDynamic Skill Lifecycle Management for Agentic Reinforcement LearningGAGPO: Generalized Advantage Grouped Policy OptimizationSelf-Distilled Agentic Reinforcement LearningSKILL0: In-Context Agentic Reinforcement Learning for Skill InternalizationHierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM AgentsAgent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM AgentsHindsight Credit Assignment for Long-Horizon LLM AgentsDynamic Dual-Granularity Skill Bank for Agentic RLRLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL SystemSkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement LearningThink Fast and Slow: Step-Level Cognitive Depth Adaptation for LLM AgentsHiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model AgentsHierarchy-of-Groups Policy Optimization for Long-Horizon Agentic TasksPaying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM AgentsDifferentiable Evolutionary Reinforcement LearningA Practitioner's Guide to Multi-turn Agentic Reinforcement LearningDyna-Mind: Learning to Simulate from Experience for Better AI AgentsSALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory GraphDeepAgent: A General Reasoning Agent with Scalable ToolsetsCode Driven Planning with Domain-Adaptive CriticHarnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM AgentsEPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement LearningEnhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World SuccessEnhancing Decision-Making of Large Language Models via Actor-CriticUnleashing Embodied Task Planning Ability in LLMs via Reinforcement LearningCache-Efficient Posterior Sampling for Reinforcement Learning with LLM-Derived Priors Across Discrete and Continuous DomainsDivide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement LearningSPA-RL: Reinforcing LLM Agents via Stepwise Progress AttributionGFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with
Generative Flow NetworksReAct Meets ActRe: When Language Agents Enjoy Training Data AutonomyOffline Reinforcement Learning for LLM Multi-Step Reasoning