WebShop
Emerging38papers using it
2024first seen
The 'WebShop' dataset/benchmark contains a collection of multi-turn interactions designed to evaluate the performance of reinforcement learning algorithms in training large language models as autonomous agents.
Papers using WebShop (38)
- Retrospex: Language Agent Meets Offline Reinforcement Learning CriticBeyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon Planning3SPO: State-Score-Supervised Policy Optimization for LLM AgentsSemantic Consistency Policy Optimization for Reinforcement Learning of LLM AgentsHera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM AgentsTurn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMsGraph-Enhanced Policy Optimization in LLM Agent TrainingLearn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement LearningGroup-in-Group Policy Optimization for LLM Agent TrainingSIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent TrainingWhen Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent TrainingT$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement LearningMilestone-Guided Policy Learning for Long-Horizon Language AgentsSkill1: Unified Evolution of Skill-Augmented Agents via Reinforcement LearningStraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory AbstractionGAGPO: Generalized Advantage Grouped Policy OptimizationSelf-Distilled Agentic Reinforcement LearningCLEAR: Context Augmentation from Contrastive Learning of Experience via Agentic ReflectionHiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM AgentsHindsight Credit Assignment for Long-Horizon LLM AgentsDynamic Dual-Granularity Skill Bank for Agentic RLSkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement LearningTSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM AgentsHiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model AgentsHierarchy-of-Groups Policy Optimization for Long-Horizon Agentic TasksExploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy OptimizationCuES: A Curiosity-driven and Environment-grounded Synthesis Framework for Agentic RLMeta-RL Induces Exploration in Language AgentsSALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory GraphDeepAgent: A General Reasoning Agent with Scalable ToolsetsHarnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM AgentsEnhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World SuccessEnhancing Decision-Making of Large Language Models via Actor-CriticSPA-RL: Reinforcing LLM Agents via Stepwise Progress AttributionRRO: LLM Agent Optimization Through Rising Reward TrajectoriesAgent Q: Advanced Reasoning and Learning for Autonomous AI AgentsAn Extremely Data-efficient and Generative LLM-based Reinforcement
Learning Agent for RecommendersEnhancing Decision-Making for LLM Agents via Step-Level Q-Value Models