WebShop
Canonical48papers using it
2023first seen
The 'WebShop' dataset is a benchmark used to evaluate the performance of AI agents in a shopping environment, focusing on their ability to interact with and navigate through various tasks related to online shopping.
Papers using WebShop (44)
- SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement LearningHarnessX: A Composable, Adaptive, and Evolvable Agent Harness FoundrySkillAdaptor: Self-Adapting Skills for LLM Agents from TrajectoriesSkill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement LearningTurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent TrainingExploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy OptimizationSKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit AssignmentWhat and When to Distill: Selective Hindsight Distillation for Multi-Turn AgentsBeyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon PlanningRSPO: Reward-Swap Policy Optimization for Multi-Turn LLM AgentsSTAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent TrainingUnified Context Evolution for LLM AgentsSIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent TrainingAdaMEM: Test-Time Adaptive Memory for Language AgentsFrom Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM AgentsSelf-evolving LLM agents with in-distribution Optimization3SPO: State-Score-Supervised Policy Optimization for LLM AgentsOn-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn AgentsEnvRL: Learn from Environment Dynamics in Agentic Reinforcement LearningUncertainty Decomposition for Clarification Seeking in LLM AgentsSemantic Consistency Policy Optimization for Reinforcement Learning of LLM AgentsJoint Learning of Experiential Rules and Policies for Large Language Model AgentsATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksHera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM AgentsProper Scoring Rules for Agentic Uncertainty QuantificationWhere LLM Agents Fail And How They Can Learn From FailuresProgress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement LearningRetrospective Progress-Aware Self-Refinement for LLM Agent TrainingSKILL0: In-Context Agentic Reinforcement Learning for Skill InternalizationShadowMerge: A Novel Poisoning Attack on Graph-Based Agent Memory via Relation-Channel ConflictsRewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon AgentsWhen Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent TrainingUCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-DistillationGrasp: Graph-structured Skill Compositions For LLM AgentsOTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM AgentsHiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM AgentsDynamic Dual-Granularity Skill Bank for Agentic RLSkillnet: Create, Evaluate, And Connect AI SkillsTSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM AgentsMeta-RL Induces Exploration in Language AgentsGraph-Enhanced Policy Optimization in LLM Agent TrainingStructured Agent Distillation for Large Language ModelBetter Than Your Teacher: LLM Agents That Learn From Privileged AI FeedbackADaPT: As-Needed Decomposition and Planning with Language Models