MuJoCo
Canonical156papers using it
2024first seen
A physics engine whose continuous-control locomotion tasks are standard RL benchmarks.
Papers using MuJoCo (156)
- OM2P: Offline Multi-Agent Mean-Flow PolicyDirectly Forecasting Belief for Reinforcement Learning with DelaysSkill Learning via Policy Diversity Yields Identifiable Representations for Reinforcement LearningStochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror DescentStreaming Reinforcement Learning under Partial Observability with Real-Time Recurrent LearningPersonalized Observation Normalization for Federated Reinforcement Learning in Simulation Environments with HeterogeneityWhen are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?Beyond Non-Expert Demonstrations: Outcome-Driven Action Constraint for
Offline Reinforcement LearningAligning Humans and Robots via Reinforcement Learning from Implicit Human FeedbackADDQ: Adaptive Distributional Double Q-LearningBehavioral Entropy-Guided Dataset Generation for Offline Reinforcement
LearningRIZE: Adaptive Regularization for Imitation LearningAn Empirical Study of Deep Reinforcement Learning in Continuing TasksTIMRL: A Novel Meta-Reinforcement Learning Framework for Non-Stationary
and Multi-Task EnvironmentsOn Rollouts in Model-Based Reinforcement LearningStructure-Conditioned Actor-Critic Branches for Quality-Diversity Reinforcement LearningCounterfactual Transport Flows for Offline Conservative Trajectory RefinementSAVGO: Learning State-Action Value Geometry with Cosine Similarity for Continuous ControlANO: A Principled Approach to Robust Policy OptimizationConstraint-Enhanced Reinforcement Learning Based on Dynamic Decoupled Spherical Radial SquashingStochastic Minimum-Cost Reach-Avoid Reinforcement LearningPhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video GenerationWhen LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RLFlow-based Policy With Distributional Reinforcement Learning in Trajectory OptimizationDelayed homomorphic reinforcement learning for environments with delayed feedbackMean Flow Policy OptimizationEfficient Federated RLHF via Zeroth-Order Policy OptimizationBounded Ratio Reinforcement LearningasRoBallet: Closing the Sim2Real Gap via Friction-Aware Reinforcement Learning for Underactuated Spherical DynamicsLyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement LearningContextual Latent World Models for Offline Meta Reinforcement LearningWhen Sensors Fail: Temporal Sequence Models for Robust PPO under Sensor DriftTaming the Adversary: Stable Minimax Deep Deterministic Policy Gradient via Fractional ObjectivesEfficient Soft Actor-Critic with LLM-Based Action-Level Guidance for Continuous ControlFlow Matching Policy Optimization with Mirror Descent and Entropy ConstraintsMatch or Replay: Self Imitating Proximal Policy OptimizationBoosting Maximum Entropy Reinforcement Learning via One-Step Flow MatchingSegment to Focus: Guiding Latent Action Models in the Presence of DistractorsDistributional Reinforcement Learning with Diffusion Bridge CriticsRisk-Sensitive Exponential Actor CriticGeneral Flexible $f$-divergence for Challenging Offline RL Datasets with Low Stochasticity and Diverse Behavior PoliciesSolving Parameter-Robust Avoid Problems with Unknown Feasibility using Reinforcement LearningPRISM: Parallel Reward Integration with Symmetry for MORLIn-Context Planning with Latent Temporal AbstractionsBridging Dynamics Gaps via Diffusion Schr\"odinger Bridge for Cross-Domain Reinforcement LearningDistributional value gradients for stochastic environmentsReinforcement Learning from Implicit Neural Feedback for Human-Aligned Robot ControlEnhancing Deep Deterministic Policy Gradients on Continuous Control Tasks with Decoupled Prioritized Experience ReplayUACER: An Uncertainty-Adaptive Critic Ensemble Framework for Robust Adversarial Reinforcement LearningSACn: Soft Actor-Critic with n-step ReturnsAutomatic Reward Shaping from Multi-Objective Human HeuristicsLearning Intractable Multimodal Policies with Reparameterization and Diversity RegularizationControllable Flow Matching for Online Reinforcement LearningLearning Quantized Continuous Controllers for Integer HardwareBeyond Distributions: Geometric Action Control for Continuous Reinforcement LearningSEBA: Sample-Efficient Black-Box Attacks on Visual Reinforcement LearningHeuristic Transformer: Belief Augmented In-Context Reinforcement LearningStabilizing Policy Gradient Methods via Reward ProfilingGRACE: A Language Model Framework for Explainable Inverse Reinforcement LearningConstant in an Ever-Changing WorldADARL: Adaptive Low-Rank Structures for Robust Policy Learning under UncertaintyOffSim: Offline Simulator for Model-based Offline Inverse Reinforcement LearningMulti-Actor Multi-Critic Deep Deterministic Reinforcement Learning with a Novel Q-Ensemble MethodScalable Option Learning in High-Throughput Environments$Agent^2$: An Agent-Generates-Agent Framework for Reinforcement Learning AutomationTrust Region Reward Optimization and Proximal Inverse Reward Optimization AlgorithmIn-Context Compositional Q-Learning for Offline Reinforcement LearningAccelerating Transformers in Online RLFine-tuning Behavioral Cloning Policies with Preference-Based Reinforcement LearningOffline-to-Online Reinforcement Learning with Classifier-Free Diffusion GenerationGeneralized Adaptive Transfer Network: Enhancing Transfer Learning in Reinforcement Learning Across DomainsSafe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy AdaptationOnline Pre-Training for Offline-to-Online Reinforcement LearningDeep Reinforcement Learning with Gradient Eligibility TracesTurning Sand to Gold: Recycling Data to Bridge On-Policy and Off-Policy Learning via Causal BoundOne-Step Flow Policy Mirror DescentDistributional Soft Actor-Critic with Diffusion PolicyGeometry of Neural Reinforcement Learning in Continuous State and Action SpacesWasserstein Barycenter Soft Actor-CriticGrowing with Experience: Growing Neural Networks in Deep Reinforcement LearningRevealing the Challenges of Sim-to-Real Transfer in Model-Based Reinforcement Learning via Latent Space ModelingThe Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement LearningVariational OOD State Correction for Offline Reinforcement LearningCache-Efficient Posterior Sampling for Reinforcement Learning with LLM-Derived Priors Across Discrete and Continuous DomainsLLM-Explorer: A Plug-in Reinforcement Learning Policy Exploration Enhancement Driven by Large Language ModelsADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement LearningMeasure gradients, not activations! Enhancing neuronal activity in deep reinforcement learningPPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy OptimizationSurrogate-Assisted Evolutionary Reinforcement Learning Based on Autoencoder and Hyperbolic Neural NetworkAdapting World Models with Latent-State Dynamics ResidualsText-to-Decision Agent: Offline Meta-Reinforcement Learning from Natural Language SupervisionDynamic Action Interpolation: A Universal Approach for Accelerating
Reinforcement Learning with Expert GuidanceEau De $Q$-Network: Adaptive Distillation of Neural Networks in Deep Reinforcement LearningLearning Policy Committees for Effective Personalization in MDPs with Diverse TasksGroup Fairness in Multi-Task Reinforcement LearningResidual Policy Gradient: A Reward View of KL-regularized ObjectiveApplication of linear regression and quasi-Newton methods to the deep
reinforcement learning in continuous action casesReward Redistribution via Gaussian Process Likelihood EstimationCAE: Repurposing the Critic as an Explorer in Deep Reinforcement LearningEfficient Online Reinforcement Learning for Diffusion PolicyEnhancing Offline Reinforcement Learning with Curriculum Learning-Based
Trajectory ValuationTask-Aware Virtual Training: Enhancing Generalization in Meta-Reinforcement Learning for Out-of-Distribution TasksMaximum Entropy Reinforcement Learning with Diffusion PolicyYes, Q-learning Helps Offline In-Context RLOffline Reinforcement Learning via Inverse OptimizationEntropy Regularized Task Representation Learning for Offline
Meta-Reinforcement LearningHierarchical Subspaces of Policies for Continual Offline Reinforcement LearningEnhancing Online Reinforcement Learning with Meta-Learned Objective from
Offline DataSPEQ: Offline Stabilization Phases for Efficient Q-Learning in High
Update-To-Data Ratio Reinforcement LearningOn Generalization and Distributional Update for Mimicking Observations with Adequate ExplorationEfficient Diversity-based Experience Replay for Deep Reinforcement LearningEfficient Model-Based Reinforcement Learning Through Optimistic Thompson
SamplingPre-trained Language Models Improve the Few-shot Prompt Ability of Decision TransformerUCB-driven Utility Function Search for Multi-objective Reinforcement LearningA Pontryagin Perspective on Reinforcement LearningDiffusion Actor-Critic with Entropy RegulatorRobust Deep Reinforcement Learning with Adaptive Adversarial
Perturbations in Action SpaceS$^2$AC: Energy-Based Reinforcement Learning with Stein Soft Actor
CriticTrust the Model Where It Trusts Itself -- Model-Based Actor-Critic with
Uncertainty-Aware Rollout AdaptionDEER: A Delay-Resilient Framework for Reinforcement Learning with
Variable DelaysEnhancing Sample Efficiency and Exploration in Reinforcement Learning through the Integration of Diffusion Models and Proximal Policy OptimizationMeta-DT: Offline Meta-RL as Conditional Sequence Modeling with World
Model DisentanglementSymmetric Q-learning: Reducing Skewness of Bellman Error in Online
Reinforcement LearningNo Representation, No Trust: Connecting Representation, Collapse, and
Trust Issues in PPOLLM-Empowered State Representation for Reinforcement LearningSnapshot Reinforcement Learning: Leveraging Prior Trajectories for
EfficiencyContinuous Mean-Zero Disagreement-Regularized Imitation Learning
(CMZ-DRIL)A Simple Mixture Policy Parameterization for Improving Sample Efficiency
of CVaR OptimizationPhasic Diversity Optimization for Population-Based Reinforcement
LearningRobust Model Based Reinforcement Learning Using $\mathcal{L}_1$ Adaptive
ControlHard-Thresholding Meets Evolution Strategies in Reinforcement LearningOff-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent
BaselineMaximum Entropy Reinforcement Learning via Energy-Based Normalizing FlowVariational Delayed Policy OptimizationSymmetric Reinforcement Learning Loss for Robust Learning on Diverse Tasks and Model ScalesRRLS : Robust Reinforcement Learning SuiteRobust Model-Based Reinforcement Learning with an Adversarial Auxiliary
ModelMemory Sequence Length of Data Sampling Impacts the Adaptation of
Meta-Reinforcement Learning AgentsROER: Regularized Optimal Experience ReplayTackling Data Corruption in Offline Reinforcement Learning via Sequence
ModelingConstrained Intrinsic Motivation for Reinforcement LearningEnergy-Guided Diffusion Sampling for Offline-to-Online Reinforcement
LearningMaximum Entropy On-Policy Actor-Critic via Entropy Advantage EstimationOn the Perturbed States for Transformed Input-robust Reinforcement
LearningCooperative Multi-Agent Deep Reinforcement Learning in Content Ranking
OptimizationProvable Domain Adaptation for Offline Reinforcement Learning with Limited SamplesSimultaneous Training of First- and Second-Order Optimizers in
Population-Based Reinforcement LearningEnhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward ShapingNeuroplastic Expansion in Deep Reinforcement LearningDynamic Learning Rate for Deep Reinforcement Learning: A Bandit ApproachLearning Successor Features the Simple WaySolving Minimum-Cost Reach Avoid using Reinforcement LearningZonal RL-RRT: Integrated RL-RRT Path Planning with Collision Probability
and Zone ConnectivityHierarchical Prompt Decision Transformer: Improving Few-Shot Policy
Generalization with Global and Adaptive GuidanceInverse Delayed Reinforcement LearningSMOSE: Sparse Mixture of Shallow Experts for Interpretable Reinforcement
Learning in Continuous Control Tasks