DeepMind Control Suite
Canonical66papers using it
2024first seen
A set of continuous-control RL tasks built on MuJoCo with a standardized interface.
Papers using DeepMind Control Suite (66)
- Wasserstein Policy OptimizationTask-Relevant Representation Decoupling for Visual Reinforcement Learning GeneralizationImplicit Action Chunking for Smooth Continuous ControlELVIS: Ensemble-Calibrated Latent Imagination for Long-Horizon Visual MPCNeural Co-state Policies: Structuring Hidden States in Recurrent Reinforcement LearningRevisiting Mixture Policies in Entropy-Regularized Actor-CriticMind Dreamer: Untethering Imagination via Active Causal Intervention on Latent ManifoldsMean Flow Policy OptimizationReal-Time Generative Policy via Langevin-Guided Flow Matching for Autonomous DrivingDecoupling Task and Behavior: A Two-Stage Reward Curriculum in Reinforcement Learning for RoboticsResWM: Residual-Action World Model for Visual RLR2-Dreamer: Redundancy-Reduced World Models without Decoders or AugmentationFlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion PoliciesEvaluating Feature Dependent Noise in Preference-based Reinforcement LearningImproving and Accelerating Offline RL in Large Discrete Action Spaces with Structured Policy InitializationReward Learning through Ranking Mean Squared ErrorTrust, Don't Trust, or Flip: Robust Preference-Based Reinforcement Learning with Multi-Expert FeedbackLatent Action World Models for Control with Unlabeled TrajectoriesSpectral Representation-based Reinforcement LearningAltNet: Addressing the Plasticity-Stability Dilemma in Reinforcement LearningBootstrap Off-policy with World ModelTest-driven Reinforcement Learning in Continuous ControlBeyond Distributions: Geometric Action Control for Continuous Reinforcement LearningClustering-Based Weight Orthogonalization for Stabilizing Deep Reinforcement LearningA Forensic Analysis of Synthetic Data in RL: Diagnosing and Solving Algorithmic Failures in Model-Based Policy OptimizationLocal Reinforcement Learning with Action-Conditioned Root Mean Squared Q-FunctionsOff-policy Reinforcement Learning with Model-based Exploration AugmentationWhat Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?One Model for All Tasks: Leveraging Efficient World Models in Multi-Task PlanningCategorical Policies: Multimodal Policy Learning and Exploration in Continuous ControlOne-Step Flow Policy Mirror DescentBalancing Expressivity and Robustness: Constrained Rational Activations for Reinforcement LearningDream to Generalize: Zero-Shot Model-Based Reinforcement Learning for Unseen Visual DistractionsFlow-Based Policy for Online Reinforcement LearningThe Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement LearningApproximated Behavioral Metric-based State Projection for Federated Reinforcement LearningMRS: Multi-Resolution Skills for HRL AgentsMeasure gradients, not activations! Enhancing neuronal activity in deep reinforcement learningFisher-Guided Selective Forgetting: Mitigating The Primacy Bias in Deep
Reinforcement LearningScaling Off-Policy Reinforcement Learning with Batch and Weight NormalizationSimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement LearningReward-free World Models for Online Imitation LearningUniZero: Generalized and Efficient Planning with Scalable Latent World
ModelsEffective Exploration Based on the Structural Information PrinciplesFocus On What Matters: Separated Models For Visual-Based RL
GeneralizationActor-Critic Reinforcement Learning with Phased ActorGeneralizing Consistency Policy to Visual RL with Prioritized Proximal
Experience RegularizationStealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement LearningHindsight PRIORs for Reward Learning from Human PreferencesPEAC: Unsupervised Pre-training for Cross-Embodiment Reinforcement LearningIntrinsic Dynamics-Driven Generalizable Scene Representations for
Vision-Oriented Decision-Making ApplicationsiQRL -- Implicitly Quantized Representations for Sample-efficient
Reinforcement LearningStabilizing Extreme Q-learning by Maclaurin ExpansionDecoupling regularization from the action spaceUncertainty-Aware Reward-Free Exploration with General Function
ApproximationROER: Regularized Optimal Experience ReplayProSpec RL: Plan Ahead, then ExecuteCURLing the Dream: Contrastive Representations for World Modeling in
Reinforcement LearningState-Novelty Guided Action Persistence in Deep Reinforcement LearningMulti-Type Preference Learning: Empowering Preference-Based
Reinforcement Learning with Equal PreferencesBisimulation metric for Model Predictive ControlMasked Generative Priors Improve World Models Sequence Modelling CapabilitiesNeuroplastic Expansion in Deep Reinforcement LearningMAD-TD: Model-Augmented Data stabilizes High Update Ratio RLMake the Pertinent Salient: Task-Relevant Reconstruction for Visual
Control with DistractionsCurriculum Reinforcement Learning for Complex Reward Functions