D4RL
Canonical125papers using it
3,427HF downloads
4HF likes
2024first seen
Datasets for Deep Data-Driven RL β standardized offline-RL benchmark tasks and logged datasets.
π€ Hugging Faceβ apache-2.0
Papers using D4RL (125)
- Penalizing Infeasible Actions and Reward Scaling in Reinforcement Learning with Offline DataDirectly Forecasting Belief for Reinforcement Learning with DelaysShortcut Trajectory Planning for Efficient Offline Reinforcement LearningFast and Highly Expressive Policy Learning for Offline Reinforcement Learning via Bootstrapped Flow Q-LearningWavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement LearningBeyond the Known: Decision Making with Counterfactual Reasoning Decision TransformerLearning on One Mode: Addressing Multi-modality in Offline Reinforcement
LearningDiffusion Model Predictive ControlDrift Q-LearningCounterfactual Transport Flows for Offline Conservative Trajectory RefinementBeyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision TransformerPath-Coupled Bellman Flows for Distributional Reinforcement LearningRankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action RankingPeng's Q($\lambda$) for Conservative Value Estimation in Offline Reinforcement LearningCOOPO: Cyclic Offline-Online Policy Optimization AlgorithmNeuro-Inspired Inverse Learning for Planning and ControlMoment Matching Q-LearningReinforcement Learning via Value Gradient FlowPreserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement LearningWhen Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement LearningIPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement LearningRobust Regularized Policy Iteration under Transition UncertaintyGEM: Guided Expectation-Maximization for Behavior-Normalized Candidate Action Selection in Offline RLEfficient Anti-exploration via VQVAE and Fuzzy Clustering in Offline Reinforcement LearningSMAC: Score-Matched Actor-Critics for Robust Offline-to-Online TransferFlow Actor-Critic for Offline Reinforcement LearningCS-GBA: A Critical Sample-based Gradient-guided Backdoor Attack for Offline Reinforcement LearningOff-Policy Actor-Critic with Sigmoid-Bounded Entropy for Real-World Robot LearningAutomatic Constraint Policy Optimization based on Continuous Constraint Interpolation Framework for Offline Reinforcement LearningAgile Reinforcement Learning through Separable Neural ArchitectureGuided Flow Policy: Learning from High-Value Actions in Offline Reinforcement LearningLong-Horizon Model-Based Offline Reinforcement Learning Without Explicit ConservatismOptimal Perturbation Budget Allocation for Data Poisoning in Offline Reinforcement LearningAdaptive Replay Buffer for Offline-to-Online Reinforcement LearningFrom Static Constraints to Dynamic Adaptation: Sample-Level Constraint Relaxation for Offline-to-Online Reinforcement LearningDiffusion Policies with Value-Conditional Optimization for Offline Reinforcement LearningOpinion: Towards Unified Expressive Policy Optimization for Robust Robot LearningQuantile Q-Learning: Revisiting Offline Extreme Q-Learning with Quantile RegressionOne-Step Generative Policies with Q-Learning: A Reformulation of MeanFlowEnhancing Robustness of Offline Reinforcement Learning Under Data Corruption via Sharpness-Aware MinimizationASTRO: Adaptive Stitching via Dynamics-Guided Trajectory RolloutsOffline Reinforcement Learning with Generative Trajectory PoliciesHuman-in-the-Loop Bandwidth Estimation for Quality of Experience Optimization in Real-Time Video CommunicationWhat Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?Diffusion Policies with Offline and Inverse Reinforcement Learning for Promoting Physical Activity in Older Adults Using Wearable SensorsDAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred TransitionsUnleashing Flow Policies with Distributional CriticsRobust Policy Expansion for Offline-to-Online RL under Diverse Data CorruptionOffline-to-Online Reinforcement Learning with Classifier-Free Diffusion GenerationOne-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement LearningDouble Check My Desired Return: Transformer with Target Alignment for Offline Reinforcement LearningAdaptive Scaling of Policy Constraints for Offline Reinforcement LearningOnline Pre-Training for Offline-to-Online Reinforcement LearningConsistency Trajectory Planning: High-Quality and Efficient Trajectory Optimization for Offline Model-Based Reinforcement LearningShould We Ever Prefer Decision Transformer for Offline Reinforcement Learning?Offline Reinforcement Learning with Wasserstein Regularization via Optimal Transport MapsFrom Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement LearningBelief-Based Offline Reinforcement Learning for Delay-Robust Policy OptimizationBiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement LearningOffline RL with Smooth OOD Generalization in Convex Hull and its NeighborhoodPolicy-Based Trajectory Clustering in Offline Reinforcement LearningMOORL: A Framework for Integrating Offline-Online Reinforcement LearningCAWR: Corruption-Averse Advantage-Weighted Regression for Robust Policy OptimizationAccelerating Residual Reinforcement Learning with Uncertainty EstimationTROFI: Trajectory-Ranked Offline Inverse Reinforcement LearningAnalytic Energy-Guided Policy Optimization for Offline Reinforcement
LearningTaming OOD Actions for Offline Reinforcement Learning: An Advantage-Based ApproachPretraining a Shared Q-Network for Data-Efficient Offline Reinforcement LearningImagination-Limited Q-Learning for Offline Reinforcement LearningDiffusion Self-Weighted Guidance for Offline Reinforcement LearningLearning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RLDecision SpikeFormer: Spike-Driven Transformer for Decision MakingVIPO: Value Function Inconsistency Penalized Offline Reinforcement LearningAn Optimal Discriminator Weighted Imitation Perspective for
Reinforcement LearningModel-Based Offline Reinforcement Learning with Adversarial Data
AugmentationLearning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-NetworkFlow Q-LearningBehavior-Regularized Diffusion Policy Optimization for Offline Reinforcement LearningHabitizing Diffusion Planning for Efficient and Effective Decision
MakingM$^3$PC: Test-time Model Predictive Control for Pretrained Masked
Trajectory ModelSR-Reward: Taking The Path More TraveledDRDT3: Diffusion-Refined Decision Test-Time Training ModelPIQL: Projective Implicit Q-Learning with Support Constraint for Offline Reinforcement LearningSAMG: Offline-to-Online Reinforcement Learning via
State-Action-Conditional Offline Model GuidanceQ-Distribution guided Q-learning for offline reinforcement learning:
Uncertainty penalized Q-value via consistency modelDiffusion Actor-Critic: Formulating Constrained Policy Iteration as
Diffusion Noise Regression for Offline Reinforcement LearningDecision Mamba: Reinforcement Learning via Hybrid Selective Sequence
ModelingQ-value Regularized Transformer for Offline Reinforcement LearningKAN v.s. MLP for Offline Reinforcement LearningNetworkGym: Reinforcement Learning Environments for Multi-Access Traffic
Management in Network SimulationSimple Ingredients for Offline Reinforcement LearningReinformer: Max-Return Sequence Modeling for Offline RLTowards Robust Policy: Enhancing Offline Reinforcement Learning with
Adversarial Attacks and DefensesDiffusion Policies creating a Trust Region for Offline Reinforcement
LearningIn-Context Decision Transformer: Reinforcement Learning via Hierarchical
Chain-of-ThoughtModel-based Offline Reinforcement Learning with Lower Expectile
Q-LearningA2PO: Towards Effective Offline Reinforcement Learning from an
Advantage-aware PerspectiveGrid-Mapping Pseudo-Count Constraint for Offline Reinforcement LearningCompositional Conservatism: A Transductive Approach in Offline
Reinforcement LearningOffline Reinforcement Learning with Domain-Unlabeled DataImproving Offline Reinforcement Learning with Inaccurate SimulatorsTask-agnostic Decision Transformer for Multi-type Agent Control with
Federated Split TrainingState-Constrained Offline Reinforcement LearningAlignIQL: Policy Alignment in Implicit Q-Learning through Constrained OptimizationLearning from Random Demonstrations: Offline Reinforcement Learning with
Importance-Sampled Diffusion ModelsAdaptive Advantage-Guided Policy Regularization for Offline
Reinforcement LearningUDQL: Bridging The Gap between MSE Loss and The Optimal Value Function
in Offline Reinforcement LearningStrategically Conservative Q-LearningStabilizing Extreme Q-learning by Maclaurin ExpansionCDSA: Conservative Denoising Score-based Algorithm for Offline
Reinforcement LearningDiffPoGAN: Diffusion Policies with Generative Adversarial Networks for
Offline Reinforcement LearningBinary Reward Labeling: Bridging Offline Preference and Reward-Based
Reinforcement LearningSUMO: Search-Based Uncertainty Estimation for Model-Based Offline
Reinforcement LearningForward KL Regularized Preference Optimization for Aligning Diffusion
PoliciesQ-value Regularized Decision ConvFormer for Offline Reinforcement
LearningPlanning Transformer: Long-Horizon Offline Reinforcement Learning with
Planning TokensRethinking Optimal Transport in Offline Reinforcement LearningOffline Behavior DistillationReturn Augmented Decision Transformer for Off-Dynamics Reinforcement LearningHypercube Policy Regularization Framework for Offline Reinforcement LearningConstrained Latent Action Policies for Model-Based Offline Reinforcement LearningEnhancing Decision Transformer with Diffusion-Based Trajectory Branch
GenerationAre Expressive Models Truly Necessary for Offline RL?Goal-Conditioned Data Augmentation for Offline Reinforcement LearningDiffusion Models as Optimizers for Efficient Planning in Offline RL