LIBERO
Canonical146papers using it
2025first seen
This dataset was created using LeRobot. Dataset Structure meta/info.json: { "codebase_version": "v3.0", "robot_type": "panda", "total_episodes": 1693, "total_frames": 273465, "total_tasks": 40, "chunks_size": 1000, "data_files_size_in_mb": 100, "video_files_size_in_mb": 500, "fps": 10.0, "splits": { "train": "0:1693" }
Papers using LIBERO (146)
- SimpleVLA-RL: Scaling VLA Training via Reinforcement LearningHide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime MonitoringVLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent AlignmentSSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic ManipulationEmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation TrajectoriesPriGo: Test-Time Primitive Guidance to Diffusion and Flow Policies for Adaptive Robotic ManipulationLearning Robust Execution in Robotic Manipulation with Agentic Reinforcement LearningAC-VLA: Robust Out-of-Distribution Action Execution via Compositional LearningReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action GenerationRARM: Confidence-Gated Progress Reward Modeling for RL in ManipulationTraining Vision-Language-Action Models with Dense Embodied Chain-of-Thought SupervisionAgentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models$\pi_0$-EqM: Equilibrium Matching for Closed-Loop Vision-Language-Action ControlPoint Tracking Improves World Action ModelsELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play AdaptationS$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon ManipulationDVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic ManipulationGaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic ManipulationPointACT: Vision-Language-Action Models with Multi-Scale Point-Action InteractionSKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World ModelsLearning Multi-Modal Trajectory Policies for Data-Efficient Robotic ManipulationGPU-Parallel Multi-Task Reinforcement Learning with Demonstration Guided Policy OptimizationAxisGuide: Grounding Robot Action Coordinate System in RGB Observations for Robust Visuomotor ManipulationCoarse-to-Control: Action-Token Planning for Vision-Language-Action ModelsRobotic Policy Adaptation via Weight-Space Meta-LearningLight-WAM: Efficient World Action Models with State-Fusion Action DecodingGEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic ManipulationReGIL: Retrieval-Guided Imitation Learning from a Single DemonstrationCT-VAM: A Cerebello-Thalamic-Inspired Vision-Action Model for Efficient Visuomotor ControlHiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic ManipulationMaskWAM: Unifying Mask Prompting and Prediction for World-Action ModelsActing While Understanding: Asynchronous Semantic-Action Decoupling for Real-Time Vision-Language-Action ModelsSAPS: Shared Autonomy for Policy Steering by Blending Teleoperation with a Pretrained VLALearning New Tasks via Reusable Skills: Skill-Compositional Experts for Embodied Continual LearningLaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot PoliciesScaling Short-Term Memory of Visuomotor Policies for Long-Horizon TasksPearlVLA: Progressive Embodied Action-Plan Refinement in Latent SpaceUncertainty Quantification for Flow-Based Vision-Language-Action ModelsLamp: Learning Vision-language-action Policies With 3D Scene Flow As Latent Motion PriorLatent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model InferenceOA-WAM: Object-Addressable World Action Model for Robust Robot ManipulationElasticFlow: One-Step Physics-Consistent Policy with Elastic Time Horizons for Language-Guided ManipulationPriorVLA: Prior-Preserving Adaptation for Vision-Language-Action ModelsLearning Action Manifold with Multi-view Latent Priors for Robotic ManipulationFrom Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot ManipulationRotVLA: Rotational Latent Action for Vision-Language-Action ModelAttenA+: Rectifying Action Inequality in Robotic Foundation ModelsFrameSkip: Learning from Fewer but More Informative Frames in VLA TrainingRealtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAsIntentVLA: Short-Horizon Intent Modeling for Aliased Robot ManipulationPhysBrain 1.0 Technical ReportHealth-Conditioned Vision-Language-Action Models for Malfunction-Aware Robot ControlKey-Gram: Extensible World Knowledge for Embodied ManipulationThinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot ManipulationSword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-TrainingStarVLA: A Lego-like Codebase for Vision-Language-Action Model DevelopingA1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action ModelSTRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal PerturbationsStarVLA-$\alpha$: Reducing Complexity in Vision-Language-Action SystemsOmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RLOFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic ManipulationMask World Model: Predicting What Matters for Robust Robot Policy LearningdWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World ModelLaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent ReasoningLearning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic ManipulationROSER: Few-Shot Robotic Sequence Retrieval for Scalable Robot Learning$\pi$-StepNFT: Wider Space Needs Finer Steps in Online RL for Flow-based VLAsAnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action ModelsRestoring Linguistic Grounding in VLA Models via Train-Free Attention RecalibrationAtomicVLA: Unlocking the Potential of Atomic Skill Learning in RobotsAtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World ModelsSee, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic ManipulationCORAL: Scalable Multi-Task Robot Learning via LoRA ExpertsWorld2Act: Latent Action Post-Training from World Model DynamicsDiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot ControlDepthCache: Depth-Guided Training-Free Visual Token Merging for Vision-Language-Action Model InferenceBeyond Dense Futures: World Models as Structured Planners for Robotic ManipulationLanguage-Grounded Decoupled Action Representation for Robotic ManipulationSmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness OptimizationVLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image ReasoningReSteer: Quantifying and Refining the Steerability of Multitask Robot PoliciesKineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action DecompositionVolumeDP: Modeling Volumetric Representation for Manipulation Policy LearningProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action ModelsAcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action ModelsSparse Autoencoders Reveal Interpretable and Steerable Features in VLA ModelsSpeedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied ManipulationROBOGATE: Adaptive Failure Discovery for Safe Robot Policy Deployment via Two-Stage Boundary-Focused SamplingMMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and GenerationDFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow MatchingVLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy DistillationProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic ManipulationLearning to Accelerate Vision-Language-Action Models through Adaptive Visual Token CachingStreamVLA: Breaking the Reason-Act Cycle via Completion-State GatingGSR: Learning Structured Reasoning for Embodied ManipulationFrom Knowing to Doing Precisely: A General Self-Correction and Termination Framework for VLA modelsReshaping Action Error Distributions for Reliable Vision-Language-Action ModelsThink Proprioceptively: Embodied Visual Reasoning for VLA ManipulationJEPA-VLA: Video Predictive Embedding is Needed for VLA ModelsHoloBrain-0 Technical ReportWoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RLGlobal Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic ManipulationImproving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual InputsUniversal Pose Pretraining for Generalizable Vision-Language-Action PoliciesV-VLAPS: Value-Guided Planning for Vision-Language-Action ModelsCLARE: Continual Learning for Vision-Language-Action Models via Autonomous Adapter Routing and ExpansionDemonstration-Free Robotic Control via LLM AgentsAdaPower: Specializing World Foundation Models for Predictive ManipulationSee Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video DemonstrationsMasked Generative Policy for Robotic ControlToken Expand-Merge: Training-Free Token Compression for Vision-Language-Action ModelsGeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA ManipulationRobotic VLA Benefits from Joint Learning with Motion Image DiffusionLoLA: Long Horizon Latent Action Learning for General Robot ManipulationDream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model BackboneEveryDayVLA: A Vision-Language-Action Model for Affordable Robotic ManipulationExpReS-VLA: Specializing Vision-Language-Action Models Through Experience Replay and RetrievalSlotVLA: Towards Modeling of Object-Relation Representations in Robotic ManipulationAVA-VLA: Improving Vision-Language-Action models with Active Visual AttentionUnifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action GenerationE0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete DiffusionLatBot: Distilling Universal Latent Actions for Vision-Language-Action ModelsHAMLET: Switch your Vision-Language-Action Model into a History-Aware PolicyStaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State RepresentationMetaVLA: Unified Meta Co-training For Efficient Embodied AdaptionD2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AIVITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert DistillationVLA-0: Building State-of-the-Art VLAs with Zero ModificationMechanistic interpretability for steering vision-language-action modelsVLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic ManipulationLatent Action Pretraining Through World ModelingRoboSSM: Scalable In-context Imitation Learning via State-Space ModelsKeyWorld: Key Frame Reasoning Enables Effective and Efficient World ModelsFPC-VLA: A Vision-Language-Action Framework with a Supervisor for Failure Prediction and CorrectionFocusing on What Matters: Object-Agent-centric Tokenization for Vision Language Action modelsViReSkill: Vision-Grounded Replanning with Skill Memory for LLM-Based Planning in Lifelong Robot LearningdVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-ThoughtMolmoAct: Action Reasoning Models that can Reason in SpaceGeoVLA: Empowering 3D Representations in Vision-Language-Action ModelsFast ECoT: Efficient Embodied Chain-of-Thought via Thoughts ReuseUnified Vision-Language-Action ModelTTF-VLA: Temporal Token Fusion Via Pixel-attention Integration For Vision-language-action ModelsMapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen TasksVLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement LearningAgentic Robot: A Brain-Inspired Framework for Vision-Language-Action Models in Embodied Agents