LIBERO
Emerging72papers using it
2024first seen
The LIBERO benchmark is a dataset used to evaluate the efficiency and performance of Vision-Language-Action models in terms of inference cost and task success rates.
Papers using LIBERO (72)
- VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World ModelDream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model BackboneLIBERO-PRO: Towards Robust And Fair Evaluation Of Vision-language-action Models Beyond MemorizationWorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World ModelingPHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action ModelsThink Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action ModelsLearned Image Compression for Vision-Language-Action ModelsReflective VLA: In-Context Action Consequences Make VLAs GeneralizeTraining Vision-Language-Action Models with Dense Embodied Chain-of-Thought SupervisionLIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint ImaginationRotVLA: Rotational Latent Action for Vision-Language-Action ModelRealtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAsPhysBrain 1.0 Technical ReportPointACT: Vision-Language-Action Models with Multi-Scale Point-Action InteractionFrom Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action ModelStarVLA: A Lego-like Codebase for Vision-Language-Action Model DevelopingLaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning$\pi$-StepNFT: Wider Space Needs Finer Steps in Online RL for Flow-based VLAsWorld2Act: Latent Action Post-Training via Skill-Compositional World ModelsInformation-Theoretic Constraints for Continual Vision-Language-Action AlignmentVLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image ReasoningDualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action ModelsVLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action ModelsTAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action ModelsLaMP: Learning Vision-Language-Action Policy with 3D Scene Flow as Latent Motion PriorDFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow MatchingImproving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual InputsQVLA: Not All Channels Are Equal in Vision-Language-Action Model's QuantizationThink Proprioceptively: Embodied Visual Reasoning for VLA ManipulationJEPA-VLA: Video Predictive Embedding is Needed for VLA ModelsROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action ModelsUniversal Pose Pretraining for Generalizable Vision-Language-Action PoliciesGlobal Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic ManipulationMM-ACT: Learn from Multimodal Parallel Generation to ActGeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA ManipulationUnified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion ProcessEvo-1: Lightweight Vision-Language-Action Model with Preserved Semantic AlignmentEveryDayVLA: A Vision-Language-Action Model for Affordable Robotic ManipulationAudio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic ManipulationSRPO: Self-Referential Policy Optimization for Vision-Language-Action ModelsWhen Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action ModelsCompressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic ManipulationAVA-VLA: Improving Vision-Language-Action models with Active Visual AttentionMAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action GeneralizationE0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete DiffusionOn Robustness of Vision-Language-Action Model against Multi-Modal PerturbationsHAMLET: Switch your Vision-Language-Action Model into a History-Aware PolicyVITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert DistillationDepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial ReasoningMetavla: Unified Meta Co-training For Efficient Embodied AdaptionVLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic ManipulationLatent Action Pretraining Through World ModelingSimpleVLA-RL: Scaling VLA Training via Reinforcement LearningFocusing on What Matters: Object-Agent-centric Tokenization for Vision Language Action modelsdVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-ThoughtDiscrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action PoliciesCogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & SparsificationUnified Vision-Language-Action ModelVLA-0: Building State-of-the-art Vlas With Zero ModificationTTF-VLA: Temporal Token Fusion Via Pixel-attention Integration For Vision-language-action ModelsAtomic Action Slicing: Planner-aligned Options For Generalist VLA AgentsCross-platform Scaling Of Vision-language-action Models From Edge To Cloud GpusContinually Evolving Skill Knowledge In Vision Language Action ModelSelf-improving Vision-language-action Models With Data Generation Via Residual RLDropvla: An Action-level Backdoor Attack On Vision-language-action ModelsDiscover, Learn, And Reinforce: Scaling Vision-language-action Pretraining With Diverse Rl-generated TrajectoriesGoal-oriented Backdoor Attack Against Vision-language-action Models Via Physical ObjectsMasked Generative Policy For Robotic Control3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen TasksThink Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action ModelsVLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token CachingM2Distill: Multi-Modal Distillation for Lifelong Imitation Learning