SimplerEnv
Emerging26papers using it
2025first seen
'SimplerEnv' is a simulation benchmark used to evaluate continuous-action vision-language-action models in various settings, including standard, few-shot, and noisy conditions.
Papers using SimplerEnv (26)
- VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent AlignmentS$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon ManipulationOA-WAM: Object-Addressable World Action Model for Robust Robot ManipulationFrameSkip: Learning from Fewer but More Informative Frames in VLA TrainingIntentVLA: Short-Horizon Intent Modeling for Aliased Robot ManipulationPhysBrain 1.0 Technical ReportSpatial Memory for Out-of-Vision Manipulation in Vision-Language-ActionStarVLA: A Lego-like Codebase for Vision-Language-Action Model DevelopingStarVLA-$\alpha$: Reducing Complexity in Vision-Language-Action SystemsDisentangled Robot Learning via Separate Forward and Inverse Dynamics PretrainingReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-TuningOFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic ManipulationEfficient Long-Horizon Vision-Language-Action Models via Static-Dynamic DisentanglementReshaping Action Error Distributions for Reliable Vision-Language-Action ModelsST4VLA: Spatially Guided Training for Vision-Language-Action ModelsTwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-TransformersSTARE-VLA: Progressive Stage-Aware Reinforcement for Fine-Tuning Vision-Language-Action ModelsSTORM: Search-Guided Generative World Models for Robotic ManipulationUnifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action GenerationManiAgent: An Agentic Framework for General Robotic ManipulationEmbodied-R1: Reinforced Embodied Reasoning for General Robotic ManipulationInstructVLA: Vision-Language-Action Instruction Tuning from Understanding to ManipulationCronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action ModelingTTF-VLA: Temporal Token Fusion Via Pixel-attention Integration For Vision-language-action ModelsFrom Seeing to Doing: Bridging Reasoning and Decision for Robotic ManipulationReBot: Scaling Robot Learning with Real-to-Sim-to-Real Robotic Video Synthesis