RoboTwin
Emerging7papers using it
2025first seen
The 'RoboTwin' dataset/benchmark contains diverse robot data used to evaluate the performance of Vision-Language-Action models in unifying perception, language, and control for task execution.
Papers using RoboTwin (7)
- X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action PretrainingTowards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action ModelsVLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action ModelsROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action ModelsHALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought ReasoningEvo-1: Lightweight Vision-Language-Action Model with Preserved Semantic AlignmentLight Future: Multimodal Action Frame Prediction Via Instructpix2pix