R-2R
Emerging32papers using it
2019first seen
The 'R-2R' dataset is a benchmark used to evaluate Vision-and-Language Navigation (VLN) systems, containing diverse trajectories and instructions derived from real-world indoor environments.
Papers using R-2R (32)
- PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation
for Vision-and-Language NavigationTagaVLM: Topology-Aware Global Action Reasoning for Vision-Language NavigationProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language NavigationImplicit Geometry Representations for Vision-and-Language Navigation from Web VideosTrajectory-Diversity-Driven Robust Vision-and-Language NavigationBeyond Textual Knowledge-Leveraging Multimodal Knowledge Bases for Enhancing Vision-and-Language NavigationWhen and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial ReasoningpFedNavi: Structure-Aware Personalized Federated Vision-Language Navigation for Embodied AIEnhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour VideosVision-and-Language Navigation with Analogical Textual Descriptions in LLMsThink Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion
and Reasoning for Vision-and-Language NavigationFine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language NavigationGeneral Scene Adaptation for Vision-and-Language NavigationA Recurrent Vision-and-Language BERT for NavigationVision-and-Language Navigation via Causal LearningHistory Aware Multimodal Transformer for Vision-and-Language NavigationThe Road to Know-Where: An Object-and-Room Informed Sequential BERT for
Indoor Vision-Language NavigationHOP: History-and-Order Aware Pre-training for Vision-and-Language
NavigationNeighbor-view Enhanced Model for Vision and Language NavigationLocal Slot Attention for Vision-and-Language NavigationESceme: Vision-and-Language Navigation with Episodic Scene MemoryMultimodal Attention Networks for Low-Level Vision-and-Language
NavigationVLN-PETL: Parameter-Efficient Transfer Learning for Vision-and-Language
NavigationPrompt-based Context- and Domain-aware Pretraining for Vision and
Language NavigationDAP: Domain-aware Prompt Learning for Vision-and-Language NavigationNavHint: Vision and Language Navigation Agent with a Hint GeneratorCausality-based Cross-Modal Representation Learning for
Vision-and-Language NavigationDELAN: Dual-Level Alignment for Vision-and-Language Navigation by
Cross-Modal Contrastive LearningWhy Only Text: Empowering Vision-and-Language Navigation with
Multi-modal PromptsSeeing is Believing? Enhancing Vision-Language Navigation using Visual
PerturbationsNAVCON: A Cognitively Inspired and Linguistically Grounded Corpus for
Vision and Language NavigationMAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for
Effective-and-Efficient Vision-and-Language Navigation