R-2R
Emerging14papers using it
2024first seen
The 'R-2R' dataset/benchmark contains navigation tasks that require agents to follow natural language instructions in photo-realistic environments and is used to evaluate the robustness and effectiveness of vision-and-language navigation methods.
Papers using R-2R (14)
- Language and Planning in Robotic Navigation: A Multilingual Evaluation of State-of-the-Art ModelsImplicit Geometry Representations for Vision-and-Language Navigation from Web VideosTrajectory-Diversity-Driven Robust Vision-and-Language NavigationDoes Peer Observation Help? Vision-Sharing Collaboration for Vision-Language NavigationStructured Observation Language for Efficient and Generalizable Vision-Language NavigationGlobal Commander and Local Operative: A Dual-Agent Framework for Scene NavigationDV-VLN: Dual Verification for Reliable LLM-Based Vision-and-Language NavigationETP-R1: Evolving Topological Planning with Reinforcement Fine-tuning for Vision-Language Navigation in Continuous EnvironmentsVision-and-Language Navigation with Analogical Textual Descriptions in LLMsLandmark-Guided Knowledge for Vision-and-Language NavigationCoNav: Collaborative Cross-Modal Reasoning for Embodied NavigationThink Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion
and Reasoning for Vision-and-Language NavigationFine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language NavigationRoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied
Navigation