CVDN
Emerging8papers using it
2020first seen
The CVDN dataset/benchmark is used to evaluate vision-and-language navigation tasks that involve navigating real-world scenes based on dialogue instructions.
Papers using CVDN (8)
- PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation
for Vision-and-Language NavigationImplicit Geometry Representations for Vision-and-Language Navigation from Web VideosHistory Aware Multimodal Transformer for Vision-and-Language NavigationVision-Dialog Navigation by Exploring Cross-modal MemoryESceme: Vision-and-Language Navigation with Episodic Scene MemoryGrounded Entity-Landmark Adaptive Pre-training for Vision-and-Language
NavigationDELAN: Dual-Level Alignment for Vision-and-Language Navigation by
Cross-Modal Contrastive LearningWhy Only Text: Empowering Vision-and-Language Navigation with
Multi-modal Prompts