nuScenes
Emerging36papers using it
2024first seen
The 'nuScenes' dataset is a comprehensive benchmark for autonomous driving that contains diverse sensor data and annotations from real-world driving scenarios, used to evaluate the performance of perception and planning algorithms in complex environments.
Papers using nuScenes (36)
- SOLVE: Synergy Of Language-vision And End-to-end Networks For Autonomous DrivingImpromptu VLA: Open Weights And Open Data For Driving Vision-language-action ModelsEmbodied Scene Understanding for Vision Language Models via MetaVQAOpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action ModelCarscenes: Semantic VLM Dataset For Safe Autonomous DrivingLearning Vision-Language-Action World Models for Autonomous DrivingOneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action ModelsSAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous DrivingNatural Language Instructions for Scene-Responsive Human-in-the-Loop Motion Planning in Autonomous Driving using Vision-Language-Action ModelsDriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous DrivingEfficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action DiffusionMindDriver: Introducing Progressive Multimodal Reasoning for Autonomous DrivingSparseOccVLA: Bridging Occupancy and Vision-Language Models via Sparse Queries for Unified 4D Scene Understanding and PlanningListen, Look, Drive: Coupling Audio Instructions for User-aware VLA-based Autonomous DrivingdVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable ReasoningColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous DrivingCoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous DrivingA Low-rank Method For Vision Language Model Hallucination Mitigation In Autonomous DrivingLess Is More: Lean Yet Powerful Vision-language Model For Autonomous DrivingBEV-VLM: Trajectory Planning Via Unified BEV AbstractionKEPT: Knowledge-enhanced Prediction Of Trajectories From Consecutive Driving Frames With Vision-language ModelsGoal-based Vision-language DrivingDriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid ThinkingAutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-TuningStsbench: A Spatio-temporal Scenario Benchmark For Multi-modal Large Language Models In Autonomous DrivingNurisk: A Visual Question Answering Dataset For Agent-level Risk Assessment In Autonomous DrivingGenesis: Multimodal Driving Scene Generation With Spatio-temporal And Cross-modal ConsistencyStructured Labeling Enables Faster Vision-language Models For End-to-end Autonomous DrivingLlavida: A Large Language Vision Driving Assistant For Explicit Reasoning And Enhanced Trajectory PlanningALN-P3: Unified Language Alignment For Perception, Prediction, And Planning In Autonomous DrivingMultimodal Framework For Explainable Autonomous Driving: Integrating Video, Sensor, And Textual Data For Enhanced Decision-making And TransparencyS4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual RepresentationRAD: Retrieval-Augmented Decision-Making of Meta-Actions with
Vision-Language Models in Autonomous DrivingDriveVLM: The Convergence of Autonomous Driving and Large
Vision-Language ModelsSenna: Bridging Large Vision-Language Models and End-to-End Autonomous
DrivingRAC3: Retrieval-Augmented Corner Case Comprehension for Autonomous Driving with Vision-Language Models