Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Wenzhao Zheng — most-cited papers & profile · Multimodal
← authors
·
overview
Wenzhao Zheng
19
papers ·
6
citations ·
17
h-index
Berkeley College · University of California, Berkeley · Tsinghua University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving
2023 · 5 citations
OPERA: Omni-Supervised Representation Learning with Hierarchical Supervisions
2022 · 1 citations
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
2026
TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation
2026
SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
2025
RoboArmGS: High-Quality Robotic Arm Splatting via Bézier Curve Refinement
2025
Latent Diffusion Model without Variational Autoencoder
2025
Geodrive: 3D Geometry-informed Driving World Model With Precise Action Control
2025
EmbodiedOcc++: Boosting Embodied 3D Occupancy Prediction with Plane Regularization and Uncertainty Sampler
2025
DiffMoE: Dynamic Token Selection for Scalable Diffusion Transformers
2025
Segment Any Motion in Videos
2025
A Simple Baseline for Multi-Camera 3D Object Detection
2022
Token-Label Alignment for Vision Transformers
2022
EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding
2024
Training-free Regional Prompting for Diffusion Transformers
2024
Topics
Navigation
Perception
Control
Diffusion Models
Segmentation
Object Detection
3D Vision
Manipulation
Sim-to-Real
Text-to-Image