Awesome AI Agents
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Xizhou Zhu — most-cited papers & profile · AI Agents
← authors
·
overview
Xizhou Zhu
29
papers ·
244
citations ·
28
h-index
Tsinghua University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
2024 · 230 citations
InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
2025 · 7 citations
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
2024 · 5 citations
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
2025 · 1 citations
DeciWatch: A Simple Baseline for 10x Efficient 2D and 3D Pose Estimation
2022 · 1 citations
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
2025
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
2025
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
2025
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
2025
InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
2025
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
2025
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
2025
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
2025
LangBridge: Interpreting Image as a Combination of Language Embeddings
2025
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
2025
Topics
Vision-Language
Training Techniques
Code
Model Architecture
Vision-Language Models
Visual QA & Reasoning
Efficiency
Fine-Tuning
RL
Evaluation