Awesome Computer Vision
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Haodong Duan — most-cited papers & profile · Computer Vision
← authors
·
overview
Haodong Duan
28
papers ·
41
citations ·
18
h-index
Chinese University of Hong Kong
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
2024 · 33 citations
Intern-S1: A Scientific Multimodal Foundation Model
2025 · 5 citations
InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD
2024 · 2 citations
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
2025 · 1 citations
Intern-S1: A Scientific Multimodal Foundation Model
2025
SPARK: Synergistic Policy And Reward Co-Evolving Framework
2025
Visual Agentic Reinforcement Fine-Tuning
2025
OPT-BENCH: Evaluating LLM Agent on Large-Scale Search Spaces Optimization Problems
2025
BoostStep: Boosting mathematical capability of Large Language Models via improved single-step reasoning
2025
Redundancy Principles for MLLMs Benchmarks
2025
OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference
2025
Visual-RFT: Visual Reinforcement Fine-Tuning
2025
MM-IFEngine: Towards Multimodal Instruction Following
2025
InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
2025
MM-IFEngine: Towards Multimodal Instruction Following
2025
Topics
Evaluation
Fine-Tuning
Vision-Language
Training Techniques
Optimization
Large
Benchmarks
In-Context Learning
Efficiency
Supervised