Awesome Generative Models
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Jifeng Dai — most-cited papers & profile · Generative Models
← authors
·
overview
Jifeng Dai
22
papers ·
8
citations ·
53
h-index
Tsinghua University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
2024 · 5 citations
CooHOI: Learning Cooperative Human-Object Interaction with Manipulated Object Dynamics
2024 · 3 citations
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
2025
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
2025
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
2025
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
2025
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
2025
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
2025
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
2025
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
2025
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
2025
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
2025
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
2025
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
2025
LangBridge: Interpreting Image as a Combination of Language Embeddings
2025
Topics
Vision-Language Models
Benchmarks
Manipulation
Video-Language
Visual QA & Reasoning
Control
Instruction Tuning
Navigation
Embodied & Agents
Perception