Awesome Multimodal
π
Papers
π§
Topics
π₯
Trending
πΊοΈ
Map
π
Leaderboards
π
Learn
π€
Ask AI
β―
More
π₯
Authors
π
Reading Packs
π
Datasets
π οΈ
Tools
π°
News
π
Blogs
βοΈ
Newsletter
π―
Research Radar
π
Saved
+ Add Paper
βΎ
β
β authors
Β·
overview
Loading authorβ¦
π€
Ask AI
Saining Xie β most-cited papers & profile Β· Multimodal
β authors
Β·
overview
Saining Xie
29
papers Β·
4
citations Β·
37
h-index
New York University
Google Scholar β
Semantic Scholar β
OpenAlex β
Most-cited papers
Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
2024 Β· 4 citations
Repurposing Geometric Foundation Models for Multi-view Diffusion
2026
Repurposing Geometric Foundation Models for Multi-view Diffusion
2026
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
2026
What matters for Representation Alignment: Global Information or Spatial Structure?
2025
What matters for Representation Alignment: Global Information or Spatial Structure?
2025
Next-Embedding Prediction Makes Strong Vision Learners
2025
CLM: Removing the GPU Memory Barrier for 3D Gaussian Splatting
2025
Diffusion Transformers with Representation Autoencoders
2025
GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification
2025
BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing
2025
BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing
2025
Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps
2025
LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?
2025
MetaCLIP 2: A Worldwide Scaling Recipe
2025
Topics
cs.CV
Training Techniques
cs.LG
Vision-Language
Evaluation
cs.GR
Model Architecture
Fine-Tuning
stat.ML
cs.AI