Awesome Speech Audio
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Rongrong Ji — most-cited papers & profile · Speech Audio
← authors
·
overview
Rongrong Ji
22
papers ·
2
citations ·
88
h-index
Xiamen University · Soochow University · Hubei University of Technology
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
2025 · 1 citations
What You Perceive Is What You Conceive: A Cognition-Inspired Framework for Open Vocabulary Image Segmentation
2025 · 1 citations
Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models
2026
A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation
2026
Omni-Referring Image Segmentation
2025
Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval
2025
UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
2025
UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
2025
DeOcc-1-to-3: 3D De-Occlusion from a Single Image via Self-Supervised Multi-View Diffusion
2025
LTD-Bench: Evaluating Large Language Models by Letting Them Draw
2025
Grounded Chain-of-Thought for Multimodal Large Language Models
2025
Hadamard Matrix Guided Online Hashing
2019
Supervised Online Hashing via Similarity Distribution Learning
2019
Towards Language-guided Visual Recognition via Dynamic Convolutions
2021
Towards Language-guided Visual Recognition via Dynamic Convolutions
2021
Topics
Vision-Language
Model Architecture
Efficiency
cs.CV
Evaluation
Vision-Language Models
Benchmarks
Training Techniques
Visual Language
Video-Language