ImageNet
Emerging32papers using it
2019first seen
ImageNet-R This repo is made to facilitate the evaluation of various pretraining models. It's constructed from the source file provided by official implementation. Usage from datasets import load_dataset dataset = load_dataset('axiong/imagenet-r') Dataset Summary ImageNet-R(endition) contains art, cartoons, deviantart,
Papers using ImageNet (32)
- DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual VocabulariesA Vision-language Foundation Model For Leaf Disease IdentificationDual Distribution Estimation for Zero-shot Noisy Test-Time Adaptation with VLMsHow Well Does Gpt-4o Understand Vision? Evaluating Multimodal Foundation Models On Standard Computer Vision TasksMajorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific ShiftMind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMsDREAM: Where Visual Understanding Meets Text-to-Image GenerationDEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language ModelsAdaptive Debiasing Tsallis Entropy for Test-Time AdaptationBreaking the Limits of Open-Weight CLIP: An Optimization Framework for Self-supervised Fine-tuning of CLIPRL makes MLLMs see better than SFTQ-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal AdaptationDynamic Multimodal Prototype Learning in Vision-Language ModelsLarge Language Models Facilitate Vision Reflection In Image ClassificationBenchmarking Attribute Discrimination In Infant-scale Vision-language ModelsREAR: Rethinking Visual Autoregressive Models Via Generator-tokenizer Consistency RegularizationData Or Language Supervision: What Makes CLIP Better Than DINO?DRIP: Dynamic Patch Reduction Via Interpretable PoolingLine Of Sight: On Linear Representations In VllmsAre Vision Language Models Robust To Uncertain Inputs?Omnisegmentor: A Flexible Multi-modal Learning Framework For Semantic SegmentationHeptapod: Language Modeling On Visual SignalsModel alignment using inter-modal bridgesBetter Language Models Exhibit Higher Visual AlignmentImage as a Foreign Language: BEiT Pretraining for All Vision and
Vision-Language TasksONE-PEACE: Exploring One General Representation Model Toward Unlimited
ModalitiesMaking the Most of What You Have: Adapting Pre-trained Visual Language
Models in the Low-data RegimeOn the Generalization of Multi-modal Contrastive LearningUni-NLX: Unifying Textual Explanations for Vision and Vision-Language
TasksObjectCompose: Evaluating Resilience of Vision-Based Models on
Object-to-Background Compositional ChangesHarnessing Frozen Unimodal Encoders for Flexible Multimodal AlignmentViCo: Word Embeddings from Visual Co-occurrences