ImageNet-1k
Emerging18papers using it
2021first seen
Dataset Card for ImageNet Dataset Summary ILSVRC 2012, commonly known as 'ImageNet' is an image dataset organized according to the WordNet hierarchy. Each meaningful concept in WordNet, possibly described by multiple words or word phrases, is called a "synonym set" or "synset". There are more than 100,000 synsets in Wo
Papers using ImageNet-1k (18)
- Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware InferenceImmuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World TrustworthinessJEPA-T: Joint-embedding Predictive Architecture With Text Fusion For Image GenerationMultimodal Large Language Models as Image ClassifiersEvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and GenerationHigh-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion DecodingExplaining CLIP Zero-shot Predictions Through ConceptsKoo-Fu CLIP: Closed-Form Adaptation of Vision-Language Models via Fukunaga-Koontz Linear Discriminant AnalysisA Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion TransformersCross-modal Proxy Evolving for OOD Detection with Vision-Language ModelsVision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language ModelExplaining Similarity in Vision-Language Encoders with Weighted Banzhaf InteractionsViLU: Learning Vision-Language Uncertainties for Failure PredictionImage Recognition With Vision And Language Embeddings Of VlmsBeginning With You: Perceptual-initialization Improves Vision-language Representation And AlignmentTransferring Pre-trained Multimodal Representations with Cross-modal
Similarity MatchingCLIP-PING: Boosting Lightweight Vision-Language Models with Proximus
Intrinsic Neighbors GuidanceL-Verse: Bidirectional Generation Between Image and Text