ImageNet
Canonical55papers using it
9,123HF downloads
2HF likes
2016first seen
~1.28M labeled images across 1,000 categories (ILSVRC) — the standard large-scale image-classification benchmark.
Papers using ImageNet (55)
- Classifier-agnostic Saliency Map ExtractionSoft Mixture-of-Recursions: Going Deeper with Recursive Vision TransformersDnA: Denoising Attention for Visual TasksFusion: A Framework for Unified Sequential Token AdaptatIon in VisiOn TraNsformersRethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware PerspectiveGradient-Skipping Relevance Propagation for Efficient Explainability of Vision TransformersInhibited Self-Attention: Sharpening Focus in Vision TransformersAchieving 3D Attention via Triplet Squeeze and Excitation BlockOCT Data is All You Need: How Vision Transformers with and without Pre-training Benefit ImagingBeyond Pixels: Enhancing LIME with Hierarchical Features and Segmentation Foundation ModelsEnd-to-End Autoregressive Image Generation with 1D Semantic TokenizerWhat-Where Transformer: A Slot-Centric Visual Backbone for Concurrent Representation and LocalizationNormalizing Flows with Iterative DenoisingWhat Helps---and What Hurts: Bidirectional Explanations for Vision TransformersLatent Forcing: Reordering the Diffusion Trajectory for Pixel-Space Image GenerationLe-DETR: Revisiting Real-Time Detection Transformer with Efficient Encoder DesignTriLite: Efficient Weakly Supervised Object Localization with Universal Visual Features and Tri-Region DisentanglementRAViT: Resolution-Adaptive Vision TransformerDSeq-JEPA: Discriminative Sequential Joint-Embedding Predictive ArchitectureEnhancing Transformer-Based Vision Models: Addressing Feature Map Anomalies Through Novel Optimization StrategiesHiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion ModelsConceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction DetectionIwin Transformer: Hierarchical Vision Transformer using Interleaved WindowsQuick Bypass Mechanism of Zero-Shot Diffusion-Based Image RestorationVision Foundation Models as Effective Visual Tokenizers for Autoregressive Image GenerationExploring Superposition and Interference in State-of-the-Art Low-Parameter Vision ModelsObject-level Self-Distillation for Vision PretrainingMultiple Object Stitching for Unsupervised Representation LearningImage Recognition with Online Lightweight Vision Transformer: A SurveyD-Feat Occlusions: Diffusion Features for Robustness to Partial Visual
Occlusions in Object RecognitionReconciling Stochastic and Deterministic Strategies for Zero-shot Image Restoration using Diffusion Model in DualAn Attention Free TransformerDecomposeme: Simplifying Convnets For End-to-end LearningOn The Surprising Effectiveness Of Attention Transfer For Vision Transformers'part'ly First Among Equals: Semantic Part-based Benchmarking For State-of-the-art Object Recognition SystemsEfficient Self-supervised Vision Transformers for Representation
LearningConv2Former: A Simple Transformer-Style ConvNet for Visual RecognitionUnderstanding The Robustness in Vision TransformersEfficient Visual Pretraining with Contrastive DetectionMViTv2: Improved Multiscale Vision Transformers for Classification and
DetectionFinding an Unsupervised Image Segmenter in Each of Your Deep Generative
ModelsScaling Vision TransformersA Unified View of Masked Image ModelingDecoder Denoising Pretraining for Semantic SegmentationUnderstanding Gaussian Attention Bias of Vision Transformers Using
Effective Receptive FieldsExploring the Limits of Deep Image Clustering using Pretrained ModelsPixel ObjectnessSemi-Supervised Vision TransformersOVO: One-shot Vision Transformer Search with Online distillationPatch Is Not All You NeedMultistep Distillation of Diffusion Models via Moment MatchingImproving Visual Representation Learning through Perceptual
UnderstandingDenseDINO: Boosting Dense Self-Supervised Learning with Token-Based
Point-Level ConsistencyAFIDAF: Alternating Fourier and Image Domain Adaptive Filters as an
Efficient Alternative to Attention in ViTsCRAFT Objects from Images