COCO
Canonical46papers using it
2017first seen
Common Objects in Context — 330k images with object-detection, segmentation, keypoint, and captioning annotations.
Papers using COCO (46)
- Stable Diffusion for Data Augmentation in COCO and Weed DatasetsU-Shape Mamba: State Space Model for faster diffusionDRiffusion: Draft-and-Refine Process Parallelizes Diffusion Models with EaseDiffusion Is Your Friend in Show, Suggest and TellAdapting Self-Supervised Representations as a Latent Space for Efficient GenerationLatent Denoising Makes Good TokenizersCost-Aware Routing for Efficient Text-To-Image GenerationDiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion ModelingDIVE: Inverting Conditional Diffusion Models for Discriminative TasksDeeply Supervised Flow-Based Generative ModelsSelf-Corrected Flow Distillation for Consistent One-Step and Few-Step Text-to-Image GenerationAttnGAN: Fine-Grained Text to Image Generation with Attentional
Generative Adversarial NetworksA Variational U-Net for Conditional Appearance and Shape GenerationDiffEdit: Diffusion-based semantic image editing with mask guidanceInstanceDiffusion: Instance-level Control for Image GenerationObject-driven Text-to-Image Synthesis via Adversarial TrainingDistilling Diffusion Models into Conditional GANsFA-GAN: Feature-Aware GAN for Text to Image SynthesisImproving Diffusion-Based Image Synthesis with Context PredictionAll are Worth Words: A ViT Backbone for Diffusion ModelsLafite2: Few-shot Text-to-Image GenerationShape-Guided Diffusion with Inside-Outside AttentionCPGAN: Full-Spectrum Content-Parsing Generative Adversarial Networks for
Text-to-Image SynthesisFrido: Feature Pyramid Diffusion for Complex Scene Image SynthesisGLIGEN: Open-Set Grounded Text-to-Image GenerationA Simple Latent Diffusion Approach for Panoptic Segmentation and Mask
InpaintingCondition-Aware Neural Network for Controlled Image GenerationCAGAN: Text-To-Image Generation with Combined Attention GANsEDICT: Exact Diffusion Inversion via Coupled TransformationsTF-ICON: Diffusion-Based Training-Free Cross-Domain Image CompositionERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model with
Knowledge-Enhanced Mixture-of-Denoising-ExpertsShifted Diffusion for Text-to-image GenerationDAFT-GAN: Dual Affine Transformation Generative Adversarial Network for
Text-Guided Image InpaintingPCGAN: Partition-Controlled Human Image GenerationAdversarial Synthesis of Human Pose from TextTR0N: Translator Networks for 0-Shot Plug-and-Play Conditional
GenerationAre Diffusion Models Vision-And-Language Reasoners?Efficient Multimodal Diffusion Models Using Joint Data Infilling with
Partially Shared U-NetObjBlur: A Curriculum Learning Approach With Progressive Object-Level
Blurring for Improved Layout-to-Image GenerationLocRef-Diffusion:Tuning-Free Layout and Appearance-Guided GenerationSwinv2-Imagen: Hierarchical Vision Transformer Diffusion Models for
Text-to-Image GenerationBK-SDM: A Lightweight, Fast, and Cheap Version of Stable DiffusionLocalizing and Editing Knowledge in Text-to-Image Generative ModelsDP-RDM: Adapting Diffusion Models to Private Domains Without Fine-TuningLaDiC: Are Diffusion Models Really Inferior to Autoregressive
Counterparts for Image-to-Text Generation?LocInv: Localization-aware Inversion for Text-Guided Image Editing