← all datasets

CLIP

Emerging
15papers using it
2023first seen

CLIP (Contrastive Language-Image Pretraining) is a dataset and model that contains paired images and text, used to evaluate multimodal alignment and preferences in vision-language tasks.

Papers using CLIP (15)

CLIP dataset β€” papers, benchmarks & downloads Β· Multimodal