Définition
CLIP (Contrastive Language-Image Pre-training) est un réseau neuronal développé par OpenAI qui traite les données d'image et de texte dans un espace vectoriel commun et apprend directement les concepts visuels via le langage naturel.
Explication
Les modèles de vision par ordinateur classiques nécessitent généralement des jeux de données d'images pré-classifiés avec des catégories rigides. CLIP, en revanche, utilise une méthode d'apprentissage contrastif et a été entraîné sur des centaines de millions de paires image-texte provenant d'Internet, lui permettant d'apprendre quelles phrases textuelles correspondent à quels contenus visuels. Cela confère à CLIP la capacité de classification dite "zero-shot" : il peut classer précisément des images qu'il n'a jamais vues pendant son entraînement, en mesurant simplement la similarité sémantique avec le texte fourni. CLIP constitue la base technologique des générateurs d'images modernes tels que DALL-E ou Stable Diffusion, ainsi que des systèmes de recherche multimodaux avancés. Dans les solutions B2B et SaaS, le modèle est principalement utilisé pour la recherche d'images intelligente, le balisage automatique (auto-tagging) et la classification de vastes collections de médias non structurés.dealcode Sales AIBereit für automatisierte B2B-Prozesse?
dealcode automatisiert die administrative Arbeit Ihres Vertriebs- & Marketingteams. Nutzen Sie künstliche Intelligenz für präzise Kontaktrecherche und nahtlose CRM-Pflege.