
Les spécialistes de la division Apple Machine Learning Research ont publié un travail constatant la capacité limitée des modèles langage-vision (VLM) actuels à raisonner exclusivement sur la base d'informations visuelles. Malgré leur aptitude à suivre des instructions textuelles complexes, les systèmes actuels ne parviennent pas à identifier correctement les concepts communs à partir d'ensembles d'exemples d'images et à les appliquer à de nouvelles données d'entrée.
En réponse à ce problème, les chercheurs ont présenté une nouvelle tâche d'évaluation intitulée Visual Concept Inference from Sets (VICIS). Le principe de la méthode consiste à fournir au modèle un petit ensemble contextuel d'images partageant une idée commune, ainsi qu'une requête cible. Le système doit générer de nouvelles images qui préservent le concept défini par l'ensemble contextuel tout en restant cohérentes avec la requête.
Cette initiative vise à combler une lacune dans l'évaluation de l'intelligence artificielle, en déplaçant l'accent de la compréhension textuelle vers le raisonnement logique purement visuel. La mise en œuvre de la tâche VICIS permettra de mesurer plus précisément les progrès des modèles dans le domaine de la généralisation visuelle abstraite, sans s'appuyer sur des indices textuels.
commentaire éditorial
Pourquoi c’est important
Il est attendu que la tâche VICIS devienne une nouvelle norme industrielle pour tester l'intelligence visuelle, stimulant ainsi le développement d'architectures moins dépendantes des ancres textuelles. Le prochain signal observable sera l'apparition de rapports sur les résultats des tests des principaux modèles sur ce benchmark. La principale incertitude demeure la vitesse à laquelle les chercheurs pourront surmonter les limitations fondamentales des approches actuelles d'apprentissage sur images.