
Especialistas da divisão Apple Machine Learning Research publicaram um trabalho no qual constatam a capacidade limitada dos modernos modelos de linguagem-visão (VLM) de raciocinar exclusivamente com base em informações visuais. Apesar de serem capazes de seguir instruções textuais complexas, os sistemas atuais não conseguem identificar corretamente conceitos gerais a partir de conjuntos de exemplos de imagens e aplicá-los a novos dados de entrada.
Em resposta a esse problema, os pesquisadores apresentaram uma nova tarefa de avaliação chamada Visual Concept Inference from Sets (VICIS). A essência da metodologia consiste em fornecer ao modelo um pequeno conjunto contextual de imagens, unidas por uma ideia comum, e uma solicitação alvo. O sistema deve gerar novas imagens que preservem o conceito definido pelo conjunto contextual, permanecendo ao mesmo tempo consistentes com a solicitação.
Esta iniciativa visa preencher uma lacuna na avaliação da inteligência artificial, deslocando o foco da compreensão textual para o raciocínio lógico puramente visual. A implementação da tarefa VICIS permitirá medir com maior precisão o progresso dos modelos na área de generalização visual abstrata, sem depender de dicas textuais.
comentário editorial
Por que importa
Espera-se que a tarefa VICIS se torne um novo padrão da indústria para testar a inteligência visual, estimulando o desenvolvimento de arquiteturas menos dependentes de âncoras textuais. O próximo sinal observável será o surgimento de relatórios sobre os resultados de testes dos principais modelos neste benchmark. A principal incerteza permanece sendo a velocidade com que os pesquisadores conseguirão superar as limitações fundamentais das abordagens atuais de treinamento baseado em imagens.