
Специалисты подразделения Apple Machine Learning Research опубликовали работу, в которой констатируют ограниченную способность современных языково-визуальных моделей (VLM) рассуждать исключительно на основе визуальной информации. Несмотря на умение следовать сложным текстовым инструкциям, текущие системы не могут корректно выявлять общие концепции из наборов примеров изображений и применять их к новым входным данным.
В ответ на эту проблему исследователи представили новую оценочную задачу под названием Visual Concept Inference from Sets (VICIS). Суть методики заключается в предоставлении модели небольшого контекстного набора изображений, объединенных общей идеей, и целевого запроса. От системы требуется генерация новых изображений, которые сохраняют концепцию, определенную контекстным набором, оставаясь при этом согласованными с запросом.
Данная инициатива направлена на заполнение пробела в оценке искусственного интеллекта, смещая фокус с текстового понимания на纯视觉ное логическое мышление. Внедрение задачи VICIS позволит точнее измерять прогресс моделей в области абстрактного визуального обобщения без опоры на текстовые подсказки.
комментарий редакции
Что это значит
Ожидается, что задача VICIS станет новым отраслевым стандартом для тестирования визуального интеллекта, что стимулирует разработку архитектур, менее зависимых от текстовых якорей. Следующим наблюдаемым сигналом станет появление отчетов о результатах тестирования ведущих моделей на этом бенчмарке. Основной неопределенностью остается скорость, с которой исследователи смогут преодолеть фундаментальные ограничения текущих подходов к обучению на изображениях.