
Специалисты подразделения Apple Machine Learning Research опубликовали работу, посвященную изучению методов кодирования позиций в трансформерах, обрабатывающих токены из набора изображений с известными параметрами съемки. Авторы отмечают, что существующие схемы абсолютного или относительного кодирования не отвечают ключевым требованиям: уникальности кодирования патчей, инвариантности внимания к преобразованиям SE(3) с многомасштабным сходством и адаптивности к геометрии сцены.
Для решения выявленных проблем исследователи представили новый подход под названием RayRoPE (Projective Ray Positional Encoding). Этот механизм разработан специально для заполнения пробела в технологиях многовидового внимания, позволяя моделям эффективнее учитывать пространственные взаимосвязи между различными ракурсами одной сцены.
Разработка направлена на создание системы, которая может уникально кодировать фрагменты изображения и гибко реагировать на изменения геометрии окружающего пространства. Предложенное решение позиционируется как ответ на ограничения предыдущих методов, которые не смогли одновременно обеспечить все необходимые свойства для качественной обработки многовидовых данных.
комментарий редакции
Что это значит
Наиболее вероятным следствием станет интеграция подобных методов архитектуры трансформеров в будущие версии фреймворков для компьютерного зрения. Следующим наблюдаемым сигналом следует считать появление технических отчетов с бенчмарками или упоминание технологии в контексте обновлений инструментов для разработчиков AR/VR. Основную неопределенность составляет степень готовности технологии к промышленному развертыванию и ее совместимость с текущим аппаратным обеспечением мобильных устройств.