
Les spécialistes de la division Apple Machine Learning Research ont publié un travail consacré à l'étude des méthodes de codage positionnel dans les transformateurs traitant des jetons issus d'un ensemble d'images avec des paramètres de capture connus. Les auteurs soulignent que les schémas existants de codage absolu ou relatif ne répondent pas aux exigences clés : l'unicité du codage des patchs, l'invariance de l'attention aux transformations SE(3) avec une similarité multi-échelle et l'adaptabilité à la géométrie de la scène.
Pour résoudre les problèmes identifiés, les chercheurs ont présenté une nouvelle approche appelée RayRoPE (Projective Ray Positional Encoding). Ce mécanisme a été conçu spécifiquement pour combler une lacune dans les technologies d'attention multi-vues, permettant aux modèles de prendre plus efficacement en compte les relations spatiales entre les différents angles de vue d'une même scène.
Le développement vise à créer un système capable de coder de manière unique les fragments d'image et de réagir avec souplesse aux changements de géométrie de l'espace environnant. La solution proposée est présentée comme une réponse aux limitations des méthodes précédentes, qui n'ont pas réussi à assurer simultanément toutes les propriétés nécessaires pour un traitement de qualité des données multi-vues.
commentaire éditorial
Pourquoi c’est important
La conséquence la plus probable sera l'intégration de telles méthodes d'architecture de transformateurs dans les futures versions des frameworks de vision par ordinateur. Le prochain signal observable à surveiller devrait être l'apparition de rapports techniques avec des benchmarks ou la mention de la technologie dans le contexte des mises à jour des outils pour les développeurs AR/VR. La principale incertitude réside dans le degré de préparation de la technologie pour un déploiement industriel et sa compatibilité avec le matériel actuel des appareils mobiles.