
Especialistas da divisão Apple Machine Learning Research publicaram um trabalho dedicado ao estudo de métodos de codificação posicional em transformadores que processam tokens de um conjunto de imagens com parâmetros de captura conhecidos. Os autores observam que os esquemas existentes de codificação absoluta ou relativa não atendem aos requisitos fundamentais: unicidade da codificação de patches, invariância de atenção a transformações SE(3) com similaridade multiescala e adaptabilidade à geometria da cena.
Para resolver os problemas identificados, os pesquisadores apresentaram uma nova abordagem chamada RayRoPE (Projective Ray Positional Encoding). Este mecanismo foi desenvolvido especificamente para preencher a lacuna nas tecnologias de atenção multivisão, permitindo que os modelos considerem de forma mais eficaz as relações espaciais entre diferentes perspectivas de uma mesma cena.
O desenvolvimento visa criar um sistema capaz de codificar exclusivamente fragmentos de imagem e responder flexivelmente a mudanças na geometria do espaço circundante. A solução proposta é posicionada como uma resposta às limitações dos métodos anteriores, que não conseguiram garantir simultaneamente todas as propriedades necessárias para o processamento de qualidade de dados multivisão.
comentário editorial
Por que importa
A consequência mais provável será a integração de métodos semelhantes de arquitetura de transformadores em futuras versões de frameworks para visão computacional. O próximo sinal observável deve ser o aparecimento de relatórios técnicos com benchmarks ou a menção da tecnologia no contexto de atualizações de ferramentas para desenvolvedores de AR/VR. A principal incerteza reside no grau de prontidão da tecnologia para implantação industrial e sua compatibilidade com o hardware atual de dispositivos móveis.