De acordo com a The Decoder, a OpenAI avalia o próximo modelo Astra como o primeiro sistema da empresa com capacidades cibernéticas "críticas". Para controle, a OpenAI planeja monitorar a cadeia de raciocínio do modelo.

O problema descrito no resumo da publicação é que a observação da cadeia de raciocínio já é considerada um reflexo não confiável das decisões reais do modelo. Segundo a The Decoder, a nova arquitetura da Astra torna uma parte ainda maior do raciocínio inacessível à leitura.

Isso significa um possível enfraquecimento do controle simultaneamente ao aumento das capacidades do sistema. No entanto, os materiais apresentados contêm apenas um sinopse de metadados, e não o texto completo da publicação ou confirmação independente, portanto, os detalhes da abordagem da OpenAI e a escala do risco permanecem pouco claros.