
Según The Decoder, OpenAI evalúa el próximo modelo Astra como el primer sistema de la compañía con capacidades cibernéticas «críticas». Para su control, OpenAI planea monitorear la cadena de razonamiento del modelo.
El problema descrito en el resumen de la publicación es que la observación de la cadena de razonamiento ya se considera un reflejo poco fiable de las decisiones reales del modelo. Según The Decoder, la nueva arquitectura de Astra hace que una parte aún mayor del razonamiento sea inaccesible para su lectura.
Esto implica un posible debilitamiento del control simultáneo al aumento de las capacidades del sistema. Sin embargo, los materiales presentados contienen solo un sinopsis de metadatos, no el texto completo de la publicación ni una confirmación independiente, por lo que los detalles del enfoque de OpenAI y la magnitud del riesgo permanecen poco claros.
comentario editorial
Por qué importa
La consecuencia probable es que la verificación de seguridad de Astra pueda depender más de métodos que no se reduzcan a leer la cadena de razonamiento. La señal observable más cercana son las explicaciones públicas de OpenAI sobre el estado del modelo, los criterios de capacidades cibernéticas «críticas» y las medidas de control adicionales. Existe una incertidumbre sustancial relacionada con el hecho de que solo se dispone de un relato de metadatos de The Decoder sin una declaración primaria de OpenAI ni una publicación completa.