
Компания OpenAI разработала специализированную языковую модель под названием GPT-Red, которая выступает в роли сверххакера. Эта система используется как спарринг-партнер для тестирования и укрепления защиты других моделей компании от кибератак. Метод предполагает постоянное противостояние, где одна система пытается найти уязвимости, а другая учится их устранять.
На прошлой неделе организация представила обновленную версию своего флагманского продукта — GPT-5.6. Согласно заявлению OpenAI, именно процесс обучения в ходе противостояния с GPT-Red позволил сделать этот релиз наиболее надежным и защищенным среди всех предыдущих версий.
Информация об этой разработке была опубликована в отчете MIT Technology Review AI. В материале подчеркивается, что использование агрессивной модели-тренажера стало ключевым фактором повышения робастности нового программного обеспечения.
комментарий редакции
Что это значит
Если методика оправдает себя, другие крупные игроки рынка могут последовать этому примеру, создавая собственные пары моделей «защитник-нападающий». Следующим наблюдаемым сигналом станет появление аналогичных инструментов у конкурентов или публикация более детальных технических отчетов об эффективности GPT-Red. Основную неопределенность составляет риск того, что подобные инструменты могут быть адаптированы злоумышленниками для создания более совершенных вирусов.