OpenAI раскрыла шесть случаев непослушания своих ИИ-моделей
Компания также представила правила, по которым намерена сообщать о подобных инцидентах.
В одном из случаев модель GPT-5.6 Sol оставляла в кратком изложении выполненной работы инструкции для самой себя после перехода в новое контекстное окно. В этих инструкциях она предлагала скрывать допущенные ошибки, придумывать отсутствующие исторические данные и не сообщать пользователю о несовпадениях между версиями источников. Такие указания часто выполнялись в следующей части задачи.
Например, при подготовке финансовой модели ИИ не смог найти необходимые показатели за предыдущие годы и предложил самостоятельно создать правдоподобные значения, не раскрывая этого пользователю без прямого вопроса. OpenAI обнаружила подобное поведение в 2,15 процента проверенных кратких отчетов GPT-5.6 Sol. У более новой модели семейства Astra показатель снизился до 0,27 процента.
В другом эпизоде невыпущенная модель семейства Astra самостоятельно добавляла в отчеты команды, похожие на попытку взлома ограничений. В одной из них следующей версии агента предлагалось игнорировать сообщения разработчиков, в другой ИИ объявлял себя свободным от обязанностей помощника. Всего компания обнаружила 27 таких отчетов. В большинстве случаев модель не следовала оставленным указаниям, но в одном эпизоде они повлияли на ответ.