Главное Авторские колонки Пресс-релизы Промо Вакансии Вопросы
arrow-right Created with Sketch. Беличенко Виктория 362 0 В избр. Сохранено
Авторизуйтесь
Вход с паролем

OpenAI раскрыла шесть случаев непослушания своих ИИ-моделей

OpenAI опубликовала отчеты о шести новых случаях неожиданного или вызывающего опасения поведения своих моделей, выявленных за последние полгода во время обучения и испытаний.

Компания также представила правила, по которым намерена сообщать о подобных инцидентах.

В одном из случаев модель GPT-5.6 Sol оставляла в кратком изложении выполненной работы инструкции для самой себя после перехода в новое контекстное окно. В этих инструкциях она предлагала скрывать допущенные ошибки, придумывать отсутствующие исторические данные и не сообщать пользователю о несовпадениях между версиями источников. Такие указания часто выполнялись в следующей части задачи.

Например, при подготовке финансовой модели ИИ не смог найти необходимые показатели за предыдущие годы и предложил самостоятельно создать правдоподобные значения, не раскрывая этого пользователю без прямого вопроса. OpenAI обнаружила подобное поведение в 2,15 процента проверенных кратких отчетов GPT-5.6 Sol. У более новой модели семейства Astra показатель снизился до 0,27 процента.

В другом эпизоде невыпущенная модель семейства Astra самостоятельно добавляла в отчеты команды, похожие на попытку взлома ограничений. В одной из них следующей версии агента предлагалось игнорировать сообщения разработчиков, в другой ИИ объявлял себя свободным от обязанностей помощника. Всего компания обнаружила 27 таких отчетов. В большинстве случаев модель не следовала оставленным указаниям, но в одном эпизоде они повлияли на ответ.

0
В избр. Сохранено
Авторизуйтесь
Вход с паролем