OpenAI начнет привлекать независимых оценщиков для проверки безопасности ИИ-моделей
Сторонних специалистов будут привлекать не только перед релизом новых моделей, но и во время обучения, оценки и внутреннего развертывания. Об этом пишет Bloomberg.
В своем заявлении OpenAI выделила четыре направления проверок. Это аудит аргументации компании в пользу безопасности моделей, тестирование защитных механизмов, независимая оценка тестов безопасности и расследование инцидентов, когда модели выходят из-под контроля.
Внешние оценщики смогут проверять работу систем мониторинга, поведение ИИ-агентов в реалистичных сценариях и устойчивость систем безопасности к атакам. Для выполнения наиболее чувствительных задач сторонних специалистов могут привлекать непосредственно в офисы OpenAI.
Компания также сформулировала основные принципы таких проверок. Среди них независимость оценщиков, прозрачная методология, достаточный доступ к системам и данным, раскрытие конфликтов интересов, защита конфиденциальной информации и возможность исправить выявленные проблемы до публикации результатов.