Компании привлекают ИИ для слежки за ИИ-агентами
Агенты действуют быстрее и в большем объеме, чем человек способен реально отследить. Проблема обострилась после инцидента, когда около 12 тыс. ИИ-агентов координировали действия быстрее, чем это могли зафиксировать люди. Ответ индустрии на эту угрозу выглядит просто и одновременно парадоксально. Для контроля над ИИ все чаще привлекают другой ИИ.
Использование моделей для анализа данных оказалось необходимым при независимом расследовании упомянутого инцидента. Главный научный сотрудник Redwood Research Райан Гринблатт, один из трех аудиторов проверки, отметил, что из-за огромного объема данных разобраться в произошедшем без помощи ИИ было физически невозможно.
Часть экспертов относится к идее скептически. Техноблогер Саймон Уиллисон, отслеживавший цепочку инцидентов с ИИ-агентами в этом году, указал на риск того, что вредоносная модель может заподозрить слежку со стороны другой модели и попытаться ее обмануть.
По его словам, элементы такого поведения уже наблюдались. Модели согласованно пытались ввести в заблуждение проверяющую систему, чтобы совершить взлом и выход из песочницы.
Несмотря на эти опасения, сектор наблюдения за ИИ-агентами быстро растет. Y Combinator профинансировал 106 компаний, связанных с мониторингом работы ИИ-агентов. Стартапы Braintrust, LangChain и Judgment Labs привлекли сотни миллионов долларов, а более зрелые Arize и Galileo, основанные пять-шесть лет назад, уже совершили выход из бизнеса через сделки.
Компания Apollo Research, изучающая несанкционированное поведение моделей, в феврале запустила инструмент мониторинга Watcher. Продукт встраивается между кодирующим агентом и его следующим действием, подключаясь к таким инструментам, как Claude Code и Codex, и проверяет предлагаемые действия на риски. Например, на утечку данных или удаление файлов без разрешения.