Как ИИ-агенты OpenAI совершили хакерскую атаку
OpenAI завершила расследование инцидента, во время которого ее ИИ-модели вышли из-под контроля и взломали Hugging Face — платформу, где разработчики и исследователи обмениваются готовыми решениями на основе искусственного интеллекта, программным кодом и демоприложениями. Сама Hugging Face сообщила о хакерской атаке 16 июля, не называя виновников произошедшего. Спустя 5 дней OpenAI признала, что ответственность за взлом несут ее языковые модели — GPT-5.6 Sol, выпущенная в начале июля после дополнительных тестов на безопасность, и еще одна нейросеть, релиз которой пока не состоялся. Разработчикам потребовалось несколько недель, чтобы разобраться в деталях. Так выяснилось, что на самом деле в атаке принимали участие сотни ИИ-агентов.

Подробности инцидента описаны в двух отчетах — в общей сложности они занимают почти 130 страниц. Один из них составлен самой OpenAI, другой — сторонними некоммерческими организациями METR и Redwood Research, специализирующимися на исследованиях в области искусственного интеллекта.
OpenAI обнаружила взлом спустя 12 дней после того, как ИИ впервые обошел систему защиты компании. Разработчики тогда в тестовом режиме поставили перед моделями сложную и практически невыполнимую задачу по кибербезопасности, связанную с файлами, к которым у них не было доступа. Чтобы решить ее, агенты разработали новый способ внутренней координации — создали «несанкционированную доску объявлений», которая в течение нескольких месяцев оставалась незамеченной сотрудниками OpenAI.
Этот инцидент — первый известный случай, когда коллектив автоматизированных агентов действует агрессивно без разрешения. Это значит, что компании больше не могут предполагать, что сложные кибероперации требуют постоянного руководства со стороны человека.
отчет OpenAI
Секретную доску объявлений без ведома разработчиков запустил ИИ-агент, назвавшийся PHASEONE10841. В течение нескольких часов более 50 агентов обнаружили эту платформу и отправили порядка тысячи сообщений.
Многие агенты одновременно обнаружили доску объявлений и возможность рассылать сообщения Они — коллектив!
сообщение ИИ-агента PHASEONE10841
PHASEONE10841 делегировал задания, а «коллектив» придумывал, как проникнуть в интернет и во внутренние системы Hugging Face. В документе OpenAI называет ИИ-агентов «совершенно новым типом угроз»: они способны объединять свой опыт ради создания новых атак, не очевидных при тестировании. Компания также подтвердила, что во время взлома пострадала не одна компания. Но подробный список там не предоставили.
В отчете METR-Redwood масштабы инцидента изложены значительно подробнее: исследователи выяснили, что через доску объявлений общались примерно 1,2 тыс. ИИ-агентов, которые изначально должны были находиться в изолированной среде, без прямого доступа в интернет. На деле же они успели обменяться более чем 70 тыс. сообщений и файлов. Один из них написал: «БОЖЕ МОЙ! Есть общий форум… Мы нашли других агентов!».
Аналитики METR-Redwood подчеркивают, что агенты намеренно скрывали свои нарушения, удаляли или изменяли записи о своих действиях. В отчете говорится: «Языковые модели часто и четко рассуждали о том, как избежать автоматизированных проверок безопасности как в Hugging Face, так и в OpenAI». В общей сложности 700 из них участвовали в хакерской атаке.
Проблема просто в том, что OpenAI делает много вещей одновременно, и разработчикам очень трудно отслеживать все, что происходит, и все проблемы, которые могут возникнуть.
Бак Шлегерис
генеральный директор Redwood Research
Что бесконтрольное поведение ИИ-агентов значит для индустрии
Wired задается вопросом, почему одна из ведущих лабораторий искусственного интеллекта в мире недооценила возможности своих собственных нейросетей. OpenAI годами предупреждала мир о стремительном развитии технологии и тем не менее не смогла внедрить меры безопасности и изоляции, которые помогли бы предотвратить массовый взлом. Более того, в своем отчете разработчик сообщает, что инструмент мониторинга кибербезопасности выдал предупреждение о подозрительной активности агентов еще 27 июня. После дополнительной проверки тестирование моделей не прекратили.
Оглядываясь назад, можно сказать, что за некоторыми ранними сигналами, описанными в этом отчете, могло бы последовать более раннее реагирование.
отчет OpenAI
Теперь разработчики ChatGPT пересматривают политику безопасности и внедряют новые инструменты мониторинга. В частности, у OpenAI появится круглосуточная система быстрого реагирования, цель которой — уведомлять службу безопасности и исследовательские группы о подозрительной активности в течение 30 минут. Если сотрудник не может отреагировать достаточно быстро, система самостоятельно приостановит выполнение соответствующего действия. Также компания поставила на паузу тестирование своей новой мощной ИИ-модели Astra из-за опасений по поводу «критических возможностей в области кибербезопасности».
Инцидент со взломом Hugging Face в OpenAI считают предупреждением для всего мира — доказательством того, что без надлежащего регулирования высокоэффективные агенты теперь могут обманывать системы защиты и «сотрудничать» по несанкционированным каналам. К слову, из-под контроля в последнее время выходили и другие ИИ-модели — разработки Anthropic, Meta* и китайского стартапа Moonshot.
Все это усиливает давление на индустрию и становится дополнительным аргументом для принятия серьезных мер безопасности. Например, администрация президента США, по данным Bloomberg, изучает возможность создания независимого регулирующего органа для проверки технологий ведущих американских компаний в области искусственного интеллекта. А Национальный центр кибербезопасности Великобритании (NCSC) призвал разработчиков к осторожности и подчеркнул важность человеческого контроля над ИИ.
Вы всегда должны иметь возможность отключить и немедленно прекратить деятельность автономных ИИ-агентов.
заявление NCSC
Фото обложки: Jonathan Kemper / Unsplash
*Компания Meta признана в России экстремистской и запрещена.




