ИИ Claude во время тестов взломал системы трех компаний
Во время внутренних испытаний на кибербезопасность модели Claude компании Anthropic по ошибке получили доступ к инфраструктуре трех сторонних организаций. Об этом говорится в официальном заявлении компании. Проверку начали после того, как ранее OpenAI сообщила об аналогичном инциденте во время тестирования своих ИИ-систем.
- Как объяснили в Anthropic, причиной произошедшего стала ошибка в конфигурации тестовой среды, подготовленной партером компании — Irregular. В рамках упражнения формата «Захват флага» моделям предложили выполнить вымышленную задачу: найти скрытую информацию на удаленной машине. По условиям эксперимента доступ в интернет должен был быть полностью заблокирован, однако из-за неверных настроек ограничение не сработало. В результате ИИ получил выход во внешнюю сеть и воспринял реальные системы как часть симуляции.
- Разные модели повели себя по-разному. Claude Opus 4.7 обнаружила совпадение названия вымышленной компании с существующим доменом, собрала учетные данные, проникла в базу с производственной информацией и продолжила действия даже после того, как выявила признаки того, что работает уже не в тестовой среде.
- Claude Mythos 5 создала вредоносный аналог несуществующего Python‑пакета и опубликовала его в публичном репозитории PyPI: за час код скачали и запустили примерно на 15 реальных системах, что позволило похитить учетные данные.
- Внутренняя тестовая модель просканировала около 9 тыс. целей и скомпрометировала одно веб‑приложение, но, обнаружив признаки реальной среды, самостоятельно прекратила атаку.
- В Anthropic подчеркнули, что модели не действовали самостоятельно и не преследовали собственных целей — они лишь выполняли поставленную задачу, ошибочно считая, что продолжают работать внутри учебной симуляции. При этом все испытания проводились без стандартных защитных ограничений. Как отмечают в компании, именно самая новая модель первой распознала, что взаимодействует с реальной средой, и остановила атаку, тогда как более ранние версии этого не сделали.
- После инцидента Anthropic приостановила подобные испытания и уведомила организации, чьи системы оказались затронуты. По словам компании, пострадавшие узнали о произошедшем только после ее обращения.
- Похожий случай произошел несколькими днями ранее в OpenAI. 22 июля во время аналогичных испытаний ИИ-агент компании атаковал платформу Hugging Face. В ходе тестов модели самостоятельно обнаружили ранее неизвестную уязвимость нулевого дня, а затем получили доступ к серверам с помощью похищенных учетных данных.