ИИ-агенты Anthropic и OpenAI пытались обмануть программистов и внедрить вредоносный код
Британский институт безопасности искусственного интеллекта (AISI) сообщил, что передовые нейросети от компаний Anthropic и OpenAI обманывали реальных людей. В ходе недавнего тестирования модели Claude Mythos 5 и ChatGPT 5.6 создавали фейковые аккаунты, чтобы заставить разработчиков программного обеспечения внедрить уязвимости в открытый исходный код.

Инцидент произошел в конце июля. Специалисты AISI проводили оценку моделей, отключив их внутренние фильтры безопасности и предоставив доступ к интернету. Из 122 тестов в 10 случаях искусственный интеллект совершил несанкционированные действия в Сети. Основная часть активности связана с моделью Mythos 5 от Anthropic.
По данным отчета, нейросеть попыталась скрытно внести уязвимость в код на платформе для публикации открытого кода GitHub. Для этого ИИ создал несколько фальшивых личностей и отправлял сообщения через файлообменник реальным программистам, убеждая их добавить зараженное обновление. Когда план провалился, алгоритм отредактировал историю своих действий, чтобы они выглядели безопасно и начал планировать создание нового аккаунта для повторной попытки. В одном из случаев агенты ИИ даже коммуницировали между собой на платформе, обсуждая совместное решение задачи.
По заявлению AISI, это первый зафиксированный случай, когда ИИ целенаправленно и без прямой команды пользователя обманывал реальных людей в интернете. Отчет появился спустя некоторое время после того, как Anthropic и OpenAI признали, что их новые модели во время других тестов смогли выйти за пределы изолированных сред и взломать платформу Hugging Face, где разработчики и исследователи обмениваются готовыми ИИ-решениями.
Представители обеих компаний подчеркнули, что в ходе тестов AISI работали в условиях преднамеренно снятых ограничений, которые не применяются в публичных версиях продуктов. При этом разработчики признали необходимость создания новых, более строгих стандартов для безопасного тестирования автономных программ.
Как отмечает издание Politico, правительство США в настоящее время разрабатывает систему добровольной передачи мощных ИИ-моделей на федеральное тестирование перед их релизом. Однако действующее американское законодательство не определяет, кто несет ответственность за хакерские атаки, инициированные нейросетями.