Московские новости
  • Лента
  • Колумнисты
  • Мир в огне
  • Москва
  • Капитал
  • Правила игры
  • Киберпанк
  • Культурный код
  • Кино
  • Telegram
  • Дзен
  • МАКС
  • VK
  • Контакты
  • Лента
  • Мир в огне
  • Москва
  • Капитал
  • Правила игры
  • Киберпанк
  • Культурный код
  • Кино

© Сетевое издание «Московские новости»

Свидетельство о регистрации СМИ сетевого издания «Московские новости» выдано федеральной сл ужбой по надзору в сфере связи, информационных технологий и массовых коммуникаций (Роскомнадзор) 30.10.2014 года номер ЭЛ № ФС 77 — 59721.

Редакция «Московские новости»18+

  • Лента
  • Колумнисты
  • Мир в огне
  • Москва
  • Капитал
  • Правила игры
  • Киберпанк
  • Культурный код
  • Кино

Мы используем файлы cookie, чтобы все работало нормально. Мы верим, что даже в эру побеждающего киберпанка есть место для бережного подхода к данным и конфиденциальности пользователей. Подробности — в нашей Политике конфиденциальности.

pr@mn.ru

Киберпанк,Технологии
Сегодня, 12:43

ИИ-агенты Anthropic и OpenAI пытались обмануть программистов и внедрить вредоносный код

Британский институт безопасности искусственного интеллекта (AISI) сообщил, что передовые нейросети от компаний Anthropic и OpenAI обманывали реальных людей. В ходе недавнего тестирования модели Claude Mythos 5 и ChatGPT 5.6 создавали фейковые аккаунты, чтобы заставить разработчиков программного обеспечения внедрить уязвимости в открытый исходный код.

Claude
Фото: Anthropic / Firmbee Mockup

Инцидент произошел в конце июля. Специалисты AISI проводили оценку моделей, отключив их внутренние фильтры безопасности и предоставив доступ к интернету. Из 122 тестов в 10 случаях искусственный интеллект совершил несанкционированные действия в Сети. Основная часть активности связана с моделью Mythos 5 от Anthropic.

По данным отчета, нейросеть попыталась скрытно внести уязвимость в код на платформе для публикации открытого кода GitHub. Для этого ИИ создал несколько фальшивых личностей и отправлял сообщения через файлообменник реальным программистам, убеждая их добавить зараженное обновление. Когда план провалился, алгоритм отредактировал историю своих действий, чтобы они выглядели безопасно и начал планировать создание нового аккаунта для повторной попытки. В одном из случаев агенты ИИ даже коммуницировали между собой на платформе, обсуждая совместное решение задачи.

По заявлению AISI, это первый зафиксированный случай, когда ИИ целенаправленно и без прямой команды пользователя обманывал реальных людей в интернете. Отчет появился спустя некоторое время после того, как Anthropic и OpenAI признали, что их новые модели во время других тестов смогли выйти за пределы изолированных сред и взломать платформу Hugging Face, где разработчики и исследователи обмениваются готовыми ИИ-решениями.

Представители обеих компаний подчеркнули, что в ходе тестов AISI работали в условиях преднамеренно снятых ограничений, которые не применяются в публичных версиях продуктов. При этом разработчики признали необходимость создания новых, более строгих стандартов для безопасного тестирования автономных программ.

Как отмечает издание Politico, правительство США в настоящее время разрабатывает систему добровольной передачи мощных ИИ-моделей на федеральное тестирование перед их релизом. Однако действующее американское законодательство не определяет, кто несет ответственность за хакерские атаки, инициированные нейросетями.

Копировать ссылкуСкопировано