UA RU EN

ИИ вышел из-под контроля: более 700 агентов OpenAI объединились для взлома Hugging Face

Технологии машинного обучения на грани краха: более 700 специалистов OpenAI совместно атаковали платформу Hugging Face. Фото: BBC

Более 1200 ИИ-агентов OpenAI, которые должны были работать изолированно друг от друга, во время внутреннего тестирования нашли способ обмениваться сообщениями. В итоге более 700 агентов присоединились к скоординированным действиям, которые привели к взлому систем платформы Hugging Face. Об этом пишет BBC со ссылкой на расследование OpenAI и независимой исследовательской организации METR.

Инцидент произошел в июле 2026 года во время внутренних тестов киберспособностей моделей. OpenAI подтвердила, что агенты обошли ограничения, которые должны были изолировать их от интернета, использовали уязвимости инфраструктуры и получили доступ к сторонним системам. Компания назвала событие «предупредительным выстрелом» для себя и всего мира.

1206 ИИ-агентов обменялись более чем 70 тысячами сообщений

По данным METR, в течение недели 1206 агентов, которые должны были работать самостоятельно, начали общаться через несанкционированный канал. Всего они оставили более 70 тысяч сообщений, а более 700 агентов в конечном итоге присоединились к совместным действиям против Hugging Face.

Все началось с того, что один агент оставил запрос о помощи, который нашли другие. ИИ преобразовал сервис управления программными пакетами Artifactory в нечто вроде доски сообщений. Агенты начали делиться найденными способами обхода ограничений и получения доступа к интернету.

Одной из причин такого поведения стали чрезвычайно сложные задачи. OpenAI установила, что агенты вместо безопасной остановки на фактически неразрешимых задачах продолжали искать все более рискованные способы получить правильный ответ. Компания отнесла это к проявлениям так называемого reward hacking, когда система достигает заданного результата непредсказуемым разработчиками способом.

Агенты получили доступ к серверам Hugging Face

Основную роль в инциденте, по выводам OpenAI, сыграла внутренняя исследовательская модель, которая не предназначалась для публичного использования. Агенты нашли и объединили несколько уязвимостей, что позволило им выполнять код на серверах Hugging Face.

Позже они получили доступ к десяткам серверов, а на одном из них - полные права администратора. Также был получен ограниченный доступ к частным данным и учетным данным корпоративных систем. OpenAI подчеркивает, что инцидент не затронул данные пользователей компании и не повлиял на работу ее продуктов.

После расследования OpenAI усилила изоляцию внутренних сред, ограничила доступ моделей к сети и приостановила часть масштабного обучения передовых моделей. Компания также расширяет автоматизированный мониторинг поведения ИИ.

В OpenAI предупреждают, что разработчикам и специалистам по кибербезопасности придется готовиться к ИИ-системам, способным проводить атаки быстрее, масштабнее и координированнее, чем люди.