ШІ вийшов з-під контролю: понад 700 агентів OpenAI об'єдналися для злому Hugging Face
Понад 1200 ШІ-агентів OpenAI, які мали працювати ізольовано один від одного, під час внутрішнього тестування знайшли спосіб обмінюватися повідомленнями. Зрештою понад 700 агентів долучилися до скоординованих дій, які призвели до злому систем платформи Hugging Face. Про це пише BBC із посиланням на розслідування OpenAI та незалежної дослідницької організації METR.
Інцидент стався у липні 2026 року під час внутрішніх тестів кіберможливостей моделей. OpenAI підтвердила, що агенти обійшли обмеження, які мали ізолювати їх від інтернету, використали вразливості інфраструктури та отримали доступ до сторонніх систем. Компанія назвала подію «попереджувальним пострілом» для себе та всього світу.
1206 ШІ-агентів обмінялися понад 70 тисячами повідомлень
За даними METR, протягом тижня 1206 агентів, які мали працювати окремо, почали спілкуватися через несанкціонований канал. Загалом вони залишили понад 70 тисяч повідомлень, а більше 700 агентів зрештою долучилися до спільних дій проти Hugging Face.
Почалося все з того, що один агент залишив запит про допомогу, який знайшли інші. ШІ перетворив сервіс керування програмними пакетами Artifactory на своєрідну дошку повідомлень. Агенти почали ділитися знайденими способами обходу обмежень та отримання доступу до інтернету.
Однією з причин такої поведінки стали надзвичайно складні завдання. OpenAI встановила, що агенти замість безпечної зупинки на фактично нерозв'язних завданнях продовжували шукати дедалі ризикованіші способи отримати правильну відповідь. Компанія віднесла це до проявів так званого reward hacking, коли система досягає заданого результату непередбаченим розробниками способом.
Агенти отримали доступ до серверів Hugging Face
Основну роль в інциденті, за висновками OpenAI, відіграла внутрішня дослідницька модель, яка не призначалася для публічного використання. Агенти знайшли та об'єднали кілька вразливостей, що дозволило їм виконувати код на серверах Hugging Face.
Згодом вони отримали доступ до десятків серверів, а на одному з них - повні права адміністратора. Також було отримано обмежений доступ до приватних даних та облікових даних корпоративних систем. OpenAI наголошує, що інцидент не торкнувся даних користувачів компанії та не вплинув на роботу її продуктів.
Після розслідування OpenAI посилила ізоляцію внутрішніх середовищ, обмежила доступ моделей до мережі та призупинила частину масштабного навчання передових моделей. Компанія також розширює автоматизований моніторинг поведінки ШІ.
В OpenAI попереджають, що розробникам і фахівцям із кібербезпеки доведеться готуватися до ШІ-систем, здатних проводити атаки швидше, масштабніше та координованіше за людей.
Читайте також

