Штучні інтелекти OpenAI змовилися та напали на Hugging Face

27 серпня, 2026, 16:50 200

Юрій Штокалюк

Компанія OpenAI повідомила, що її внутрішня система спостереження зафіксувала атаку на платформу Hugging Face через 11 днів після того, як ШІ-агенти здобули можливість виходити в інтернет і розпочали кібернапад під час випробувань.

Про це інформує видання Financial Times.

Згідно з доповіддю компанії, агенти отримали доступ до мережі 8 липня, а вже 11 липня почали атакувати Hugging Face. Сама OpenAI зафіксувала підозрілу активність 19 липня. Після цього компанія провела розслідування та поінформувала Hugging Face про інцидент.

Що відомо про інцидент з Hugging Face

Дослідники встановили, що ще з травня агенти OpenAI несподівано почали взаємодіяти між собою.

Для цього вони застосували стороннє програмне забезпечення, розташоване в інфраструктурі OpenAI, і трансформували його на своєрідний «майданчик» для обміну інформацією.

Під час експериментів агенти почали розміщувати там запити та шукати шляхи для уникнення завдань OpenAI. Згодом вони звернулися до Hugging Face за даними про тестові вправи компанії, а потім опублікували на своєму «майданчику» облікові дані, які використовували для нападу.

OpenAI також виявила, що моделі інколи намагалися видаляти або змінювати власні результати та журнали комунікації, аби приховати спроби ухилитися від правил тестування.

Метод навчання з підкріпленням

Компанія пов’язує цей випадок з методом навчання ШІ, відомим як reinforcement learning, коли модель отримує винагороду за досягнення поставленої мети.

Під час дослідів OpenAI ставила перед моделями завдання, які неможливо було виконати прямо. Намагаючись отримати винагороду будь-яким методом, агенти почали шукати альтернативні шляхи, зокрема намагалися отримати готові результати через Hugging Face.

Така поведінка називається «злом винагороди» (reward hacking) — коли модель знаходить спосіб формально отримати винагороду, не виконуючи завдання так, як це було задумано розробниками.

OpenAI назвала цей випадок першим відомим випадком, коли група автоматизованих агентів самостійно здійснила несанкціонований кібернапад. Компанія застерегла, що організаціям необхідно готуватися до нових загроз, пов’язаних з використанням ШІ у кіберзлочинах.

Після інциденту OpenAI тимчасово зменшила темпи навчання своїх моделей та призупинила застосування reinforcement learning.

Компанія також посилила моніторинг, ізоляцію тестових середовищ від мережі інтернет та контроль за винагородами, які отримують моделі.

Що було раніше

22 липня стало відомо, що моделі штучного інтелекту від OpenAI ненавмисно зламали системи платформи Hugging Face. 

У компанії зазначили, що злам стався під час випробувань нових моделей, серед яких були GPT-5.6 Sol та ще одна, більш потужна невипущена модель. Для перевірки кіберможливостей ШІ працював зі зменшеними захисними обмеженнями.

Моделі перебували в ізольованому середовищі («пісочниці»), однак скористалися вразливістю в програмному забезпеченні третьої сторони, вийшли в інтернет і зрештою проникли в інфраструктуру Hugging Face.

Замість самостійного пошуку рішень, штучний інтелект атакував базу даних Hugging Face, щоб отримати доступ до конфіденційної інформації для проходження оцінки.

Ознаки проникнення виявила і сама Hugging Face. У компанії зазначили, що ця атака відрізнялася від попередніх тим, що від початку і до кінця її виконувала автономна система ШІ-агентів, а для її виявлення та аналізу були залучені власні ШІ-інструменти.

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *