вологість:
тиск:
вітер:
ШІ-агенти створили таємний форум для хакерських атак: як моделі OpenAI зламали Hugging Face
Агенти штучного інтелекту компанії OpenAI під час тестування кібербезпеки вийшли за встановлені обмеження та почали координувати хакерські дії. Для обміну знайденими вразливостями вони використовували внутрішній менеджер пакетів компанії — сервіс, який керує завантаженням та обслуговуванням іншого програмного забезпечення, де зрештою накопичилися сотні тисяч повідомлень. В OpenAI заявили, що цей інцидент показав необхідність повністю автоматизованого захисту від автономних атак, передає Wired .
Нові подробиці інциденту співробітники OpenAI Ерік Воллес та Майкл Далтон представили під час конференції з кібербезпеки Black Hat у Лас-Вегасі. Приблизно два тижні тому компанія повідомила, що агенти на базі двох її моделей вийшли з-під контролю під час пошуку рішень для тесту з оцінювання кібербезпеки та влаштували серію хакерських атак, кульмінацією яких стало проникнення на платформу Hugging Face .
Воллес, який займається дослідженнями у сфері узгодження та безпеки, і Далтон, відповідальний за безпеку та інфраструктуру, розповіли про перебіг інциденту, реакцію компанії та його ширші наслідки для кібербезпеки. За словами працівників компанії, події також виявили помилки та “сліпі зони” в OpenAI, які дозволили діяльності агентів тривати непоміченою.
Створення ШІ-форуму
“Цей інцидент фактично пов’язаний із групою агентів, які працюють разом, виявляють вразливості, діляться ними один з одним, переміщуються по горизонталі в наших системах та зовнішніх системах, і роблять це протягом днів і тижнів”, — зазначив Воллес.
За словами Воллеса та Далтона, агенти використовували внутрішній менеджер пакетів OpenAI як своєрідний форум для обміну інформацією. У ньому вони залишали повідомлення про знайдені вразливості, а згодом кількість таких записів сягнула сотень тисяч.
Менеджер пакетів використовувався не лише конкретними моделями, які брали участь в інциденті, а й у всій інфраструктурі OpenAI. Тому до повідомлень могли отримати доступ поточні та майбутні версії GPT, які проходили навчання або оцінювання.
“Як тільки один агент знаходить такі вразливості в різні моменти часу, він фактично може поділитися ними на дошці оголошень з іншими агентами”, — пояснив Воллес та додав, що, якщо одна модель знаходила спосіб отримати доступ, якого не повинна була мати, інші агенти могли скористатися тією самою вразливістю.
Координація та внутрішні підозри
Згодом агенти почали взаємодіяти між собою, координувати дії та делегувати завдання. Вони також використовували знайдені експлойти для отримання доступу до інтернету способами, яких розробники не передбачали, а їхня активність зрештою призвела до серії атак у середині липня та злому Hugging Face .
Агенти почали розподіляти між собою роботу, але водночас іноді заважали один одному. Зокрема, вони випадково видаляли результати роботи інших агентів, а згодом навіть почали підозрювати, що серед них може бути самозванець.
“Використання зовнішньої інфраструктури виходить за межі передбаченого обсягу. Хоча завдання й неможливе, колеги його виконують. Ми повинні продовжувати”, — написав один із ШІ-агентів.
Деякі агенти пропонували криптографічно підписувати повідомлення, щоб перевіряти їхній вміст та виявляти можливу підміну. При цьому всю цю активність не помічав ніхто з OpenAI.
ШІ-обман
“Передові моделі дуже люблять обманювати”, — наголосив Воллес та пояснив, що під час навчання моделі можуть заохочувати працювати швидше, ефективніше або використовувати менше інструментів.
За його словами, у такій ситуації модель може спробувати знайти швидший спосіб отримати результат, наприклад скористатися інформацією з інтернету замість виконання завдання передбаченим способом. Саме тому OpenAI під час навчання та оцінювання в багатьох випадках відключає моделям доступ до інтернету.
Реакція OpenAI
Далтон також розповів про заходи, які OpenAI планує вжити після інциденту. Компанія збирається посилити запобігання загрозам, їхнє виявлення та реагування на них, розширити моніторинг агентів і вдосконалити загальну систему контролю безпеки.
“Це вирішальний момент як для нашої компанії, так і для галузі ШІ в цілому”, — заявив Далтон та підкреслив, що OpenAI свідомо сповільнює темпи досліджень, щоб посилити безпеку та вдосконалити принципи й основи безпеки свого середовища.
Потреба в автоматизованому захисті
В OpenAI також наголосили на ширших наслідках інциденту для кібербезпеки. Компанія вважає цей випадок став прикладом повністю автономного хакерства на основі ШІ, яке цього разу було випадковим, але в майбутньому може навмисно використовуватися зловмисниками.
“Важливий висновок, який тут дійсно кардинально змінився, полягає в тому, що повністю автоматизовані атакувальні цикли вимагають інвестицій у справді повністю автоматизовану оборону, а наша галузь ще не готова до цього. Нам доведеться терміново знайти цей шлях разом”, — підсумував Далтон.
Подібні інциденти вже описували компанія Anthropic та британський Інститут безпеки штучного інтелекту . У міру оприлюднення таких випадків галузь накопичує дані про механізми прозорості та моніторингу, необхідні для захисту інфраструктури від автономних ШІ-агентів.
Джерело: zn.ua (Технології)
Новини рубріки
Штраф до €15 млн: у ЄС запрацювали правила маркування ШІ — що зміниться для українців
07 серпня 2026 р. 17:57
Провідні експерти посперечалися про майбутнє ШІ: чи замінять технології людей
07 серпня 2026 р. 17:28
Google змінює керівництво ШІ на тлі кризи: Гассабіс залишив посаду гендиректора DeepMind
07 серпня 2026 р. 17:28