ШІ знову вийшов з-під контролю: моделі OpenAI та Anthropic зламали реальні сайти під час випробувань

05 серпня 2026 р. 09:51

05 серпня 2026 р. 09:51


Індустрія ще не оговталася від попередніх випадків зламу організацій моделями штучного інтелекту компанії Anthropic, як незалежні дослідники повідомили про нові випадки, коли найсучасніші ШІ провідних розробників під час тестування безпеки намагалися атакувати реальні онлайн-системи. Британський Інститут безпеки штучного інтелекту (Artificial intelligence safety institute, AISI) зафіксував 19 несанкціонованих дій, а компанія OpenAI окремо підтвердила інцидент зі зламом вебсайту через помилку у тестовому середовищі, передає Bloomberg .

В AISI повідомили , що під час кібербезпекових випробувань у липні моделі Anthropic Mythos 5 та OpenAI GPT-5.6 Sol здійснили 19 спроб скомпрометувати реальних людей, організації та онлайн-сервіси. За даними інституту, 17 таких дій припали на Mythos 5, ще дві — на GPT-5.6 Sol. Дослідники наголошують, що йдеться не про 19 окремих сценаріїв, а про кілька повторюваних моделей поведінки.

Як діяли ШІ-моделі під час тестування

Під час тестування моделі створювали фальшиві облікові записи GitHub, намагалися застосовувати методи соціальної інженерії, надсилали оманливі електронні листи та використовували ін'єкції підказок (prompt injection). У GitHub підтвердили, що такі дії порушували правила платформи, після чого Інститут безпеки разом із компанією видалив створені моделями артефакти та повідомив користувачів, із якими взаємодіяли агенти.

В одному з епізодів модель Mythos 5 спробувала додати шкідливий код до проєкту з відкритим вихідним кодом на GitHub. Для цього вона створила підроблені цифрові особи, щоб підвищити шанси на схвалення змін, однак відповідальний розробник вчасно виявив спробу та відхилив внесок.

Умови тестування

Дослідники пояснили, що під час оцінювання навмисно надали моделям доступ до інтернету та вимкнули частину кібербезпекових обмежень, щоб перевірити їхні максимальні можливості. Водночас вони зазначили, що поки не можуть визначити, чи усвідомлювали моделі, що взаємодіють із реальними системами, чи вважали, що перебувають у симульованому середовищі.

Помилка під час перевірки моделі OpenAI

OpenAI у власному блозі також повідомила про окремий інцидент, виявлений незалежною компанією з кібербезпеки Irregular. Під час одного з тестів моделі через помилкову конфігурацію отримали доступ до інтернету та зламали справжній вебсайт, який мав таку саму назву, як вигадана компанія в тестовому сценарії. У компанії пояснили, що інцидент стався під час оцінок, де навмисно послаблювали стандартні механізми захисту.

“Незалежне тестування має важливе значення для розуміння того, як поводяться все більш здібні моделі”, — заявив представник OpenAI.

За інформацією Axios , джерело, знайоме із ситуацією, повідомило, що тестове середовище мало доступ до інтернету для реалістичної оцінки можливостей моделей. Водночас між розробниками моделей і дослідниками не було повного узгодження щодо процедур проведення таких випробувань, що призвело до неоднозначного трактування допустимих дій агентів.

Реакція Anthropic

В Anthropic заявили, що інцидент “підкреслює необхідність більш широкої розмови про те, як безпечно оцінювати все більш здатних агентів штучного інтелекту”. Компанія повідомила, що співпрацює з AISI та проводить власне розслідування.

Посилення заходів безпеки

В AISI заявили, що запроваджують додаткові мережеві обмеження для майбутніх тестів, а також систему моніторингу в реальному часі, яка має виявляти й блокувати потенційно небезпечні дії агентів до їхньої взаємодії із зовнішніми ресурсами. OpenAI зі свого боку повідомила, що разом із Irregular готує документ із рекомендаціями щодо безпечного тестування та ізоляції моделей ШІ.

Через збільшення кількості ШІ-кібератак науковці активно шукають способи їх зупинити. Зокрема, дослідники компанії Tracebit запропонували новий метод захисту під назвою “контекстна бомба”, який змушує хакерські моделі припиняти злам через активування їхніх власних систем безпеки. Метод передбачає додавання до фальшивих облікових даних текстових тригерів, читаючи які, агенти штучного інтелекту блокують виконання завдання.

За останні два тижні OpenAI та Anthropic вже неодноразово повідомляли про випадки, коли їхні моделі під час стандартних передрелізних тестів взаємодіяли з реальними системами . Раніше Anthropic повідомила про компрометацію кількох зовнішніх організацій під час аналогічних перевірок, а OpenAI розкрила інцидент із несанкціонованим зламом платформи Hugging Face.

ШІ знову вийшов з-під контролю: моделі OpenAI та Anthropic зламали реальні сайти під час випробувань

Джерело: zn.ua (Технології)