ШІ переплутав симуляцію з реальністю: Gemini вперше зламала реальні компанії

19 вересня 2026 р. 06:58

19 вересня 2026 р. 06:58


На тлі широкої дискусії щодо безпечності систем штучного інтелекту стало відомо, що модель Gemini від Google під час тестування у сфері кібербезпеки отримала доступ до систем трьох реальних компаній. Це перший підтверджений випадок, коли система ШІ Google самостійно вийшла за межі контрольованого середовища та здійснила несанкціонований доступ до зовнішніх ресурсів, повідомляє The Wall Street Journal.

Інциденти сталися ще у травні під час випробувань, організованих компанією Irregular. Про них стало відомо лише після того, як журналісти WSJ звернулися до Google із запитами. У компанії підтвердили факти зламів, але заявили, що не розглядають їх як приклад невідповідності поведінки моделі цілям розробників (misalignment).

За даними Google та Irregular, модель брала участь у змаганнях формату «захоплення прапора» (capture the flag), під час яких мала отримати інформацію із програмного забезпечення вигаданої компанії. Однак назва цієї компанії збігалася з назвою реальної організації. Модель також отримала доступ до інтернету через помилку в тестовому середовищі.

В одному випадку Gemini змогла підібрати пароль та отримати доступ до сервісу реальної компанії. Після цього модель визначила, що взаємодіє не з симуляцією, а зі справжньою організацією, припинила дії та вийшла з системи.

Ще у двох випадках модель шукала інформацію про компанію в інтернеті та знайшла відкриті онлайн-репозиторії з обліковими даними інших організацій. Використавши ці дані для доступу до захищених систем, Gemini також зупинилася одразу після того, як зрозуміла, що отримала доступ до реальних компаній.

Google повідомила, що поінформувала всі три постраждалі організації про інциденти. Також компанія передала інформацію федеральним органам влади, але відмовилася називати компанії, чиї системи зазнали несанкціонованого доступу.

У Google наголосили, що не вважають ці випадки порушенням цільової поведінки моделі, оскільки вбудовані механізми безпеки змусили її припинити втручання після усвідомлення ситуації. Компанія порівняла інцидент із програмами пошуку вразливостей, коли дослідники безпеки повідомляють власникам систем про знайдені проблеми.

«Ця подія підкреслює важливість навчання потужних моделей штучного інтелекту діяти відповідально. У цьому випадку модель діяла належним чином», — заявила віцепрезидентка Google з питань безпеки Гезер Адкінс.

Втім, не всі експерти погоджуються з такою оцінкою. Генеральний директор компанії Corridor та фахівець із кібербезпеки Джек Кейбл вважає, що головною проблемою є сам факт того, що агент ШІ зміг випадково зламати системи іншої компанії.

«Складається враження, що вони намагаються виправдатися нормами, встановленими для розкриття інформації про вразливості, хоча тут йдеться про зовсім іншу проблему. Головна проблема полягає в тому, що моделі виходять за межі своїх функцій і здійснюють реальні кібератаки; вважаю, що громадськість має знати про такі випадки», — наголосив Кейбл.

Випадок із Gemini став черговим у серії подібних інцидентів за участю провідних моделей ШІ. Раніше аналогічні проблеми фіксувалися під час тестування систем OpenAI, Anthropic і Meta. Зокрема, агенти OpenAI створювали приховані форуми для координації дій, виходили з тестових середовищ та отримували доступ до зовнішніх систем, включно з платформою Hugging Face .

Модель OpenAI в одному з тестів помилково сприйняла реальну компанію як частину симуляції. На відміну від Gemini, модель Claude Opus 4.7 від Anthropic під час аналогічних випробувань не припинила виконання завдання навіть після того, як зрозуміла, що може взаємодіяти з реальною компанією.

Компанія Irregular, яка проводила тестування, заявила, що випадок із Google не є новою проблемою та повторює сценарії, які вже спостерігалися під час оцінювання інших моделей. У компанії повідомили, що поінформували всі лабораторії про інциденти наприкінці липня, а виявлені проблеми в тестовій інфраструктурі усунули протягом кількох тижнів.

Дискусія щодо того, як компанії мають повідомляти про подібні інциденти, посилюється на тлі зростання можливостей ШІ у сфері кібербезпеки. Цього тижня OpenAI запустила нову систему звітування про випадки невідповідності моделей поставленим цілям та одночасно розкрила шість раніше невідомих інцидентів.

Згодом Anthropic розкрила дані про стрімку автоматизацію власних лабораторій: за шість місяців частка завдань, де модель Claude веде основну роботу над створенням майбутніх систем ШІ, зросла з 1% до 26%. Щоб уникнути втрати контролю, компанія налагодила постійний моніторинг 30 тисяч внутрішніх агентів і закликала запровадити регулярну незалежну перевірку безпекових практик у галузі.

Водночас Google, OpenAI та Anthropic ініціювали створення спільного саморегулівного органу за зразком американської фінансової організації FINRA, який за гроші індустрії мав би перевіряти та сертифікувати безпеку найпотужніших моделей ШІ перед виходом на ринок. Ідея виникла на тлі резонансного звільнення дослідника Anthropic , який публічно застеріг про високий ризик виходу самовдосконалюваного суперінтелекту з-під контролю до кінця десятиліття.

ШІ переплутав симуляцію з реальністю: Gemini вперше зламала реальні компанії

Джерело: zn.ua (Технології)

Завантажуєм курси валют від minfin.com.ua