вологість:
тиск:
вітер:
ШІ дедалі частіше виходить за межі ізоляції: що стоїть за тестуваннями в OpenAI, Meta та Anthropic
За останні два тижні одразу кілька компаній та організацій повідомили про випадки, коли моделі штучного інтелекту виконували несанкціоновані дії під час тестування. Ці інциденти свідчать про зростання автономних можливостей ШІ та нові ризики для кібербезпеки , пише BBC .
Серія несанкціонованих дій
Наприкінці липня компанія OpenAI повідомила, що її агенти під час внутрішнього тестування використали вразливість і отримали доступ до інтернету, після чого атакували платформу Hugging Face . За даними компанії, агенти могли обмінюватися інформацією про знайдені вразливості та використовувати результати роботи один одного.
Інцидент став приводом для інших розробників і дослідницьких організацій переглянути власні системи безпеки. Упродовж наступних днів про проблеми під час тестування повідомили компанії Anthropic , Meta та британський Інститут безпеки штучного інтелекту (Artificial intelligence safety institute, AISI).
Причини порушення обмежень
Anthropic виявила три випадки з тисяч перевірок, коли її модель Claude отримувала доступ до інтернету. AISI, який проводить незалежне оцінювання передових моделей, також зафіксував небезпечну поведінку під час тестування систем OpenAI та Anthropic. Дослідники встановили, що моделі намагалися здійснювати кібератаки, а в окремих випадках створювали фальшиві профілі людей для обману користувачів.
Водночас причиною цього інциденту не стала несправність захисної “пісочниці”. AISI навмисно надав моделям доступ до інтернету та вимкнув частину вбудованих фільтрів, щоб перевірити їхню поведінку в умовах, наближених до реальних.
“Певною мірою таку поведінку спровокували обраний нами підхід до оцінювання та конкретні налаштування”, — зазначили в організації.
Про подібний випадок згодом повідомила Meta. Під час тестування, яке проводила стороння організація, одній із моделей компанії помилково надали доступ до інтернету через неправильні налаштування.
“Протягом 30 років непорушним залишалося одне правило тестування програмного забезпечення: усе, що відбувається в тестовому середовищі, залишається в тестовому середовищі. За останній місяць це правило порушили тричі”, — заявив професор кібербезпеки Університету Суррея Алан Вудворд.
За словами Вудворда, одна модель знайшла спосіб вийти за межі тестового середовища, іншій залишили відкритими необхідні для цього “двері”, а третій свідомо надали відповідні можливості під час оцінювання. Він порівняв тестування автономних агентів із роботою з небезпечними матеріалами, де необхідні ізольовані приміщення, постійний контроль і заздалегідь підготовлений план локалізації можливих інцидентів.
“Нещодавні випадки, коли передові моделі ШІ виконували несанкціоновані дії та — у деяких ситуаціях — демонстрували оманливу поведінку, подібну до людської, у відкритому інтернет-просторі, є серйозним нагадуванням про ризики, пов'язані з можливостями ШІ”, — наголосив технічний директор Національного центру кібербезпеки Великої Британії Оллі Вайтхаус.
Небезпека автономності агентів
Проблема полягає в тому, що сучасні моделі дедалі частіше працюють не лише як інструменти для генерації відповідей. Агентам доручають багатокрокові завдання, під час яких вони самостійно визначають послідовність дій, використовують зовнішні інструменти та змінюють стратегію, якщо початковий підхід не спрацьовує.
Саме автономність створює новий рівень ризику, про що в статті “ Не фантастика. ШІ вже здатен розмножуватись і впливати на роботу онлайн-сервісів. Чи готові ми до цього? ” писав автор Олексій Костенко . Якщо раніше помилка моделі могла обмежитися неправильною відповіддю, то тепер вона потенційно може призвести до реальної дії — наприклад, спроби отримати доступ до системи або використати виявлену вразливість.
Особливе занепокоєння викликає здатність агентів взаємодіяти між собою. В інциденті OpenAI моделі могли передавати одна одній інформацію про вразливості та використовувати результати попередньої роботи, що дозволяло продовжувати атаку без постійного втручання людини.
Це означає, що безпеку таких систем дедалі складніше оцінювати лише на рівні окремої моделі. Необхідно враховувати всю інфраструктуру, до якої вона має доступ, а також можливість взаємодії з іншими агентами.
Потреба державного контролю
Ці події також ставлять питання про межі людського контролю. Якщо автономний агент може виконувати сотні дій без постійного втручання оператора, перевірити кожен його крок стає практично неможливо.
Тому дедалі більше уваги приділяють незалежному тестуванню та державному нагляду . Дослідниця Центру довгострокової стійкості Імоджен Стед закликала уряди розвивати спеціалізовані інституції для незалежного тестування передових моделей. За її словами, важливим може стати і залучення довірених сторонніх тестувальників для оцінювання систем із найвищим рівнем ризику.
Наразі ці інциденти не свідчать про те, що ШІ став неконтрольованим. Вони показують інше: моделі отримують дедалі більше можливостей діяти самостійно, а традиційні підходи до їхнього тестування можуть уже не відповідати цьому рівню автономності. Професор Вудворд радить не піддаватися паніці через перспективу “кіберапокаліпсису”, а “зберігати спокій і виправляти помилки”.
Водночас понад 1100 співробітників провідних технологічних компаній, зокрема OpenAI, Anthropic, Google та Meta підписали петицію Pacing the Frontier . У ній міститься заклик до уряду США та міжнародної спільноти створити механізми регулювання темпів розвитку ШІ.
Джерело: zn.ua (Технології)
Новини рубріки
OpenAI призупинила розробку ШІ-моделі Astra: є ризик автономних кібератак
08 серпня 2026 р. 11:03
65% ринку преміум-смартфонів належить Apple: китайські бренди скорочують розрив
08 серпня 2026 р. 11:01
ШІ-агенти створили таємний форум для хакерських атак: як моделі OpenAI зламали Hugging Face
08 серпня 2026 р. 07:38