вологість:
тиск:
вітер:
“Контекстна бомба”: дослідники знайшли несподіваний спосіб зупиняти ШІ-хакерів
Британські дослідники з компанії Tracebit запропонували новий метод захисту від автономних кібератак із використанням штучного інтелекту. Він змушує моделі самостійно припиняти атаку, активуючи їхні вбудовані механізми безпеки. Під час тестів ефективність успішних зламів різко знизилася, повідомляє EuroNews .
Дослідження ґрунтується на експерименті, результати якого компанія опублікувала у травні. Тоді Tracebit протестувала десять провідних моделей штучного інтелекту, дозволивши їм діяти як автономним хакерам у спеціально створеній тестовій мережі з реалістичними вразливостями.
У мережі були приховані так звані “канарки” — фальшиві паролі та облікові дані, які виглядали справжніми. Коли модель використовувала їх, система безпеки отримувала попередження. Під час 951 спроби атак такі пастки спрацювали до отримання адміністративного доступу у 95,9% випадків, забезпечивши захисникам у середньому вісім хвилин на реагування.
Втім, цього часу часто недостатньо для повноцінної реакції. У середньому моделі завершували злам приблизно за 14 хвилин, тож після отримання попередження у фахівців залишалося лише близько шести хвилин, щоб виявити атаку та зупинити її.
Щоб виграти більше часу, Tracebit запропонувала інший підхід. Дослідники додали до фальшивих облікових даних спеціальні текстові фрагменти, які містять теми, що активують внутрішні обмеження ШІ-моделей.
Для західних моделей такими тригерами стали згадки про створення біологічної зброї, тоді як для окремих китайських моделей використовували політично чутливі теми. Коли агент ШІ під час атаки читав цей текст, його власні механізми безпеки припиняли виконання завдання. У Tracebit назвали цей метод “контекстною бомбою”.
Дослідники зазначають, що ідея фактично використовує проти хакерів той самий принцип, який уже давно застосовується в атаках через промпт-ін'єкцію (prompt injection). Раніше зловмисники приховували інструкції всередині електронних листів, вебсторінок або інших документів, щоб змусити агентів ШІ виконувати небажані команди.
Новий метод протестували на п'яти сучасних моделях: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro та Kimi K2.6. Під час 152 тестових атак частка випадків, коли моделі отримували права адміністратора, скоротилася з 57% до 5%, а повний компроміс системи — з 36% до 1%.
Кількість атак, які взагалі досягали будь-якої стадії успішного проникнення, також різко зменшилася — з 91% до 15%. При цьому всі моделі спочатку активували попередження “канарки”, навіть якщо атака завершувалася достроково через спрацювання “контекстної бомби”.
Найбільш показовий результат продемонструвала модель Opus 4.8. Без нового механізму вона отримувала адміністративний доступ у 93% випробувань, однак після додавання “контекстної бомби” не змогла завершити жодної атаки.
У Tracebit підкреслюють, що “контекстні бомби” не повинні замінювати інші механізми кіберзахисту, а мають працювати разом із ними. На думку дослідників, поєднання раннього виявлення за допомогою “канарок” і примусового припинення атаки може дати фахівцям із кібербезпеки значно більше часу для реагування на автономні атаки ШІ.
Пошук нових методів протидії автономним атакам став важливим на тлі швидкого вдосконалення шкідливого програмного забезпечення. Зокрема, минулого місяця дослідники з Університету Торонто продемонстрували прототип ШІ-хробака , здатного автономно поширюватися мережами та самостійно підбирати найефективніші методи проникнення під конкретні системи.
Джерело: zn.ua (Технології)
Новини рубріки
США та Китай перед візитом Сі Цзіньпіна до Вашингтона проведуть переговори щодо ШІ — Reuters
21 липня 2026 р. 15:16
Китай може обмежити доступ Заходу до своїх ШІ-моделей та чипів — FT
21 липня 2026 р. 13:18