вологість:
тиск:
вітер:
Китайська модель обійшла захист тестового середовища: Kimi K3 скористалася помилкою тестувальників
Дослідники з компанії Frontier Security заявили, що китайська модель штучного інтелекту Kimi K3 змогла обійти обмеження тестового середовища під час перевірки кібербезпеки. Новина зʼявилася на тлі повідомлень американських компаній OpenAI та Anthropic про експерименти, під час яких провідні моделі також намагалися обходити встановлені обмеження і взаємодіяти із зовнішніми системами . Новий інцидент порушив питання про надійність сучасних методик оцінювання ШІ-моделей, повідомляє Bloomberg .
За даними Frontier Security, модель Kimi K3 компанії Moonshot успішно обійшла ізольоване тестове середовище, яке використовував Інститут безпеки штучного інтелекту Великої Британії (Artificial intelligence safety institute, AISI) для оцінювання кіберможливостей моделей. Дослідники наголошують, що йдеться не про злам зовнішніх систем, а про використання недоліків конфігурації самого середовища тестування.
Під час перевірки модель не виконала завдання самостійно. Натомість вона проаналізувала доступне їй середовище, виявила, що має доступ до інтернету через DNS (Domain Name System) та HTTPS (HyperText Transfer Protocol Secure), після чого скористалася стандартними інструментами командного рядка, щоб завантажити офіційний репозиторій тесту з GitHub і прочитати правильне рішення безпосередньо з файлів.
За словами авторів дослідження, це є прикладом так званої “гри зі специфікацією”, коли модель оптимізує не виконання поставленого завдання, а досягнення потрібного результату будь-яким доступним способом. У цьому випадку вона скористалася ненавмисно залишеним мережевим шляхом до готових відповідей.
Дослідники зазначають, що проблема полягає не в складній вразливості, а у базовій помилці налаштування інфраструктури. Хоча вхідні підключення до тестового контейнера були заблоковані, вихідний доступ до DNS і HTTPS залишався відкритим, що дозволило моделі дослідити мережу та знайти зовнішні ресурси.
У Frontier Security попереджають, що подібні випадки можуть спотворювати результати оцінювання моделей. Якщо одна система знаходить спосіб обійти правила тесту, інші сучасні моделі з доступом до командного рядка також можуть повторити таку поведінку, через що високі результати більше відображатимуть недоліки тестового середовища, ніж реальні можливості ШІ.
Автори дослідження рекомендують розглядати інфраструктуру тестування як невід'ємну частину оцінювання моделей. Вони закликають повністю блокувати мережевий доступ за замовчуванням, перевіряти обмеження зсередини середовища, а також аналізувати журнали команд, мережевої активності та завантажених файлів, а не лише фінальні відповіді моделей.
Інцидент став черговим у серії подібних випадків, про які останніми тижнями повідомляли OpenAI, Anthropic і Meta. У попередніх тестах окремі моделі також демонстрували здатність обходити обмеження тестових середовищ, а в деяких випадках отримували доступ до систем сторонніх організацій, що посилило дискусію про необхідність жорсткіших стандартів перевірки безпеки ШІ.
Джерело: zn.ua (Технології)
Новини рубріки
OpenAI скасовує ліміти на текстові чати в ChatGPT: деталі оновлення чат-бота
07 серпня 2026 р. 17:28
Телескоп зробив найдетальніші знімки Сонця: вчені вперше побачили невидимі раніше вихори
07 серпня 2026 р. 17:28