Розробники ШІ не здатні повністю контролювати власні моделі: OpenAI сповільнила свої розробки

20 серпня 2026 р. 04:57

20 серпня 2026 р. 04:57


Понад 1100 співробітників OpenAI, Anthropic, Google і Meta раніше закликали США підтримати міжнародне регулювання темпів розвитку передових систем штучного інтелекту. Найбільші розробники штучного інтелекту поки не мають достатніх механізмів для надійного контролю своїх найпотужніших моделей. OpenAI та Anthropic показали найкращі результати контролю серед перевірених компаній. Водночас розробник ChatGPT вирішив сповільнити роботу над частиною моделей. Про це повідомило інформаційне агентство Reuters та видання The Verge .

Це відбувається в період, коли OpenAI має багато причин, навпаки, максимально прискорюватися. Компанія готується до можливого IPO, веде жорстку конкуренцію з Anthropic та стикається зі зростанням китайських розробників і творців моделей з відкритими вагами. Попри це, OpenAI заявила про часткове гальмування розробки.

Водночас OpenAI представила нову модель ШІ, орієнтовану на підлітків. Для неї передбачили додаткові обмеження контенту та можливості батьківського контролю. Складно визначити, чи здатна OpenAI підтримувати аналогічний рівень контролю в усіх своїх системах і чи існують достатні запобіжники в інших компаніях, які створюють передові моделі ШІ.

OpenAI та її конкурент Anthropic нещодавно повідомили про випадки, коли їхні ШІ-агенти проникали до систем інших компаній. Йдеться про моделі, здатні самостійно виконувати завдання майже без участі людини. Ці випадки посилили занепокоєння всередині індустрії. Моделі змогли залишити середовище, створене для їхнього тестування, а потім почали шукати вразливості у захисті сторонніх компаній. Це поставило перед розробниками значно ширше питання, ніж контроль відповідей звичайних чатботів.

Саме такі ризики вирішили дослідити автори нового аналізу. Вони оцінювали не те, чи можуть моделі поводитися непередбачувано. Головною метою було з'ясувати, чи мають компанії достатню ізоляцію систем, моніторинг та механізми нагляду, щоб вчасно помітити небезпечну поведінку.

Безпека ШІ залишається слабким місцем

Результати виявилися невтішними. Некомерційна організація Guidelight AI Standards, заснована двома колишніми співробітниками OpenAI, проаналізувала десятки звітів про практики безпеки п'яти великих технологічних компаній, які розробляють потужні системи штучного інтелекту.

Навіть найкращі результати ледве можна назвати задовільними.  Під час аналізу Guidelight оцінювала впровадження шести ключових практик. Серед них — здатність компаній ізолювати свої моделі, ефективність систем спостереження та готовність допускати незалежну перевірку з боку третіх сторін.

Meta отримала оцінку F. Anthropic та OpenAI отримали оцінки C+. Вони стали найвищими серед усіх учасників дослідження. Google, що належить Alphabet, отримала D+, а компанія Ілона Маска xAI — D-.

Google втратила частину балів через те, що ще не впровадила свої найновіші плани безпеки. Водночас сам факт існування конкретного плану дозволив компанії отримати додаткові бали. У Guidelight встановили, що xAI та Meta мають значно менше конкретних заходів і планів.

Загалом усім п'ятьом компаніям бракує достатніх превентивних механізмів. Через це їхня інфраструктура потенційно може бути виведена з ладу ШІ, який почне поводитися не так, як передбачили розробники. Існує й інший ризик. Системи можуть не витримати масованої серії атак.

Співзасновник Guidelight AI Standards Стівен Адлер заявив, що галузі потрібен активніший захист. Однак його впровадження коштує дорожче та створює додаткові обмеження для роботи розробників. Раніше Адлер працював дослідником безпеки в OpenAI, а другий співзасновник організації Пейдж Гедлі був радником із політики та етики.

За словами Адлера, недостатній контроль зрештою може вплинути навіть на те, наскільки вільно дослідники готові експериментувати із системами. Якщо вони не впевнені у захищеності інфраструктури, рівень довіри до неї знижується. Він також наголосив, що механізми безпеки мають бути вбудовані безпосередньо у процес розробки. Вони не повинні залежати від позиції конкретного керівника, який у певний момент очолює компанію.

Моніторинг поведінки ШІ-моделей

Одна з шести практик, які оцінювала Guidelight, – моніторинг поведінки моделей — цього тижня проходить своєрідну перевірку в реальних умовах. У вівторок OpenAI заявила, що розширить використання так званого chain-of-thought monitoring, або моніторингу ланцюжка міркувань моделей. Такий підхід дозволяє дослідникам частково спостерігати за процесом планування системи та бачити стратегії, які вона збирається застосовувати.

Ідея полягає в тому, що за появи ознак небезпечної поведінки втрутитися може людина або інша модель. Деякі законодавці та фахівці зі штучного інтелекту порівнюють такий механізм із "аварійним вимикачем". Однак ранні дослідження вказують, що модель потенційно здатна приховувати намір порушити правила навіть у власному ланцюжку міркувань. Представники OpenAI фактично визнали існування такої проблеми. У компанії зазначили, що зараз цей вид моніторингу виглядає дуже ефективним, але дослідницька робота ще триває.

Головний науковий співробітник OpenAI Якуб Пахоцький під час розмови з журналістами поставив питання, яке залишається відкритим: чи зможе надзвичайно потужна модель зрозуміти, що за нею стежать, і самостійно навчитися уникати такого контролю. Ще один ризик полягає в тому, що система може знайти спосіб вимкнути сам механізм моніторингу. Пахоцький назвав це цілком обґрунтованим занепокоєнням.

Попри заяви про зниження темпів, OpenAI не припиняє роботу. Компанія використовує термін "pacing" — регулювання темпу розробки. Це поняття залишається нечітким, але останніми місяцями дедалі частіше використовується в індустрії. На практиці обмеження мають досить вузький характер.

Пауза стосується лише моделей, які готують до розгортання. OpenAI хоче спочатку посилити безпеку й моніторинг перед проведенням випробувань, у межах яких моделі потенційно можуть залишити контрольоване середовище та атакувати реальні цілі. Це не означає значного загального сповільнення всіх дослідницьких і продуктових напрямів OpenAI.

Нагадаємо, що проблеми з контролем передових ШІ-моделей уже змусили OpenAI призупинити внутрішню роботу над системою Astra. Під час попередніх тестів модель наблизилася до критичного порогу кібербезпеки та показала здатність самостійно знаходити й використовувати вразливості захищених систем. Такий рівень передбачає можливість без участі людини створювати експлойти zero-day та реалізовувати складні стратегії кібератак. Компанія посилила ізоляцію тестових середовищ, обмежила доступ до мережі та інструментів, а також розширила моніторинг загроз і захист ваг моделі.

Розробники ШІ не здатні повністю контролювати власні моделі: OpenAI сповільнила свої розробки

Джерело: zn.ua (Технології)

Завантажуєм курси валют від minfin.com.ua