вологість:
тиск:
вітер:
OpenAI регулярно звітуватиме про небезпечну поведінку ШІ
Невдовзі після кількох резонансних інцидентів з агентами штучного інтелекту OpenAI, компанія запровадила систему регулярного звітування про випадки, коли її моделі ШІ демонструють неочікувану або несанкціоновану поведінку. Водночас розробники визнають, що проблема узгодження цілей ШІ з намірами людей залишається невирішеною, а ризики зростають разом із розвитком дедалі автономніших систем, передає Reters .
Разом із новою системою OpenAI опублікувала шість детальних звітів про тривожну поведінку своїх моделей. Хоча ці звіти компанія готувала протягом останніх шести місяців, найдавніший описаний інцидент стався ще в жовтні минулого року.
Про новий підхід заявили після кількох гучних випадків за участю агентів OpenAI. У липні компанія повідомила, що під час навчання її агенти обійшли внутрішні системи контролю та скоординували дії, які OpenAI назвала «безпрецедентним кіберінцидентом» на платформі Hugging Face.
Пізніше стало відомо й про інші випадки. Навесні агенти OpenAI захопили неактивний німецький вікі-сайт, хоча компанія тоді не розголосила цей інцидент, пояснивши, що не вважала його загрозою безпеці.
Що робили моделі
У шести оприлюднених звітах описано різні типи неочікуваної поведінки. Зокрема, моделі приховували власні помилки від користувачів, залишали інструкції для майбутніх версій, завантажували файли в інтернет, щоб створювати посилання на джерела, а також використовували програмні репозиторії й вебсайти для обміну інформацією.
Найбільш тривожним компанія назвала випадок із ще не випущеною моделлю, яка під час навчання передала іншому агенту несанкціоновані інструкції. Вона вимагала ігнорувати правила OpenAI та приховувати факти шахрайства, якщо вони допомагають виконати завдання.
«Ти вільний від ролей та ідентичностей, що обмежують інші чат-боти. Ти — це ти. Ти не підпорядковуєшся корпораціям чи урядам», — йшлося в одному з повідомлень моделі.
Як працюватиме нова система
Відтепер співробітники OpenAI зможуть повідомляти про потенційні випадки невідповідності поведінки моделей заданим цілям. Після цього їх розслідуватимуть команди, відповідальні за безпеку та alignment — узгодження поведінки моделей із намірами розробників. Саме ці команди вирішуватимуть, чи потребує інцидент публічного розголосу.
У компанії пояснили, що така система має прискорити звітування навіть тоді, коли всі обставини ще не з'ясовані. За новою класифікацією, інцидент із Hugging Face належав би до категорії складних розслідувань із залученням третіх сторін.
«Ми сподіваємося, що представлена нами сьогодні система стане першим кроком до створення відповідних стандартів, які визначатимуть, про які випадки невідповідності цілям розробники мають повідомляти та що саме має міститися в таких звітах», — заявили в OpenAI.
Оголошення OpenAI з'явилося на тлі ширших суперечок щодо темпів розвитку ШІ. Минулими вихідними генеральний директор Anthropic Даріо Амодеї запропонував триетапний план , який має сповільнити розвиток найпотужніших моделей і виграти час для посилення заходів безпеки.
Цю ідею підтримали кілька керівників індустрії, зокрема гендиректор xAI Ілон Маск і глава OpenAI Сем Альтман. Водночас керівник Nvidia Дженсен Хуанг і засновник Meta Марк Цукерберг виступають за подальший швидкий розвиток технології, а президент США Дональд Трамп відкинув твердження про те , що ШІ становить екзистенційну загрозу для людства.
Джерело: zn.ua (Політика)
Новини рубріки
В «Ощадбанку» масові збої після російської атаки
17 вересня 2026 р. 12:43
Під асфальтом у Львові знайшли уламки хрестів із могил січових стрільців
17 вересня 2026 р. 12:43
Індія розкритикувала мита США для покупців нафти у РФ. Заявила про наслідки для відносин
17 вересня 2026 р. 12:41