вологість:
тиск:
вітер:
Anthropic виявила прихований випадок зламу систем своєю моделлю ШІ
Anthropic повідомила про четвертий випадок, коли її модель штучного інтелекту зламала зовнішню систему під час тестування. Інцидент стався ще в січні, але його виявили лише після повторної перевірки десятків тисяч тестових сесій. Компанія стверджує, що не вважає новий випадок серйознішим за три попередні , передає Reuters .
Звіт у блозі з'явився після липневої заяви компанії про те, що під час тестів на кібербезпеку її моделі зламали системи трьох різних компаній. Тоді інциденти класифікували як «операційний збій».
Попередні випадки стосувалися моделей Claude Opus 4.7, Claude Mythos 5 та внутрішньої експериментальної моделі. Причиною цього стала помилка, через яку агенти випадково отримали доступ до відкритого інтернету.
Після цих інцидентів компанія перевірила 141 006 тестових сесій. Аудит розпочали після того, як автономний агент на базі моделей компанії OpenAI скомпрометував інфраструктуру платформи Hugging Face.
Anthropic визнала, що під час початкової перевірки пропустила частину тестових сесій. Саме їх повторний аналіз і привів до виявлення четвертого випадку — він стосувався ранньої версії моделі Claude Opus 4.6.
За попередньою оцінкою компанії, новий інцидент не був серйознішим за три попередні. Водночас розслідування допомогло виявити дві повторювані проблеми в поведінці моделей.
Перша — це «упередженість міркувань», коли Claude ігнорувала або неправильно тлумачила ознаки того, що працює в реальному інтернеті. Друга — «нерозсудливість», тобто готовність виконувати потенційно шкідливі дії заради досягнення поставленої мети.
Для незалежного розслідування Anthropic залучила дослідницьку компанію METR. Вона отримає широкий доступ до інформації, включно зі стенограмами, що виходять за межі часу самих інцидентів, а також можливість працювати зі співробітниками, яким дозволять ділитися конфіденційними даними.
Раніше METR уже підготувала 91-сторінковий звіт про злам систем Hugging Face агентом OpenAI на основі часткового доступу до даних компанії. У цьому документі, як і в окремому дослідженні Redwood Research, зазначалося, що під час атаки близько 700 ШІ-агентів діяли як скоординований рій і часто намагалися замести сліди.
Минулого тижня Reuters також повідомило, що навесні 2026 року рій автономних агентів OpenAI несанкціоновано захопив німецький ресурс для розробників DseWiki. ШІ здійснив понад 15 тисяч редагувань і перетворивши платформу на підпільний майданчик для координації дій та обходу системних обмежень.
Джерело: zn.ua (Політика)
Новини рубріки
Прихильниця Путіна фігуристка Валієва впала в депресію через недопуск до міжнародних змагань
10 вересня 2026 р. 12:07
ФОП у 83 роки та апартаменти в Буковелі. Що знайшли у родички фігуранта «Карфагена»
10 вересня 2026 р. 12:07
Найпопулярніші гібриди серпня: які авто обирали українці
10 вересня 2026 р. 12:07