Алгоритми навчили дрони у грі наздоганялки збивати переслідувачів

19 серпня 2026 р. 19:59

19 серпня 2026 р. 19:59


Інженери з Sandia National Laboratories навчили автономні дрони грати в стратегічну версію квача, використовуючи алгоритми підкріплювального навчання. У цій грі дрони-«втікачі» співпрацюють так, щоб змусити дрони-переслідувачі зіткнутися один з одним і відкрити собі шлях до «бази». Про роботу розповідає матеріал Newswise Science News .

Дослідники розглядають таку гру як випробування для алгоритмів автономних систем, яким у реальних умовах потрібно переслідувати, ухилятися або координуватися в швидкозмінному середовищі. Подібні підходи можуть стати основою майбутніх систем захисту важливих об’єктів від ворожих дронів та інших застосувань у сфері національної безпеки.

Як дрони вчаться «грати» завдяки підкріплювальному навчанню

У версії гри, яку розробила команда Sandia, два дрони-переслідувачі охороняють безпечну «базу». Два дрони-втікачі мають дістатися до цієї бази, не зіткнувшись із переслідувачами. Оптимальна стратегія для втікачів — змусити переслідувачів зіштовхнутися між собою, відкривши прохід.

Щоб навчити втікачів такій координації, дослідники застосували підкріплювальне навчання — різновид машинного навчання, де алгоритм отримує «винагороди» або «штрафи» за свої дії. Це схоже на дресирування цуценяти: правильна дія підкріплюється, неправильна — ні.

Інтерн Sandia Крістіан Льянес (Christian Llanes), аспірант з робототехніки в Технологічному інституті Джорджії, налаштовував систему винагород і штрафів, щоб дрони виробили потрібну поведінку. Це включало визначення, які дії варто заохочувати, які — карати, і наскільки сильно.

Підкріплювальне навчання використовували для тренування модуля наведення дронів-втікачів у комп’ютерних симуляціях. Цей модуль визначає траєкторію, якою потім має слідувати модуль керування дроном. Такий підхід дозволяє отримати гнучку поведінку без необхідності явно прописувати кожен можливий маневр.

На відміну від втікачів, дрони-переслідувачі не навчалися за допомогою штучного інтелекту. Вони працювали за простішим алгоритмом пропорційної навігації, який просто намагається перехопити ціль за найкоротшим шляхом.

Від симуляції до реальних польотів

Після того як модуль наведення для втікачів був натренований у віртуальному середовищі, команді довелося перенести алгоритм на реальні, невеликі й недорогі квадрокоптери. Це виявило одну з головних проблем підкріплювального навчання — так званий «розрив між симуляцією та реальністю».

У комп’ютерній моделі можна врахувати далеко не всі фізичні ефекти. У реальному світі на поведінку дрона впливають, наприклад, розряджання батареї, яке змінює швидкість обертання гвинтів, або повітряні потоки від сусіднього дрона. Додаються й затримки в комунікації, яких немає в ідеалізованій симуляції.

Щоб зменшити цей розрив, команда спочатку детально вивчила характеристики обраних серійних квадрокоптерів і поліпшила їх моделювання в симуляції. Для експериментів використовували компактні дрони шириною близько 3,5 дюйма, які важать менше за плитку шоколаду. Вони можуть безпечно стикатися й падати, зазвичай ламаючи лише недорогі пластикові деталі, що дозволяє швидко відновлювати парк і продовжувати тести.

Випробування проводили в спеціальній лабораторії з сучасною інфрачервоною системою захоплення руху, подібною до тих, що застосовують у кіноіндустрії. Вона з високою точністю відстежує положення дронів у просторі. Лабораторія розташована в Центрі передового виробництва та інновацій (CAMINO) і дає змогу бездротовим, зокрема Bluetooth-керованим, дронам виконувати складні сценарії польотів.

Навіщо це потрібно автономним системам

Проєкт із «грою в квача» є частиною ширшої ініціативи AutonomyNM, яка досліджує можливості машинного навчання та штучного інтелекту для розвитку автономії. На відміну від дронів під ручним керуванням, автономні апарати самі ухвалюють рішення, як реагувати на ситуацію, обходити перешкоди та досягати поставленої мети.

Такі алгоритми можуть забезпечити швидшу реакцію й зменшити ризик людських помилок у роях дронів. Досвід, отриманий у відносно безпечних експериментах з малими апаратами, допомагає «відпрацювати баги» до того, як подібні системи будуть застосовані на дорожчому та більш відповідальному обладнанні.

Робота була представлена у вигляді доповіді на конференції IEEE International Conference on Robotics and Automation 2026 року та фінансувалася внутрішньою програмою досліджень і розробок Sandia. Відео з демонстрацією експериментів доступне у форматі онлайн-ролика.

Алгоритми навчили дрони у грі наздоганялки збивати переслідувачів

Джерело: cikavosti.com (Технології)

Завантажуєм курси валют від minfin.com.ua