Секрет — у новому методі навчання, який розробили дослідники з Технологічного інституту Джорджії, пише Іnteresting Еngineering.
Читайте также: Зброя не за розміром. У похованні V століття до н. е. знайшли кістки дитини з бойовим мечем
Метод отримав назву «Learn to Teach» («Навчайся, навчаючи»). Він удосконалює популярний підхід «вчитель-учень» у навчанні з підкріпленням — тільки замість того, щоб навчати спочатку одну модель, а потім іншу, обидва «агенти» тренуються одночасно. Результат — контролер робота, який упорається з незнайомим рельєфом, витрачаючи набагато менше обчислювальних ресурсів.
Роботу довелося не лише йти самостійно — дослідники штовхали і тягнули його під час випробувань. Щоразу він змінював ходу, щоб не втратити рівновагу. Проєкт представили на конференції IEEE з робототехніки та автоматизації (ICRA), а самі автори кажуть, що підхід можна адаптувати й для інших роботів та завдань, не лише ходьби.
У класичній схемі «вчитель-учень» спочатку створюють модель-«вчителя», яка має доступ до детальних даних симуляції. Лише коли вчитель повністю натренований, його знання передають моделі-«учню», яка вже керує реальним роботом.
Читайте также: Вперше в історії. Астрономи виявили атмосферу навколо скелястої планети в зоні життя
За словами провідного дослідника Фейянга Ву, у такого підходу є дві серйозні проблеми. По-перше, послідовне навчання забирає забагато часу. По-друге, значна частина інформації, яку встиг зібрати вчитель, просто пропадає марно.
Тренування роботизованих контролерів через симуляцію може вимагати годин обчислень на дорогому графічному обладнанні — а це і час, і чималі гроші. Одночасне навчання обох моделей вирішує обидві проблеми одразу.
Читайте также: Токсичні білки. Вчені виявили в нейронах механізм, який може допомогти у боротьбі з хворобою Альцгеймера
