Роботы достигли уровня любителя в бесконечной игре в настольный теннис
Введение
В лаборатории всего в часе езды от знаменитого Уимблдона идёт совершенно иной, но не менее знаковый матч — без счёта, без зрителей и без конца. Команда Google DeepMind запустила двух роботов с механическими руками в постоянную игру в настольный теннис. Цель проекта — не развлечение, а развитие искусственного интеллекта, способного обучаться в динамичной среде. В отличие от знаменитого 11-часового матча 2010 года между Джоном Изнером и Николасом Маю, этот поединок не имеет финишной черты. Его цель — постоянное улучшение через игру с самим собой и людьми. Роботы, обученные с помощью метода обучения с подкреплением и дополненной обратной связью от ИИ, достигли того, что исследователи называют «устойчивой любительской игрой человека». Это важная веха на пути к созданию универсальных, адаптивных роботов.
Ключевые детали
- Проект роботов для настольного тенниса был запущен DeepMind в 2022 году с целью поиска масштабируемых методов обучения ИИ.
- Роботы используют обучение с подкреплением и улучшались в ходе игр с людьми разного уровня подготовки.
- В 29 играх с людьми роботы выиграли 45%, включая 55% побед против игроков среднего уровня.
- В систему интегрирована модель Google Gemini, которая анализирует видео и даёт рекомендации, функционируя как ИИ-тренер.
- Роботы пока уступают сильным игрокам, но уверенно обыгрывают новичков и конкурируют с любителями.
- Результаты представлены в научной статье 2024 года на arXiv (arXiv:2408.03906) и описаны в блоге IEEE Spectrum инженером DeepMind Панагом Санкети и профессором ASU Хени Бен Амор.
Контекст
На протяжении десятилетий разработчики роботов сталкиваются с фундаментальной проблемой: как научить машины функционировать в непредсказуемой реальной среде. Такие роботы, как Atlas от Boston Dynamics, могут выполнять впечатляющие акробатические трюки, но их действия заранее запрограммированы и не подходят для динамичных условий. Возросла потребность в роботах, способных учиться автономно, особенно в свете интереса к человеческим помощникам в домах, на заводах и в сфере ухода. Настольный теннис, с его высокой скоростью, вращением мяча и стратегической глубиной, стал идеальной средой для тестирования. Ещё с 1980-х годов робототехники использовали этот спорт для оценки точности движений и восприятия. Подход DeepMind, однако, делает акцент не на освоении отдельных навыков, а на непрерывном обучении через соревнование — методе, близком к тому, как люди улучшаются через многократную практику.
Анализ влияния
Значение роботов DeepMind не в их текущем уровне игры, а в траектории обучения. Противопоставляя роботов друг другу и людям, исследователи моделируют среду, где адаптация необходима.
“Мы оптимистично смотрим на дальнейшие исследования в этом направлении, которые приведут к созданию более способных и адаптивных машин, способных освоить разнообразные навыки для эффективной и безопасной работы в нашей неструктурированной среде”, — пишут Санкети и Бен Амор в IEEE Spectrum. Способность роботов поддерживать длительные розыгрыши и менять тактику — например, чередуя защитные удары и агрессивные — показывает уровень принятия решений, выходящий за рамки предустановленных сценариев. Более того, использование Google Gemini в качестве ИИ-тренера добавляет новый уровень обратной связи: система анализирует видео и предлагает стратегические улучшения, такие как «бить по краю стола» или «выполнять короткие удары близко к сетке». Это напоминает, как спортсмены используют видеоанализ, но с машинной скоростью.
Широкий контекст
Проект вписывается в более широкую стратегию создания универсального ИИ для робототехники, которую часто называют «моментом ChatGPT» для машин. Так же, как языковые модели изменили создание текста, учёные надеются, что ИИ, обученный через физическое взаимодействие, сможет совершить аналогичный прорыв. Это вызов — парадокс Моравека: задачи, простые для человека, например, поймать мяч или завязать шнурки, крайне сложны для роботов. Предыдущие проекты DeepMind, такие как обучение робота завязывать шнурки, и успехи Boston Dynamics в коррекции ошибок в промышленных условиях, свидетельствуют о прогрессе. Однако полная автономия остаётся в отдалённом будущем. Роботы для тенниса, несмотря на успехи, всё ещё уступают в ловкости и понимании контекста даже начинающему игроку. Их среда контролируемая, а реакции ограничены данными обучения.
Перспективы
В перспективе идея бесконечной игры может выйти за пределы спорта. Если роботы смогут бесконечно улучшать навыки через соревнование, тот же принцип можно применить к сложным реальным задачам — перемещению по загруженному дому, помощи в операциях или управлению складом. Для масштабирования потребуются более совершенные датчики, улучшенная интеграция данных и ИИ, способный переносить знания между разными областями. Использование моделей вроде Gemini указывает на гибридное будущее, где роботы учатся не только через практику, но и через текстовые команды и наблюдение. Финансирование и долгосрочные планы Alphabet показывают, что исследование будет развиваться, возможно, став основой для более масштабных инициатив в области ИИ и робототехники.
Заключение
Хотя роботы вряд ли когда-нибудь выиграют чемпионат, их бесконечные розыгрыши символизируют тихую революцию в обучении машин. Через непредсказуемость, соревнование и постоянную обратную связь DeepMind закладывает основу для роботов, которые не просто выполняют задачи, но адаптируются, улучшаются и, в конечном счёте, сотрудничают с человеком. Бесконечная игра в теннис — это не про победу. Это про постоянное улучшение — один удар за раз.