Робототехника долго страдала от узкой специализации: для каждой задачи и каждого типа тела нужна была отдельная модель, обученная на тысячах примеров. Gemini Robotics 2 от Google DeepMind ломает этот шаблон — одна и та же модель управляет гуманоидными роботами, манипуляторами с руками и колёсными платформами.
В демонстрациях робот завязывает узлы, закручивает лампочку, наклоняется, чтобы поднять предмет, и координирует действия с другими роботами при уборке гаража. За планирование и восстановление после сбоев отвечает отдельный модуль — Gemini Robotics ER 2, способный наблюдать за задачей, строить план на несколько минут действий вперёд и корректировать поведение, если что-то пошло не так. Это уже не рефлекторное реагирование на команду, а полноценное многошаговое планирование.
Самая практичная деталь — скорость адаптации. Версия On-Device 2 способна научиться управлять новым, ранее незнакомым двуруким роботом, используя менее 200 примеров. Раньше подобная адаптация требовала тысяч демонстраций. Это разница между «нужен год разработки под каждую новую модель робота» и «нужна пара дней».
Значение этого события выходит за пределы одной лаборатории. Робототехника долго оставалась зоной эффектных, но нишевых демо — робот, который умеет ровно одну вещь ровно в одной обстановке. Универсальный контроллер, переносимый между разными телами почти без переобучения, — это шаг к тому, что роботы начнут появляться там, где раньше их использование было экономически бессмысленным.
Во что углубиться:
- Что такое VLA-модели (vision-language-action) в робототехнике
- Как устроена архитектура embodied reasoning в современных роботах
- Опыт использования Jetson AGX Thor от NVIDIA для автономных систем
