Есть красивая теория: пять лет назад индустрия языковых моделей перестала обучать нейросети с нуля под каждую задачу и перешла на универсальные фундаментальные модели вроде GPT. General Intuition делает похожую ставку — только не на текст, а на тело робота.
Идея компании простая до дерзости: не нужно собирать сотни тысяч часов данных с настоящих роботов, если можно взять миллионы часов видеоигр — с точной информацией о том, какую кнопку геймпада нажал человек и в какой момент. Именно эта связка «действие-время» и рождает то, что CEO Пим де Витте называет пространственно-временной интуицией — базовое понимание того, как вещи двигаются и взаимодействуют. Компания обучила на этих данных модель, а затем дообучила её на восьми минутах настоящих роботических записей. Результат: четвероногий робот заработал в офисе с движущимися людьми и предметами, используя только фронтальную камеру — без единого дополнительного датчика.
Это сработало настолько неожиданно хорошо, что даже сама команда была удивлена. И в этом суть ставки: если несколько минут реальных данных заменяют месяцы дорогостоящих съёмок, то стоимость входа в робототехнику падает на порядок. General Intuition не собирается строить собственных роботов или беспилотные автомобили — компания хочет стать тем самым фундаментом, на который будут опираться другие. Инвесторы, включая Джеффа Безоса, Эрика Шмидта и исследователей из MIT и Google DeepMind, поверили в эту логику настолько, что вложили $320 млн при оценке в $2,3 млрд.
Остаётся вопрос, который проговаривается в кулуарах, но редко звучит в пресс-релизах: если модель одинаково хорошо ведёт себя и в игре, и в реальности, где заканчиваются гражданские применения и начинаются оборонные? Ответа пока нет, но индустрия уже наблюдает за тем, куда смотрит этот фундамент.
Во что углубиться:
- General Intuition и Medal TV: Как игровая платформа для стриминга киберспорта превратилась в фундаментальную модель для роботов
- World models в физическом AI: Чем пространственно-временное моделирование отличается от языковых моделей вроде GPT
- Инвестиции Vinod Khosla в embodied AI: Почему венчурные фонды делают ставку именно на действие, а не на текст